{"as_of":"2026-08-18T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5587792ea6803ca9f624f11455dade52bcda42dc50bdea9af492fa91496e0b1e","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:18:01.484321Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:16:58.221358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:51:20.335706Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"cited_work":{"arxiv_id":"2504.16020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alphagrad: Non-linear gradient normaliza- tion optimizer","venue":null,"work_id":"776d7209-efd8-466f-83c2-98630346d348","year":2025},"citing_paper":{"arxiv_id":"2604.12968","last_updated":"2026-04-14T17:01:36Z","snapshot_observed_at":"2026-08-13T03:34:38.365145Z","submitted_at":"2026-04-14T17:01:36Z","title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:58.221358Z"},"links":{"cited_paper":"/paper/2504.16020","citing_paper":"/paper/2604.12968"},"observation_digest":"sha256:e05fea4fd4dc63f7d85b84cef14f898427dbfb3199c73ae5caad2c3929b1ca36","observation_id":"cd69f85d-8f87-465c-b112-f26a6ae7068f","resolution":{"observed_at":"2026-05-11T10:51:20.376166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16020/citation-record","integrity":"/paper/2504.16020/integrity","json":"/paper/2504.16020/citation-record.json","paper":"/paper/2504.16020"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-16T11:18:01.192380Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.192380Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:8f5baf242512388ede0b3088bd7f6329945fda4bb9b81b41b74d6d130c1b236e","observation_id":"fdcf8736-834a-40ce-87ec-b7aa8f592c36","resolution":{"observed_at":"2026-08-16T11:18:01.192380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T11:18:01.197775Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.197775Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:68a690e298bf565bd31d96d4b463cb745b189e46a78fe3519a226dfec0bf6a76","observation_id":"c32a567b-d648-491d-813f-f666ce7592e0","resolution":{"observed_at":"2026-08-16T11:18:01.197775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.388305Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"2e5462cb-c472-4a77-8fd3-ca8f2bbe73ef","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.202353Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:239345c50f5a0f65cebe13f2f525a9f00404dd1f4b997ab4d5ddf1f556e12432","observation_id":"df8681bb-cf01-4d5e-841a-fd23a31b71cc","resolution":{"observed_at":"2026-08-16T11:18:02.392735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T11:18:01.207128Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.207128Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:0456413368ac51af534e4b8d1078a5ac49a35e401ba628695f5542d2dee97453","observation_id":"864628e3-ec9f-4f8a-b404-62fcce5d302c","resolution":{"observed_at":"2026-08-16T11:18:01.207128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-16T11:18:01.212175Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.212175Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6d17b1ed51cbbfeb82866da7712a9cbe641ebd8800ab46e40de7e2fea8dc0a7f","observation_id":"b9af3f5e-22ba-4e4d-afd8-44cd4c145b01","resolution":{"observed_at":"2026-08-16T11:18:01.212175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08292","last_updated":"2018-05-22T00:10:53Z","snapshot_observed_at":"2026-08-14T20:58:45.586325Z","submitted_at":"2017-05-23T14:11:34Z","title":"The Marginal Value of Adaptive Gradient Methods in Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08292","snapshot_observed_at":"2026-08-16T11:18:01.217918Z","title":"C., Roelofs, R., Stern, M., Srebro, N., and Recht, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.217918Z"},"links":{"cited_paper":"/paper/1705.08292","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:363788b8f98ee5b732bd9de0c12da6212cae2768911ddfca93ed5033ba9e7ca0","observation_id":"59a15f8f-7661-4e11-be65-a15f602d715f","resolution":{"observed_at":"2026-08-16T11:18:01.217918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.374303Z","title":null,"venue":null,"work_id":"834fdbe4-280a-46ef-a333-1dbeab28652c","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.223815Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:3d134e50a715204f51be3a8cb4e17ba0cce735774b7fa3d78124bd38d2b7482b","observation_id":"2116e4c4-73ba-498f-812e-f62bac900004","resolution":{"observed_at":"2026-08-16T11:18:02.378742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-16T11:18:01.229883Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.229883Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a64bcd4130bf740f8208bfc4227756e7182798cb3d4ad6f9ff06a95a92f4bc3b","observation_id":"3c9929a5-936b-4ef6-9c0e-968db3c26adc","resolution":{"observed_at":"2026-08-16T11:18:01.229883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-16T03:15:11.732149Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-16T11:18:01.234957Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.234957Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:45af6da9482eeedcd940af5305a281df5c5c468c8f2837652f48174fcd48420d","observation_id":"d4e93ed4-6877-48e9-a736-d9e2e4e5aeca","resolution":{"observed_at":"2026-08-16T11:18:01.234957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04434","last_updated":"2018-08-07T18:55:19Z","snapshot_observed_at":"2026-08-14T19:46:33.101156Z","submitted_at":"2018-02-13T02:14:35Z","title":"signSGD: Compressed Optimisation for Non-Convex Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04434","snapshot_observed_at":"2026-08-16T11:18:01.240035Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.240035Z"},"links":{"cited_paper":"/paper/1802.04434","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:db0b722435b679dff0fcbdd28f7bb16f2c383d0dc074ab5adb8089a18217f844","observation_id":"ea8a4d8a-26da-456a-812b-c8ab152c5af3","resolution":{"observed_at":"2026-08-16T11:18:01.240035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-08-17T01:05:22.671331Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-16T11:18:01.244858Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.244858Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:f584a56f1b9637814d9530d1d4a57b1260ee0ec4da358c90d412c8d63003d0da","observation_id":"b5a27ab1-e55a-404e-8139-af6f2ffdc3aa","resolution":{"observed_at":"2026-08-16T11:18:01.244858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:18:01.249735Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.249735Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:fb0593fb6e523905639c009abbfe763143c8279fb70f9361eae309832392e296","observation_id":"dfe05031-dd73-452c-8ca0-2fe51ac607da","resolution":{"observed_at":"2026-08-16T11:18:01.249735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.359786Z","title":null,"venue":null,"work_id":"32191f7e-ec79-4392-a8f4-19af73719e56","year":1997},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.254337Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a761b43e073bf579163409bf5bf9d50a5f024bb2187387b071a8ae28ee123642","observation_id":"89a86ce0-f75b-4aa9-8e0c-98b1cd0b5762","resolution":{"observed_at":"2026-08-16T11:18:02.364202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.345261Z","title":"(2018).High-Dimensional Probability: An Introduction with Applications in Data Science","venue":null,"work_id":"67af25c9-65ba-4df1-b657-4c6f63c58c08","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.259277Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a11cbe7902dc8ffc8c93914f76a885d40e6dd2ebf8be6cc2f81a7565615a8228","observation_id":"1a387490-6bea-4477-a19c-e9b954d4a9f4","resolution":{"observed_at":"2026-08-16T11:18:02.350048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.263858Z","title":"(2016).Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.263858Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a074c5edaa38989c8085ffdc43fd53e2d81fafda58bd5ee3121742d1449cc806","observation_id":"5a21bcd8-ec90-4547-894e-fb0a07929cd3","resolution":{"observed_at":"2026-08-16T11:18:01.263858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.322156Z","title":"(2004).Introductory Lectures on Convex Optimization: A Basic Course","venue":null,"work_id":"f56bddcf-0f0c-4e83-9fd5-001d27c03e76","year":2004},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.268355Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:2678d4b914f47dcd2487439dd76cbdc48ece197ea8cdc98856b0c6fb0c3df040","observation_id":"b702c0a7-9827-4788-b0bc-c5044632c2ed","resolution":{"observed_at":"2026-08-16T11:18:02.326777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.308212Z","title":null,"venue":null,"work_id":"9cebe34c-084f-482f-8045-4878d110b0bb","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.272817Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:f44dc74df530cdab3a8ddd1433607cc56b5c0a0a164276ea41a5f621aabdd612","observation_id":"7881c160-0733-4395-b9f4-ecb982106294","resolution":{"observed_at":"2026-08-16T11:18:02.312476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.293980Z","title":null,"venue":null,"work_id":"07d16ec7-70e4-4d8d-ae03-1fc8f5fe77b5","year":1963},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.277507Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:6425855be99f1ceee68c2899d58f194d992d4c767285015ecfd3d1b8d6f75bb5","observation_id":"7df63c61-200f-4d29-bda3-be91c12f7e44","resolution":{"observed_at":"2026-08-16T11:18:02.298588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.279960Z","title":null,"venue":null,"work_id":"33205b23-52f7-4787-a9aa-9d1872e611bf","year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.281956Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:2e3946235c4db0ac115a36c36d6db3361f89a97ff8c389d2ccb7374e7d3e914e","observation_id":"54cb98e1-ec24-4fb3-a671-60f128e2054b","resolution":{"observed_at":"2026-08-16T11:18:02.284253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.265646Z","title":null,"venue":null,"work_id":"5e31a6f1-68ff-4608-88b9-0b75fd7aad25","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.286429Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5e91afb02d0d9eb40d68a357c59388f36a09454a304aa832cd2d5351bbded3d9","observation_id":"2b02adda-a284-4d7e-93ed-5ec32c1f3f8d","resolution":{"observed_at":"2026-08-16T11:18:02.270207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.251789Z","title":"and Lan, G","venue":null,"work_id":"44c6e778-72bc-4c41-a407-d973902963dd","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.291060Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:3c71b8fb68694457c5e5c7b524c26f020382c7b8dc144f09df16969bf9e60d64","observation_id":"00a2ecde-7d5f-42e3-8d87-a39bc5f1789a","resolution":{"observed_at":"2026-08-16T11:18:02.256181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-14T16:43:55.734754Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-16T11:18:01.295605Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.295605Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e95329170e97521d3dbe480f9f8c49e915d32510daf6beb8e8f648aa9156095d","observation_id":"27714245-442f-446d-9718-7bf59209d292","resolution":{"observed_at":"2026-08-16T11:18:01.295605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.236887Z","title":"E., and Nocedal, J","venue":null,"work_id":"481c266b-b597-4e4c-93f0-4b024642343c","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.300327Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:fb8490bb1c9aadfca255dec6efc1791a277f66204e02e4f86f76b239bff69a2e","observation_id":"8a6cedfd-0751-4456-812b-730ddbbd2c55","resolution":{"observed_at":"2026-08-16T11:18:02.242222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.223080Z","title":"and Keshet, J","venue":null,"work_id":"11ccb60b-4267-4539-a8ff-900392bac678","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.304598Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a29884fe636d912837728f6da6bee401d9614a83e755b0f05a6b8320b9e7c3a9","observation_id":"2999a6ae-7825-448d-a58f-47e578c1e157","resolution":{"observed_at":"2026-08-16T11:18:02.227548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.208758Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":"efd3e756-1d48-4c5e-b2a3-f09965344905","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.309386Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:67e99f2bfcdfcde20c3e7c4a5123993dfd1b03f7733717715061521ff9f9e6b9","observation_id":"383e3cd5-f801-4fe6-a19f-43a319a6c00f","resolution":{"observed_at":"2026-08-16T11:18:02.213421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.194779Z","title":"and Hinton, G","venue":null,"work_id":"9da9021e-b738-439b-bd23-85db9597f30e","year":2012},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.314013Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:b46271702baaa0f8f60fa2206c2101ee0939fbf790ff1b2b3d792f4a486667e7","observation_id":"1a08e5a3-10dc-4b43-b7e5-9a9e70a252b3","resolution":{"observed_at":"2026-08-16T11:18:02.199297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.180873Z","title":null,"venue":null,"work_id":"328ad2f1-2583-402c-b971-137812062678","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.318636Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:f56043b7fbb7354aea5971cebfc5b669c217865eb7732952b77cdac4de09de08","observation_id":"4d016d55-7824-42bf-a8f7-dfd6d680ae68","resolution":{"observed_at":"2026-08-16T11:18:02.185139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.166766Z","title":null,"venue":null,"work_id":"5b7977df-5b44-4fdd-96cf-b935ebc33339","year":2001},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.323989Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:473642fc1e8926c58039eafac43b0b41a05eee9e29175cbded71cc450f5fddb1","observation_id":"a4a7b033-5bd5-496e-a7be-8b2e34b6b99d","resolution":{"observed_at":"2026-08-16T11:18:02.171265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.152840Z","title":null,"venue":null,"work_id":"4f324480-02f7-4ec2-aa0b-88117e00051c","year":2022},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.328864Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:49105e13e5d66349b93b271f0b2a69c12a6dea14b82c6dae6ab86585b867ef92","observation_id":"b8a62a3e-f58c-4485-912e-802970f4af48","resolution":{"observed_at":"2026-08-16T11:18:02.157360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.139283Z","title":null,"venue":null,"work_id":"80f6283d-13cc-4fcb-8bad-0beb4016ad20","year":2012},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.333553Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:4bc631ff3795a9125a97d8bc249ea5c3b23b3c74e70734eb44dbb6baa5114ac8","observation_id":"70ab40f6-8b7f-41a2-94b8-7d57c263f512","resolution":{"observed_at":"2026-08-16T11:18:02.143700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.125277Z","title":null,"venue":null,"work_id":"9c68e931-f43d-4a4b-a549-b6e2020f8ec8","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.338200Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:548ae32ebee8423326fd207689979149fa6abb557eb8fbcaf48280f9e4bf99e2","observation_id":"becd3253-59c5-4dc6-adb7-d04ed6470ea2","resolution":{"observed_at":"2026-08-16T11:18:02.129772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.111156Z","title":null,"venue":null,"work_id":"f9ce1110-78ae-4935-906c-c80cd86ed8bb","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.342654Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c0e0a9c90405fa2e33f08415c248ea9ac92758ea09d1951f1765816266b35fa9","observation_id":"1cd5768d-2cf3-429d-8262-5202cbf61822","resolution":{"observed_at":"2026-08-16T11:18:02.115533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.096535Z","title":null,"venue":null,"work_id":"62f8ebe0-5d36-49a2-973f-83b9bd7a4157","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.348236Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:0d3c07868951f478af66cdb073ee48c229ce2c1a34fadd74f74acfacfef09552","observation_id":"aeb06ff0-ef64-4fda-8ae2-4060c9d1553e","resolution":{"observed_at":"2026-08-16T11:18:02.101135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.082450Z","title":"S., Davis, A., Dean, J., Devin, M., et al","venue":null,"work_id":"709c3ae0-3db1-4dc7-ab50-c700958cf1d1","year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.352881Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:bfd1880cf611a2d05c5ad1cab5495f5e1b117546b37440b333238fd87e959fc0","observation_id":"4ffbbde6-a392-4ee3-9a95-3d855f23b30a","resolution":{"observed_at":"2026-08-16T11:18:02.086890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.068300Z","title":"A., and Peters, J","venue":null,"work_id":"e16929c1-77e1-4a4b-81a3-11402483dff6","year":2013},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.357278Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:b2ed84efc266eecb4cb67d6c489ad54a6cfd8c7a32197d87f4ea89acef24ea9b","observation_id":"8854dce0-c0ef-4df1-894d-4c2b7cf8a46d","resolution":{"observed_at":"2026-08-16T11:18:02.072872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.054158Z","title":"I., Kemker, R., Part, J","venue":null,"work_id":"43e6d527-f62a-48b2-b708-712e842a6ac1","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.362145Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:e630e9ba30b0595ef004500a1db93e27d62780f2e4eae04cc21fdd41e49d99c0","observation_id":"0a9e3969-ac9d-4771-b745-e7f2a22b41ba","resolution":{"observed_at":"2026-08-16T11:18:02.058722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05393","last_updated":"2018-07-10T16:09:39Z","snapshot_observed_at":"2026-08-18T04:16:38.097224Z","submitted_at":"2018-06-14T07:04:15Z","title":"Dynamical Isometry and a Mean Field Theory of CNNs: How to Train 10,000-Layer Vanilla Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05393","snapshot_observed_at":"2026-08-16T11:18:01.366994Z","title":"S., and Pennington, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.366994Z"},"links":{"cited_paper":"/paper/1806.05393","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:dac96e3bdfc54c585ae8f35a9f284f345f1f00229b30a3773a5f4736f9d62b43","observation_id":"96be1891-8836-4e0f-85f3-478587f87be4","resolution":{"observed_at":"2026-08-16T11:18:01.366994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.039945Z","title":null,"venue":null,"work_id":"8de1f462-9c6e-430c-a325-4791c8b83db2","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.371700Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:a80711ab8a219647d6cb862e17e980a89095aa4772d13574a85de056930d93a2","observation_id":"30e46975-d771-4ff1-8717-96d61b19ca25","resolution":{"observed_at":"2026-08-16T11:18:02.044363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.026044Z","title":"and Hutter, F","venue":null,"work_id":"394add10-45e1-4bb2-a2e1-3233c241b418","year":2017},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.376031Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:8a5a4ef9c09daa6fd9abf4c1ec51f646e3b5929f1d9d5e42d34732be8806c0e3","observation_id":"09458751-0902-448f-bd28-340330a6bd42","resolution":{"observed_at":"2026-08-16T11:18:02.030429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:02.010436Z","title":"J., Fu, P., Saparov, A., Choudhury, S., Huang, W., Hurtado, J., Khailany, B., Lien, H.-H","venue":null,"work_id":"010eb988-9cfa-4261-af5f-8b32e09cec6f","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.380537Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:58e2d1547313b2d6d15c2b1aba48573bcbfd22ecb708a351ecc8a0bc7356c312","observation_id":"90221d8b-d0b6-4691-a795-15e654911064","resolution":{"observed_at":"2026-08-16T11:18:02.015412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02551","last_updated":"2015-02-09T16:37:29Z","snapshot_observed_at":"2026-08-14T23:00:47.962201Z","submitted_at":"2015-02-09T16:37:29Z","title":"Deep Learning with Limited Numerical Precision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02551","snapshot_observed_at":"2026-08-16T11:18:01.385699Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.385699Z"},"links":{"cited_paper":"/paper/1502.02551","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:84e174b28e4d5cc4923ffd2267182d86ba5b3adff436447ab96d86ca6cae3a04","observation_id":"37028641-d1fa-4dc1-b3a8-e5d0306ffcae","resolution":{"observed_at":"2026-08-16T11:18:01.385699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.995780Z","title":null,"venue":null,"work_id":"472cf463-eb45-4b5e-89c3-50b5e8733c50","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.390517Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:fb2d6dba7eb2c8d1723f70d373088b1ae79fc7fb20f21b4ca332386bf32d3b2e","observation_id":"eec2c4e2-72e3-4f30-9e07-83186d30731d","resolution":{"observed_at":"2026-08-16T11:18:02.000403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:18:01.395281Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.395281Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:be16c281aef3c863fb77d38ff47b81d7b5e4583575a185a86072f145f5d28cd7","observation_id":"a06d0522-c458-45c1-b760-e75944f896ee","resolution":{"observed_at":"2026-08-16T11:18:01.395281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.981461Z","title":null,"venue":null,"work_id":"ff2b8adf-727a-4311-82ca-b40f61087df4","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.400260Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:de57c72126b147d0339c73a60cbfa6c116a7400bb1696fa989b4ac79660e8678","observation_id":"567df801-2cab-409d-a076-d10c7e22814c","resolution":{"observed_at":"2026-08-16T11:18:01.986209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.967234Z","title":null,"venue":null,"work_id":"2e1d2b46-a907-432b-806f-d4a0b2693c0c","year":1998},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.406351Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:d551f2085635a598388724f1b87e12a43320d124bb3ff74b2e312d533ab20d11","observation_id":"3d57606f-7823-4446-ae7a-61bbcbc8c431","resolution":{"observed_at":"2026-08-16T11:18:01.971908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.953130Z","title":null,"venue":null,"work_id":"8c04a8ed-17ed-4161-9a3e-4d37b2ca591f","year":2009},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.412028Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c9faaf4fbf564f77730e79bfa261545a6ee33341b099b62efb8aa45e917d95fb","observation_id":"0ce88c0a-4458-4604-999f-e324083952ee","resolution":{"observed_at":"2026-08-16T11:18:01.957405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.938751Z","title":null,"venue":null,"work_id":"995346c6-b54a-4186-aaaf-debdaf2bc1f5","year":2009},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.416393Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:812d4a0e0bef113598ed2488b84eaf835addc8eb9bc77d3eb485c29986572554","observation_id":"5c972fb9-5fb2-4502-94d3-089a23e7ec4f","resolution":{"observed_at":"2026-08-16T11:18:01.943153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10811","last_updated":"2019-06-12T17:42:33Z","snapshot_observed_at":"2026-08-17T11:06:50.023408Z","submitted_at":"2019-02-13T20:35:44Z","title":"Do ImageNet Classifiers Generalize to ImageNet?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10811","snapshot_observed_at":"2026-08-16T11:18:01.420967Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.420967Z"},"links":{"cited_paper":"/paper/1902.10811","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:8be5f7ac5b1e889c2dd040d84d0aeedce73922d68a66dafa810e0ddb3a893483","observation_id":"09fe3cc9-8b1e-4005-a0a7-e852b3d78d00","resolution":{"observed_at":"2026-08-16T11:18:01.420967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-14T19:05:25.482398Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-16T11:18:01.426437Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.426437Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c65b579284ab356e661c4fec5b14a0e2b5e429f3efd18e632d9bd5e94262986c","observation_id":"0c90e99a-8f34-4575-ad20-8e25723f422a","resolution":{"observed_at":"2026-08-16T11:18:01.426437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-16T11:18:01.431511Z","title":"J., Li, J., Paduraru, C., Gowal, S., and Hester, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.431511Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:10bf24d00c7270bfb57e6406b283833491b21af1d014948cde6ddd34c0f8df72","observation_id":"4c04338e-ad1a-4ba5-8fbb-a49be745b5a2","resolution":{"observed_at":"2026-08-16T11:18:01.431511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.923756Z","title":null,"venue":null,"work_id":"bb69c968-4237-4da2-b67b-536e7300759a","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.436371Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:00f314b57ac0178301369c8497db9a690b7fc40c89c318309f2e11d825b495c4","observation_id":"95337990-c905-4a2f-8c79-4e71df2c3ceb","resolution":{"observed_at":"2026-08-16T11:18:01.928589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-16T11:18:01.441025Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.441025Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5d957a43898920c452b7daaf66c9f1381c1a8b0df3c7f2023671bedbe7580e0f","observation_id":"d3ac973f-4e3f-4776-a158-1c5e65de5e0a","resolution":{"observed_at":"2026-08-16T11:18:01.441025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.909471Z","title":"J., and R´ e, C","venue":null,"work_id":"ae7f25fa-1f43-45ef-8965-0e46db3f1c3d","year":2022},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.446192Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:8299b1adf545f0877dd91409094786bc966e25fdb09eddbdd6f0a27f0145799b","observation_id":"ae8b443a-37fc-4514-9b25-e4b20d548b43","resolution":{"observed_at":"2026-08-16T11:18:01.913978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.893849Z","title":"U., Cordonnier, J.-B., and Jaggi, M","venue":null,"work_id":"6283a5a5-53e1-4e2f-9f2e-d129da4dc38c","year":2019},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.450931Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:f2d4af7187d16122a3378d549cd1cf9dae6aa9ebf7152920e0df5c49424d823e","observation_id":"aa65037d-4d14-4cdb-a123-66f3feb6063c","resolution":{"observed_at":"2026-08-16T11:18:01.898829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.877783Z","title":"and Stern, M","venue":null,"work_id":"dc9068d1-03c3-4566-a1f7-5110dc424fe5","year":2018},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.455438Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:842ed176835afa309a8edf621d862680fce0a5e53f51d5a07f2796d50505207e","observation_id":"7973f228-ed72-4e90-af0c-c083ab7ac2f9","resolution":{"observed_at":"2026-08-16T11:18:01.882440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03669","last_updated":"2025-05-07T13:57:44Z","snapshot_observed_at":"2026-08-16T15:57:46.655111Z","submitted_at":"2023-02-04T02:49:12Z","title":"Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems","version":4},"cited_work":{"arxiv_id":"2302.03669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03669","snapshot_observed_at":"2026-08-16T11:18:01.539652Z","title":"Deep Reinforcement Learning for Traffic Light Control in Intelligent Transportation Systems","venue":"cs.LG","work_id":"57b2056f-2c81-4ba4-8b3c-75f8ca418e11","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.460823Z"},"links":{"cited_paper":"/paper/2302.03669","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:cbc9567a1cfdaadb03db213dd0700883eb5d6afeedb2e5843dbf42328e9eaa27","observation_id":"7e4e37fe-3768-46e1-b4ca-b9372b95d0a3","resolution":{"observed_at":"2026-08-16T11:18:01.546739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-16T15:30:30.483704Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-16T11:18:01.465897Z","title":"H., Ma, T., Anandkumar, A., and R´ e, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.465897Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:c8215adb6d193ea9da3b8a3b9ed150fdc7302ed6ceee4d190cfa7a4889a1e496","observation_id":"28103d01-4a27-4def-af13-4ab16277a96d","resolution":{"observed_at":"2026-08-16T11:18:01.465897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.863522Z","title":null,"venue":null,"work_id":"1a44cef4-810f-4a0c-acc6-183141fbca80","year":2021},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.470486Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:ccf6209f3138452d82f91c68d6ec528613dbcb85bf3d5336139b44091d956a81","observation_id":"30dd5669-af2d-42a6-8992-15f7917acbac","resolution":{"observed_at":"2026-08-16T11:18:01.868048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.849056Z","title":null,"venue":null,"work_id":"45625518-f25f-4c01-9489-1aebc34bf042","year":2023},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.474816Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:1b8c275ebc1cb208a0487c4175c30d32101c9f1f241582046e77bd604cfd90ee","observation_id":"4f1562ad-8792-4d3c-a1dc-f46089c9b454","resolution":{"observed_at":"2026-08-16T11:18:01.853771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.833890Z","title":"and Bengio, Y","venue":null,"work_id":"7b538077-3d1b-439e-845a-c2933f735bc7","year":2010},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.479361Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:5b4e4555c53c87814cf6ac7822c42370af4204db91404a319eb620c47a9364e3","observation_id":"5910f499-5aa3-4660-bb11-6ca57debbfcc","resolution":{"observed_at":"2026-08-16T11:18:01.838628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:18:01.817538Z","title":null,"venue":null,"work_id":"a7f22dbf-ec7f-475b-b4a5-2f423734a7e4","year":2015},"citing_paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:18:01.484321Z"},"links":{"citing_paper":"/paper/2504.16020"},"observation_digest":"sha256:ab2f74670310aaf8117ad64e9a9eb9049a7198ff57e966315dd0057d7eee4054","observation_id":"44b289fb-2766-4a17-ba0f-1dea3548e4fd","resolution":{"observed_at":"2026-08-16T11:18:01.822759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16020","last_updated":"2025-04-23T01:25:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T11:43:10.600128Z","submitted_at":"2025-04-22T16:33:14Z","title":"AlphaGrad: Non-Linear Gradient Normalization Optimizer"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2504.16020."}