{"as_of":"2026-08-18T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c753fdef2795d643c060e2915718071fab3585ee2a26efb3896d0a2045a9364c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:55:18.298267Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T10:57:04.360455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:26:25.980990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"cited_work":{"arxiv_id":"2412.02153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02153","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting the initial steps in adaptive gradient descent optimization","venue":null,"work_id":"69d2168b-729e-4a21-9cd9-f7f664ce2da7","year":2024},"citing_paper":{"arxiv_id":"2604.26481","last_updated":"2026-04-29T09:47:21Z","snapshot_observed_at":"2026-08-13T13:26:56.070469Z","submitted_at":"2026-04-29T09:47:21Z","title":"A Provably Robust Multi-Jet Framework applied to Active Flow Control of an Airfoil in Weakly Compressible Flow","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T10:57:04.360455Z"},"links":{"cited_paper":"/paper/2412.02153","citing_paper":"/paper/2604.26481"},"observation_digest":"sha256:49d38edd92bc597ed9072feb4f769bf042ec443685b8c0b30f4e4e508c21b2da","observation_id":"c147f485-ea7b-4125-8d91-2a028299233c","resolution":{"observed_at":"2026-05-12T09:26:25.982708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02153/citation-record","integrity":"/paper/2412.02153/integrity","json":"/paper/2412.02153/citation-record.json","paper":"/paper/2412.02153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.871462Z","title":"SIAM review, 60(2):223–311, 2018","venue":null,"work_id":"c50dcfab-d61e-4610-ac42-89efc7233e12","year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.090406Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:b13144c473f21b1a1c4e6c1a39a794439acd2136796dd0310f7010ac848e07a8","observation_id":"d27cd9ed-7dde-4c26-8e3d-246a2fdad191","resolution":{"observed_at":"2026-08-11T23:55:18.875502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.859034Z","title":"Adaptivesubgradientmethodsforonlinelearning and stochastic optimization.Journal of machine learning research, 12(7), 2011","venue":null,"work_id":"2b369542-2570-460b-b9ef-fabf0fc14c37","year":2011},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.094726Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:7fc47b75971a5ec6120601b2f2ba4a49938eeeaffa7a0593c75096911c850c3f","observation_id":"fbc0659b-0346-4dc8-bac3-3b6acd5abaa7","resolution":{"observed_at":"2026-08-11T23:55:18.863774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.847030Z","title":"Neuralnetworksformachinelearning lecture 6a overview of mini-batch gradient descent.Cited on, 14(8):2, 2012","venue":null,"work_id":"bd8ff659-5d03-49d3-a992-55a150cd04d1","year":2012},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.098513Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:f378f3f95d5b22859d3c1c841fb381fa9d030dcdd862818f42bde868aee803a8","observation_id":"0b55d37c-ec4e-489f-a94f-f40e7caf39ea","resolution":{"observed_at":"2026-08-11T23:55:18.851195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T23:55:18.102499Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.102499Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:9988ca2463bddaeaf2c715051aaaf6ed8cc467aec75c234e08d15a5d09b92d80","observation_id":"7154ba05-afe1-4f39-92c0-adf66094f4ee","resolution":{"observed_at":"2026-08-11T23:55:18.102499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.834911Z","title":"Why adam outperforms gradient descent on language models: A heavy-tailed class imbalance problem","venue":null,"work_id":"2bbac7dc-e305-454e-b8e0-9df73ba122ee","year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.106926Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:5d6a3556c350bac28b761e7dbc8bef6da175e4febae89efc567568d8668c392b","observation_id":"791857b2-973e-4f78-a31b-d11c903f21e4","resolution":{"observed_at":"2026-08-11T23:55:18.839261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00204","last_updated":"2023-05-31T21:49:44Z","snapshot_observed_at":"2026-08-16T15:27:44.526321Z","submitted_at":"2023-05-31T21:49:44Z","title":"Toward Understanding Why Adam Converges Faster Than SGD for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00204","snapshot_observed_at":"2026-08-11T23:55:18.115103Z","title":"Toward understanding why adam converges faster than sgd for transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.115103Z"},"links":{"cited_paper":"/paper/2306.00204","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:bb6d07e896f0f0f34b70c2633e59c74655876ef7f56b4c5cf8ecf1b393b66757","observation_id":"5d3d1554-d265-4b76-8d1e-8be221b1f8a0","resolution":{"observed_at":"2026-08-11T23:55:18.115103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.822615Z","title":null,"venue":null,"work_id":"9b5b2c03-0388-4321-9501-01ca955313b0","year":2024},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.119808Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:2e0dd411353883c75815b003ae5107c86ef34412acbfca518c35050944ed3371","observation_id":"74ba7857-1527-425f-ab0b-7398f40742e2","resolution":{"observed_at":"2026-08-11T23:55:18.826280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-08-18T11:52:10.492128Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-11T23:55:18.123604Z","title":"Why transformers need adam: A hessian perspective.arXiv preprint arXiv:2402.16788, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.123604Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:bb8582fe5423863e45d100f051a0d0112a750bd1a1d0da17078ca1ea8310db18","observation_id":"c5191b5a-a2da-49eb-80b0-249757cd9174","resolution":{"observed_at":"2026-08-11T23:55:18.123604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.811803Z","title":"Adam can converge without any modification on update rules.Advances in neural information processing systems, 35:28386–28399, 2022","venue":null,"work_id":"9b33bed0-a6a8-45ff-91ab-f85a12f359e1","year":2022},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.127601Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:957fe59a78d61dff51f0c058cc13c2ce768ad3cd0685f9314c52f233db631f62","observation_id":"92d40876-d56f-4502-a5ef-fc0265e9f73d","resolution":{"observed_at":"2026-08-11T23:55:18.815678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.800707Z","title":"Ontheconvergenceofadamandbeyond","venue":null,"work_id":"0ea573b4-9b64-4bda-a128-dd37a29b499f","year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.131423Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:75d4ec8e15cd6107f2dab23d58eb9ae7658d07672eca7a0c658d0838e383a266","observation_id":"0e254062-20e2-40e9-8364-d3a6bf27174b","resolution":{"observed_at":"2026-08-11T23:55:18.804212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.789495Z","title":"Onthevarianceoftheadaptivelearningrateandbeyond","venue":null,"work_id":"7059d774-714a-4be7-9bda-e2e9a693329c","year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.135397Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:f2f0a7f99064821b99c36e18aaa7900d3e266aa4c3e54fcb788e33d21b4aeda3","observation_id":"b531cc5b-adf0-4d4e-9c55-05dde3af477c","resolution":{"observed_at":"2026-08-11T23:55:18.793186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.777484Z","title":"Adaptive gradient methods with dy- namic bound of learning rate","venue":null,"work_id":"02748145-97e3-4714-b616-d0382d1447a4","year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.140039Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:3192385902f1f513c25681fa18bc6eaaed287916daeb8cb8eb6ae6915a34d370","observation_id":"eeb74156-0b34-4583-9847-c698e58a1d5a","resolution":{"observed_at":"2026-08-11T23:55:18.781935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.143664Z","title":"Adabelief optimizer: Adapting stepsizes by the belief in observed gradients.Advances in neural information processing systems, 33:18795–18806, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.143664Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:29e3c97970f772e88831f9fe5f9c31e23464641c693fe25961f92eaa63d6647d","observation_id":"2a2d0d84-fbfa-4931-a3ae-5280e971826b","resolution":{"observed_at":"2026-08-11T23:55:18.143664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.757746Z","title":"Momentum is all you need for data-driven adaptive optimization","venue":null,"work_id":"d6155d8f-5cb5-4270-ba31-3453eea8c109","year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.147621Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:0f8a220ca078908900f0184aad5459b31ec361170c9c346b05e2b7802387e5b3","observation_id":"60c21456-6732-4846-908e-81c9634db9b2","resolution":{"observed_at":"2026-08-11T23:55:18.762047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.745609Z","title":"Survey of optimization algo- rithms in modern neural networks.Mathematics, 11(11):2466, 2023","venue":null,"work_id":"ffd04cff-1a36-4ab5-bc07-635fb2a7bcf6","year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.151424Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:05c898eff8d6fcf17990b9425250617ba01181a2d37c999ea3cfc86f7f255853","observation_id":"fd2b5e40-05e0-4b00-bfc2-808a81e52afa","resolution":{"observed_at":"2026-08-11T23:55:18.749731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.729243Z","title":"No train no gain: Revisitingefficienttrainingalgorithmsfortransformer-basedlanguagemodels","venue":null,"work_id":"666becfd-9aab-4eb6-a57c-21eaeff93cd8","year":2024},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.155290Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:a2459bd7fa8bdfebc309cc78f2ce2a63aed6632d33b5f550df3f36b040a1d8b4","observation_id":"4e825763-1ff0-458c-bf6f-5ebb7ecc4d23","resolution":{"observed_at":"2026-08-11T23:55:18.733754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.159144Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.159144Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:9e6ced5ecf94b79b71b2b11776463fab5fbc8a45af2952187d8d4b3cd8eb6ae8","observation_id":"9503e7e6-637f-4e50-8912-3ff3dea5a0b7","resolution":{"observed_at":"2026-08-11T23:55:18.159144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.709877Z","title":"Dissecting adam: The sign, magnitude and variance of stochastic gradients","venue":null,"work_id":"455642b3-2be9-44f9-9e73-0bf3535335c2","year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.162590Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:542b262729aa56ab8c3a509d28244829ab9f081fba603442bbc7d4b6dd3d8ed7","observation_id":"616b0594-0698-463c-b76b-efe36d10d86f","resolution":{"observed_at":"2026-08-11T23:55:18.714484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.696264Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":"2a5efcaf-fb36-4d12-8542-fd7ff4ceb758","year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.166576Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:37df2d2482b1df2fc812723fcd72f59f93e5744746f8b39d851af53347146b6f","observation_id":"e3e569c9-d134-4e9a-91e2-950098a2c5d8","resolution":{"observed_at":"2026-08-11T23:55:18.700866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-08-16T14:14:00.607790Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-11T23:55:18.171126Z","title":"Heavy- tailedclassimbalanceandwhyadamoutperformsgradientdescentonlanguagemodels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.171126Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:e5b8ba427a8f0d12d23f30e9cef2f966a51bf8488e57768e960316fa20fabcf9","observation_id":"483bd74d-39e7-4e6f-ab3b-bc86c1cfd077","resolution":{"observed_at":"2026-08-11T23:55:18.171126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T23:55:18.174774Z","title":"Bert: Pre-training of deep bidirectional transformers for language understand- ing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.174774Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:aecf8c3ad8b9f1616dd062d54af635a6dc79f3fbc595ad63d597f37f21990e62","observation_id":"fedc59b5-eaae-43be-8a59-e702ccc86ad0","resolution":{"observed_at":"2026-08-11T23:55:18.174774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.178936Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.178936Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:9276cf3d026f9dac2d5ce0d428a92c8d1c8db4a40f41f03bdc063039756957be","observation_id":"c18c163d-93a1-47ce-b256-7de82ad31881","resolution":{"observed_at":"2026-08-11T23:55:18.178936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05704","last_updated":"2022-06-07T19:25:30Z","snapshot_observed_at":"2026-08-16T18:32:09.165046Z","submitted_at":"2021-04-12T17:58:56Z","title":"Escaping the Big Data Paradigm with Compact Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05704","snapshot_observed_at":"2026-08-11T23:55:18.183017Z","title":"Escaping the big data paradigm with compact transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.183017Z"},"links":{"cited_paper":"/paper/2104.05704","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:dcbd7fefe65eb98abcba3993f16afc471b5f4ba8b1d616c035f33390042e31c9","observation_id":"bee428aa-ab62-43fa-afe1-524ba5a3c689","resolution":{"observed_at":"2026-08-11T23:55:18.183017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.677411Z","title":"Improving transformer op- timization through better initialization","venue":null,"work_id":"a61e7178-5fa5-4949-b5b8-b6374a316867","year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.187370Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:61f5ae1ddc0c817f80ed8a76d4ed77788e4bd21637dc5c237df93c2b0a28c19b","observation_id":"ee7bd2b8-1511-4123-9a25-16db88075725","resolution":{"observed_at":"2026-08-11T23:55:18.681565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.664841Z","title":"Scan and snap: Understanding trainingdynamicsandtokencompositionin1-layertransformer","venue":null,"work_id":"5c07660e-34fb-4662-8229-97fcb18ff489","year":2023},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.190823Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:bb9862f1cc0e7cfbc678a7a2ca9a9e42813c3238edba8827f81038a0af0a95ca","observation_id":"d2bc7fba-6729-4177-b206-a07a6563fe18","resolution":{"observed_at":"2026-08-11T23:55:18.669067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.5063","last_updated":"2013-02-16T00:35:48Z","snapshot_observed_at":"2026-08-15T08:47:13.449851Z","submitted_at":"2012-11-21T15:40:11Z","title":"On the difficulty of training Recurrent Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.5063","snapshot_observed_at":"2026-08-11T23:55:18.194230Z","title":"On the difficulty of training recurrent neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.194230Z"},"links":{"cited_paper":"/paper/1211.5063","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:7c6c6f24f86fcc38e296cd675f091264e38928eeb5ec050d353d49fa900f80ba","observation_id":"3dea8294-5312-4dad-8477-2a38c972e11a","resolution":{"observed_at":"2026-08-11T23:55:18.194230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.198263Z","title":"Visualizing the loss landscape of neural nets.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.198263Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:f8ce9b875873a59e605296e595daf0c6f765f68a4f4548cede676a179c53d10b","observation_id":"a1632498-320c-4c21-ac5a-f62c91ea4c9d","resolution":{"observed_at":"2026-08-11T23:55:18.198263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.645940Z","title":"On the sdes and scal- ing rules for adaptive gradient algorithms.Advances in Neural Information Processing Systems, 35:7697–7711, 2022","venue":null,"work_id":"af879700-53cc-4d07-a772-42bf457a0075","year":2022},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.202867Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:bf18b9a7c5db4afcf75bdecb0ed4e7c969bd1668bf7606168f7f81ff2438f098","observation_id":"f9e78a07-1177-471e-9b03-3a0ee96d91df","resolution":{"observed_at":"2026-08-11T23:55:18.650192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.634693Z","title":null,"venue":null,"work_id":"a37fe1b6-93bc-4cc7-b2c7-2d6f6075cac3","year":2021},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.210430Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:2a05e11f0521a7f843094d03146454a84d663727711502c870dd4917827b7d00","observation_id":"e2030e20-49c8-4dec-9706-1db481a493ab","resolution":{"observed_at":"2026-08-11T23:55:18.638428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.214398Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.214398Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:7323f9d85419e7085bac2d3515b049dbddd9427d9c89b5d97497cea77c33ca65","observation_id":"b306e551-bd51-4afc-b145-a2dc601c30f5","resolution":{"observed_at":"2026-08-11T23:55:18.214398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-08-14T18:40:13.013175Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-11T23:55:18.218036Z","title":"On the convergence of adaptive gradient methods for nonconvex optimization.arXiv preprint arXiv:1808.05671, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.218036Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:5c8d6a635615b1f5967b43de0cb54e595b05705dcfcfaed4db68d66b7b52eb19","observation_id":"aa438afe-3957-41d3-a43e-215acaba8e28","resolution":{"observed_at":"2026-08-11T23:55:18.218036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.616885Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"2b184898-47dd-4feb-bb5c-d69617076e65","year":2016},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.221996Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:bdfdcc2860965df13146b2d48358463961e281add5f6c54bb9f0ff42bd2ce3dc","observation_id":"a3239ca3-1b01-4c0f-bc14-0c8ed465182f","resolution":{"observed_at":"2026-08-11T23:55:18.620554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.604993Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":"7aa37f3b-0853-4c23-921c-24571f6def3a","year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.226209Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:fa29cf3abd9aa04de163855d345c97ca6b85dc38977893a938856ebbd9fe0199","observation_id":"6e4a4f91-c95a-47b0-8350-dd3f958c4894","resolution":{"observed_at":"2026-08-11T23:55:18.609138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.593065Z","title":"Long short-term memory.Neural Computation, 9(8):1735–1780, 1997","venue":null,"work_id":"acb2868b-416b-4743-a916-a9ad9d9daa5c","year":1997},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.230462Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:ef1aebf87b3226182b2bc68136d69dfac0e4a89b3942bfa558a4e6b4ac65d719","observation_id":"aa2311f3-a0de-4ec4-9659-49bacba4de32","resolution":{"observed_at":"2026-08-11T23:55:18.597359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.580912Z","title":"A stochastic approximation method.The annals of mathe- matical statistics, pages 400–407, 1951","venue":null,"work_id":"8a61bc4b-5cc8-4886-92b6-16a8d27c48a9","year":1951},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.234921Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:81594b238e8dde48209b4807c0197c3681e06c09f36c8a8cf8413cd5a7c55e5c","observation_id":"9ec2b5c5-28f0-4b26-8b76-093774850168","resolution":{"observed_at":"2026-08-11T23:55:18.585088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.239074Z","title":"Some methods of speeding up the convergence of iteration methods.Ussr computational mathematics and mathematical physics, 4(5):1–17, 1964","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.239074Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:061a87004091c5225c76251c255dcdd4fee02afc741d7d49713b83ccf0318728","observation_id":"f29ab8a6-0f0f-4bc1-b165-631fff1c70a3","resolution":{"observed_at":"2026-08-11T23:55:18.239074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.243371Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.243371Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:525e923bd7f30b13ba11660455a5f57f5e33c84ac99716536ad317b6bd135e4b","observation_id":"ae64e145-0cc5-4fda-b4f1-9bc6ba3983c6","resolution":{"observed_at":"2026-08-11T23:55:18.243371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.553741Z","title":"Learningmultiplelayersoffeaturesfromtinyimages","venue":null,"work_id":"0e38e191-50de-4ea2-a75b-3ef7c79b58ce","year":2009},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.246993Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:0fa0cd163324add558237d6c321d8384e1a71a9c52b83e550abdb10cf37624bc","observation_id":"8b053159-668b-4b04-baf2-91b25ac8acf6","resolution":{"observed_at":"2026-08-11T23:55:18.557433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.250663Z","title":"Imagenet large scale visual recognition challenge.International journal of computer vision, 115:211–252, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.250663Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:dc7757e0c0e9151fedfd77e3f62cc7c28947b36d0e453bde941f1574addfaf80","observation_id":"767f1587-9603-4c95-a5d5-ead3f3c3b69e","resolution":{"observed_at":"2026-08-11T23:55:18.250663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.254472Z","title":"Building a large annotated corpus of english: The penn treebank.Computational linguistics, 19(2):313–330, 1993","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.254472Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:9d5501eb002ac21b14ce72d3c5f7501c41fa382824a707a198d5d70304afb965","observation_id":"8485ca84-2abe-4b3b-848f-a44ac385636e","resolution":{"observed_at":"2026-08-11T23:55:18.254472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.529524Z","title":"fairseq: A fast, extensible toolkit for sequence modeling","venue":null,"work_id":"15a02261-be8a-4b5c-9124-ce2a7083949e","year":2019},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.258037Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:69f7458564da7c2e3bbd20a403d2e4025aca0e830391f08e0657939658a58b37","observation_id":"623c7226-ab06-4426-9dfe-b0543400e1c1","resolution":{"observed_at":"2026-08-11T23:55:18.533290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.517933Z","title":"Bleu: amethodforautomatic evaluation of machine translation","venue":null,"work_id":"479616af-9dd4-44b9-b7c7-fecd9cf7bfee","year":2002},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.261515Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:4000aeea2749f36dfa00487e7f7799f6bbfdc4209ded75906d8c41412fa4b20a","observation_id":"fe6288ff-e5e5-494e-b28a-d770ca723e25","resolution":{"observed_at":"2026-08-11T23:55:18.521952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-12T18:43:14.431633Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-11T23:55:18.265028Z","title":"Unsupervised representation learning with deep convolutional generative ad- versarial networks.arXiv preprint arXiv:1511.06434, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.265028Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:4d6e9df73c60d2e6251ab51379e448d37458f62fd6f6665ed1301dfe6aee3fb0","observation_id":"b8bfc735-fe4c-4d20-b7fd-e98bc15aedaf","resolution":{"observed_at":"2026-08-11T23:55:18.265028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.506380Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Ad- vances in neural information processing systems, 30, 2017","venue":null,"work_id":"45ba773d-9d80-4f0a-b7b3-20b20e55fbf3","year":2017},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.269334Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:5f64b470902742ad1ecf99b2c263a9d006395ead8277182d26be6ba68a03dfa5","observation_id":"ae5cb523-8896-457c-bfa7-14d0dbffc699","resolution":{"observed_at":"2026-08-11T23:55:18.510175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.495862Z","title":"Asymmetric valleys: Beyond sharp and flat local minima","venue":null,"work_id":"c51d0702-adba-4c21-828f-d85446647760","year":2019},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.272984Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:97b8e1dcce6f181633cd2ead9a15b69869dc336d9a4887983dc1539c3b214e6d","observation_id":"3873b934-4b51-4775-aa0d-001588530268","resolution":{"observed_at":"2026-08-11T23:55:18.499600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.483406Z","title":"Towards the- oretically understanding why sgd generalizes better than adam in deep learning.Advances in Neural Information Processing Systems, 33:21285–21296, 2020","venue":null,"work_id":"8a05eb58-757e-4a29-9400-c3bbb49a9e22","year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.276768Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:5b956481b9a6da87831ad58332d37c1aede2848edaba480b3f8816f70163c1a9","observation_id":"36084f00-71b3-4382-ba2a-97d75361106a","resolution":{"observed_at":"2026-08-11T23:55:18.487962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.471478Z","title":"On the adequacy of untuned warmup for adaptive optimization","venue":null,"work_id":"ba80d9d6-d2ba-4332-aa35-889d82d96fee","year":2021},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.280225Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:81e86f9ee506dcd7e3bd368d0969ec37ef6ee18d2e51ad77767168ff9eb2861c","observation_id":"9b683fd7-1aef-43d0-bb67-1032c1c28dfc","resolution":{"observed_at":"2026-08-11T23:55:18.475374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.460502Z","title":"Re- thinkingtheinceptionarchitectureforcomputervision","venue":null,"work_id":"d582c245-364d-4aa1-8422-826b94664153","year":2016},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.283631Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:0179934ed5791ab45c2e5d74a76392d60783f2afd8fd3dd6725cf060a4a666bb","observation_id":"4de66683-7cb4-4aa8-948d-f2f6eb1234f1","resolution":{"observed_at":"2026-08-11T23:55:18.464169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.287122Z","title":"SGDR: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.287122Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:1b4956d0cdd6931dd3f540c178c048726f4f0dbb73cdeaa1c075f0248fe78573","observation_id":"7b7fe0e2-1d91-49d4-9b38-9a320a418488","resolution":{"observed_at":"2026-08-11T23:55:18.287122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.442050Z","title":"Linear mode connectivity and the lottery ticket hypothesis","venue":null,"work_id":"7e9e271c-5cdc-4fdf-ad11-dad8af6b3803","year":2020},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.290543Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:00ed6e4c8889dd62cee4642003ebab0e9b60e48fd62a0f2af8bb0f91d9bd3e74","observation_id":"018f5842-299b-4eae-9179-df7b4a65e0df","resolution":{"observed_at":"2026-08-11T23:55:18.445825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.430885Z","title":"The small denominator leads to excessively large initial updates, particularly when¯g is small orσ2 is large","venue":null,"work_id":"715be68d-7bd3-4014-ba96-1a4656cdfc24","year":2012},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.294054Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:f8bf7378de2d484a50f32ac4543e4731c2e5242bdfc8a1a382e7a9e778ddfcab","observation_id":"478ed16b-4bee-4527-bf8a-ceb2170032bf","resolution":{"observed_at":"2026-08-11T23:55:18.434649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:55:18.417246Z","title":"The model is trained with a length penalty of 1.0, a beam size of 5, and an initial warmup step size of10−7","venue":null,"work_id":"d117a5aa-3d9e-4b2f-afbd-484dcf8796f4","year":null},"citing_paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T23:55:18.298267Z"},"links":{"citing_paper":"/paper/2412.02153"},"observation_digest":"sha256:d15c3bd82dcbc2033140af751754674a7839e8138460b6457904a1d8a7e6ea69","observation_id":"9c013d2f-01a8-4f6a-98c3-74560a32b667","resolution":{"observed_at":"2026-08-11T23:55:18.423003Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02153","last_updated":"2025-02-11T16:23:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T12:28:01.909514Z","submitted_at":"2024-12-03T04:28:14Z","title":"Revisiting the Initial Steps in Adaptive Gradient Descent Optimization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2412.02153."}