{"as_of":"2026-08-07T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91cf58a222ef5077d5410c0ea4ff7852c1deb464dac2b2f631fcfdad44e0a393","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:09.807584Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T13:37:44.255971Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:06:23.864619Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"cited_work":{"arxiv_id":"2505.24399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24399","snapshot_observed_at":"2026-07-02T00:06:23.864619Z","title":"Lightsam: Parameter-agnostic sharpness-aware mini- mization.arXiv preprint arXiv:2505.24399,","venue":null,"work_id":"36ea6be7-e888-4c88-936a-7abd38c40646","year":null},"citing_paper":{"arxiv_id":"2606.01827","last_updated":"2026-06-01T07:42:01Z","snapshot_observed_at":"2026-08-06T22:37:29.644562Z","submitted_at":"2026-06-01T07:42:01Z","title":"Adaptive Sharpness-Aware Minimization with a Polyak-type Step size: A Theory-Grounded Scheduler","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T13:37:44.255971Z"},"links":{"cited_paper":"/paper/2505.24399","citing_paper":"/paper/2606.01827"},"observation_digest":"sha256:5b92a98a31ab503c857df10154dc3f7b69e4c2fcba0555695ebee1dc0d98f595","observation_id":"72befb5e-07a6-4d00-abde-e4adf9eb8d24","resolution":{"observed_at":"2026-07-02T00:06:23.867165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24399/citation-record","integrity":"/paper/2505.24399/integrity","json":"/paper/2505.24399/citation-record.json","paper":"/paper/2505.24399"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-07T12:32:03.705161Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:03.705161Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:c9335ee115f394a83664144e64d01b9a60f661e4f1e78b7decbb56f8bbf350f6","observation_id":"ca909f6a-1e6a-43fa-986d-e5ed93729900","resolution":{"observed_at":"2026-08-07T12:32:03.705161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.355784Z","title":"Explor- ing generalization in deep learning,","venue":null,"work_id":"03c2586c-2482-4eb9-9cf1-de71d93eefc3","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:03.838257Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:56ba85323bc7ab396cbc66109f7be22a2cf7928c89f070b65b8d03ffc7e340aa","observation_id":"a69f7403-0ac3-4dce-a48e-d3aee9736030","resolution":{"observed_at":"2026-08-07T12:32:16.399158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.281795Z","title":"Sharpness-aware minimization for efficiently improving generalization,","venue":null,"work_id":"4f33cb65-09ff-4572-93e4-1fd2f34e6198","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.015856Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:50051685369e9930142bae208905363a736810b94d88d7680d784cc25cef860e","observation_id":"6d0acfcc-1710-4d8c-ac02-74f3e73b13cd","resolution":{"observed_at":"2026-08-07T12:32:16.313610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:04.134769Z","title":"Towards understanding sharpness-aware minimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.134769Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:66377a823bc0479a1cfbb762f85293378a7d1539ae4646abc9f6bc730f698a92","observation_id":"3d1c9cfa-773c-4279-88eb-ddee91cd26a7","resolution":{"observed_at":"2026-08-07T12:32:04.134769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.133614Z","title":"Make sharpness-aware minimization stronger: A sparsified perturbation ap- proach,","venue":null,"work_id":"be49b633-a81a-4fec-a346-cdf1a687f32f","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.346485Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:64187cd62a234421e1475d2b6bda242866a33a834a82e2e72bea6d9d2a860068","observation_id":"51ca9150-ba24-442a-ad94-bc4d3d10d720","resolution":{"observed_at":"2026-08-07T12:32:16.180995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17539","last_updated":"2025-06-13T06:18:23Z","snapshot_observed_at":"2026-07-06T16:54:18.139849Z","submitted_at":"2023-11-29T11:19:50Z","title":"Critical Influence of Overparameterization on Sharpness-aware Minimization","version":5},"cited_work":{"arxiv_id":"2311.17539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17539","snapshot_observed_at":"2026-08-07T12:32:10.954644Z","title":"Critical Influence of Overparameterization on Sharpness-aware Minimization","venue":"cs.LG","work_id":"aec240f7-3b3e-4ae2-8036-97684b524c61","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.469847Z"},"links":{"cited_paper":"/paper/2311.17539","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:a76dcceb01fb8721f967afc685680ae5e1200acee786b4087fe5d0493010b3df","observation_id":"63bbc9b3-83c5-40d1-be02-ec0b4ca133c4","resolution":{"observed_at":"2026-08-07T12:32:11.066310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:16.030575Z","title":"Adasam: Boosting sharpness-aware minimization with adaptive learning rate and momentum for training deep neural networks,","venue":null,"work_id":"7b2f98c0-c361-43e9-ab3e-311a078c9d55","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.577430Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bc37aa7485cec400bfdc7389f2b77dce25667b8ea442c8d714b17a62fa071fe3","observation_id":"b248054c-b17d-4c29-905b-4fbc431d1218","resolution":{"observed_at":"2026-08-07T12:32:16.076479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15287","last_updated":"2023-10-23T16:12:38Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:09:41Z","title":"The Crucial Role of Normalization in Sharpness-Aware Minimization","version":2},"cited_work":{"arxiv_id":"2305.15287","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15287","snapshot_observed_at":"2026-08-07T12:32:10.813953Z","title":"The Crucial Role of Normalization in Sharpness-Aware Minimization","venue":"cs.LG","work_id":"458f2277-8c12-47e9-a06d-b8ca2042ca2f","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.680024Z"},"links":{"cited_paper":"/paper/2305.15287","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:a9df129041a21a372be7797360c3286b8e6b15bbe5afdfb122abb02063d3e492","observation_id":"1562b4a7-b3f6-49a4-bd05-78dcb526760d","resolution":{"observed_at":"2026-08-07T12:32:10.878494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15146","last_updated":"2024-03-22T11:57:51Z","snapshot_observed_at":"2026-07-06T17:48:59.440247Z","submitted_at":"2024-03-22T11:57:51Z","title":"On the Convergence of Adam under Non-uniform Smoothness: Separability from SGDM and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15146","snapshot_observed_at":"2026-08-07T12:32:04.824071Z","title":"On the convergence of adam under non-uniform smoothness: Separability from sgdm and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.824071Z"},"links":{"cited_paper":"/paper/2403.15146","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5509bc5f4afbdb0c43728d60940e170eb05bbfb9d875e0181c7dffa7bb391665","observation_id":"d0f52cb7-2a7d-43b9-b5fa-d5811c97be26","resolution":{"observed_at":"2026-08-07T12:32:04.824071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.873806Z","title":"Parameter-agnostic optimization under relaxed smoothness,","venue":null,"work_id":"00a3c80e-866c-41d1-8e12-04242e42aaf9","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:04.980252Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:001f5c46e911efc73cf7a2b3133e0a0afc07f6903c9fdf65c7ab1c5a74eee868","observation_id":"67b5be73-9c6f-4d6a-bb63-c2c5204006f2","resolution":{"observed_at":"2026-08-07T12:32:15.938783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.768953Z","title":"Simultaneous model selection and optimization through parameter-free stochastic learning,","venue":null,"work_id":"b350a46b-f2a5-4226-82c7-e90d165dfbdf","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.073942Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:51144cfa86e97cbdbd22848f0e88baf1cb010a536efda43803a73c880f24d4da","observation_id":"fc7d315c-9a45-44f2-9343-6f87fc19b812","resolution":{"observed_at":"2026-08-07T12:32:15.817089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.668012Z","title":"Online learning without prior informa- tion,","venue":null,"work_id":"1bd3deb3-8459-4e7e-9a4c-27cb72916f6c","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.166582Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:e17f103911bb63e80b16abf0ff425f012e7cf34ad5e24fea8e7553fe84425cdd","observation_id":"7c0e89ba-fbe8-42e5-902d-35f146a5837b","resolution":{"observed_at":"2026-08-07T12:32:15.728899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.559591Z","title":"Training deep networks without learning rates through coin betting,","venue":null,"work_id":"a7978caa-9738-48b5-b0e8-bf4faf8529fb","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.315244Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d041d050dc22d1ef4396e1e287326b0937e1ddbc1c910b63639cf154ea190886","observation_id":"820afd49-a75c-449d-af02-41d4515c9077","resolution":{"observed_at":"2026-08-07T12:32:15.610779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07733","last_updated":"2023-07-07T19:08:18Z","snapshot_observed_at":"2026-07-06T14:42:35.005646Z","submitted_at":"2023-01-18T19:00:50Z","title":"Learning-Rate-Free Learning by D-Adaptation","version":5},"cited_work":{"arxiv_id":"2301.07733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.07733","snapshot_observed_at":"2026-08-07T12:32:10.618583Z","title":"Learning-Rate-Free Learning by D-Adaptation","venue":"cs.LG","work_id":"1ec01fa3-bfde-4c8f-be7c-1656742d42d3","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.479935Z"},"links":{"cited_paper":"/paper/2301.07733","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5151227ffbf5af29de490b76b1579c71fd0e877fc275a89558d089e67d53497f","observation_id":"9ec614e7-4656-4c12-80ca-7b17578911b3","resolution":{"observed_at":"2026-08-07T12:32:10.696383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.457456Z","title":"Convergence of adagrad for non-convex objectives: Simple proofs and relaxed assumptions,","venue":null,"work_id":"2147feba-91fd-434a-87f1-02060895b732","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.578138Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:60170ae6fbcd5161c212f5d4c3251ccb234d56f1e3c79e18faf9ed03adf349b0","observation_id":"8cc501da-ef48-42be-a7ab-5a3fb93a5128","resolution":{"observed_at":"2026-08-07T12:32:15.483915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.302265Z","title":"Closing the gap be- tween the upper bound and lower bound of adam’s iteration complexity,","venue":null,"work_id":"3b5a8f83-4cb0-4ee5-a129-ff309854c135","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.694388Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bdf43fd47b5157146b66a9c7764bc104f6fd65ff389906b4e93ed92099a65d3c","observation_id":"00fc0edf-80a8-43c3-893f-30991de5455d","resolution":{"observed_at":"2026-08-07T12:32:15.366567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:15.163652Z","title":"How sharpness-aware minimization mini- mizes sharpness?","venue":null,"work_id":"4afbb5b5-1d84-478b-96e3-389588e886f0","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.834616Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:dd000fe63031ed0a5b166c57c839da4b75158645b8b13062a46f904bf9fc0f43","observation_id":"fc93b36c-e876-4c93-9bf9-7dc158409f87","resolution":{"observed_at":"2026-08-07T12:32:15.211429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.974816Z","title":"Asam: Adaptive sharpness- aware minimization for scale-invariant learning of deep neural net- works,","venue":null,"work_id":"cfefd72a-ee1f-46ce-90a4-ac5a6298f13d","year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:05.961223Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:b654c57658442e2da7cca3a7055ae7255a7939a32e16eea08b8ccb7b4de3c15e","observation_id":"4a7ca0fb-8f49-4afc-a00b-5ea02bff8f3f","resolution":{"observed_at":"2026-08-07T12:32:15.086434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.780615Z","title":"Ran- dom sharpness-aware minimization,","venue":null,"work_id":"799a1a89-5ef9-41b4-aa5f-be76a851fdfc","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.089369Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:4ea0e992ee66d9b448dbd60029a284487d4aada43d58513971a26e607f419300","observation_id":"d8b8b287-76d0-4de8-b872-62be1ccb634f","resolution":{"observed_at":"2026-08-07T12:32:14.896107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.588075Z","title":"Sharpness-aware training for free,","venue":null,"work_id":"527677f8-025e-40ae-91b7-62cbb684aad6","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.226590Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:f45686a114d807217678e7fefd7dd9a31fa7456e2d307b050a51de14bc39836e","observation_id":"3c431750-e484-45d7-bd2a-e6d843f297d4","resolution":{"observed_at":"2026-08-07T12:32:14.667063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08065","last_updated":"2022-03-19T15:56:32Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T16:57:59Z","title":"Surrogate Gap Minimization Improves Sharpness-Aware Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08065","snapshot_observed_at":"2026-08-07T12:32:06.318865Z","title":"Surrogate gap minimization improves sharpness-aware training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.318865Z"},"links":{"cited_paper":"/paper/2203.08065","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5bbdaba93b7f548cb024b13ae546ba738e1dda7ff33f17bd357453c8b74a2ead","observation_id":"ff3ca6c2-8d02-4bc4-8df5-2e27826da636","resolution":{"observed_at":"2026-08-07T12:32:06.318865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16854","last_updated":"2024-12-22T04:40:02Z","snapshot_observed_at":"2026-08-07T17:34:52.815662Z","submitted_at":"2024-12-22T04:40:02Z","title":"Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2412.16854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16854","snapshot_observed_at":"2026-08-07T12:32:10.377062Z","title":"Sharpness-Aware Minimization with Adaptive Regularization for Training Deep Neural Networks","venue":"cs.LG","work_id":"96dd4505-c226-4c24-b179-5b31d5b34963","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.484361Z"},"links":{"cited_paper":"/paper/2412.16854","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:a89563430a2606de778e99d01b13c958717636af5aef7cb7f76b9ac6918d68d5","observation_id":"ab012672-d34c-472e-98f9-ad6716cbbf86","resolution":{"observed_at":"2026-08-07T12:32:10.443643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10683","last_updated":"2024-10-14T16:21:23Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T16:21:23Z","title":"SAMPa: Sharpness-aware Minimization Parallelized","version":1},"cited_work":{"arxiv_id":"2410.10683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10683","snapshot_observed_at":"2026-08-07T12:32:10.223472Z","title":"SAMPa: Sharpness-aware Minimization Parallelized","venue":"cs.LG","work_id":"e727df07-5179-43df-bbfa-f4f5201a4459","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.649614Z"},"links":{"cited_paper":"/paper/2410.10683","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5ac9c4c770a7950955f488a1ef0d33c079eb0499224d43c38c65961da43e46ee","observation_id":"e90f502e-041b-411d-b595-be93f69a8d76","resolution":{"observed_at":"2026-08-07T12:32:10.282995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.452503Z","title":"Sharpness-aware lookahead for accelerating convergence and improving generalization,","venue":null,"work_id":"fc37a74c-f53c-4326-b023-27b08472fdc0","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.780027Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:33d1880883d95b66a450832a29ddd494f42dd7083a39037b64372eec63eccf66","observation_id":"06b071f4-4c84-4d54-b86e-2030e642ad63","resolution":{"observed_at":"2026-08-07T12:32:14.508401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T12:32:06.895107Z","title":"On the convergence of adam and beyond,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.895107Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:10fb8123995c6c8270e3fb29775f0f053a181f896cd861e9855bb67a70b67f3a","observation_id":"1cf6545d-ea36-42f6-9d40-957561a54bd9","resolution":{"observed_at":"2026-08-07T12:32:06.895107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.278997Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":"c9b31aed-8c2c-4bf5-b93e-edf9870e2728","year":2011},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:06.992142Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:1810648f971c8d1f7025f589e589c15f982c86fa6bf7818e4d9097aa6644d43f","observation_id":"e4e3051a-28d9-4fef-9629-a3ce144d219b","resolution":{"observed_at":"2026-08-07T12:32:14.370236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.127848Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude,","venue":null,"work_id":"8522391c-3cf8-4338-9c91-aaa4c651f088","year":2012},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.160082Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:0ec43fb414f3460b327f4377037eb378e92f4d5d2b7b4e288383191eead3e1ae","observation_id":"770e4398-2fc1-433a-8c0e-fef26ffee7a0","resolution":{"observed_at":"2026-08-07T12:32:14.157089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:32:07.276622Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.276622Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:dff88f9c2592b76a133e037b6e7d935270d5d860c103984480d5d51e685dde8b","observation_id":"2d99ec0b-0153-4e2d-8b1c-8c251697b69a","resolution":{"observed_at":"2026-08-07T12:32:07.276622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:14.021567Z","title":"On the convergence of stochastic gradient descent with adaptive stepsizes,","venue":null,"work_id":"6d39a060-9718-4dbe-8564-a3b8466057ac","year":2019},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.425989Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:c5527ce6357926be87a03d9bf1f2f8c2e40b42544a872e5735cea048bf5fda63","observation_id":"e59726d7-d0f1-40e6-bc7c-b85903cc39fe","resolution":{"observed_at":"2026-08-07T12:32:14.078444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.02941","last_updated":"2019-03-10T00:48:35Z","snapshot_observed_at":"2026-08-07T09:56:34.669633Z","submitted_at":"2018-08-08T21:14:07Z","title":"On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.02941","snapshot_observed_at":"2026-08-07T12:32:07.535100Z","title":"On the convergence of a class of adam-type algorithms for non-convex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.535100Z"},"links":{"cited_paper":"/paper/1808.02941","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:c51c632947e827f4f02895eeb147dfaecd47fa3af0e70aa23fdd5839bd667c42","observation_id":"986975bc-62a6-4394-a596-7304f9a316a5","resolution":{"observed_at":"2026-08-07T12:32:07.535100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-07T12:32:07.720112Z","title":"On the convergence of adaptive gradient methods for nonconvex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.720112Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:cc94936cfc8890e2e5a0dbdd37761b854a5436a6ffd6efc4c89cf37fb6145596","observation_id":"3f164c29-be32-4d24-9a0b-52ed3180529c","resolution":{"observed_at":"2026-08-07T12:32:07.720112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-07T12:32:07.840556Z","title":"A simple convergence proof of adam and adagrad,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.840556Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:7cc2b7397f8aee5b6b076a07ba4534239a157886bfd7aa9fa87a1cd4ac765bf6","observation_id":"57d2264f-77a7-4bf9-bd75-b8ece43c1613","resolution":{"observed_at":"2026-08-07T12:32:07.840556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.845120Z","title":"A unified analysis of adagrad with weighted aggregation and momentum acceleration,","venue":null,"work_id":"56910125-a972-43b3-8d62-6cd064e56efc","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.977662Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:eae4e4ab0cd38e400a24f7eb0d573ed14d8a6564b5aba52e92c32bc6084997de","observation_id":"9260927b-c685-47ac-9a55-ba0cf1c737f3","resolution":{"observed_at":"2026-08-07T12:32:13.927465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.732825Z","title":"Rmsprop converges with proper hyperparameter,","venue":null,"work_id":"95685068-4cf4-4e48-a3fb-43f80c75c448","year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.053316Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d837f3df70b484e957c3140c9ad9ac0c3ba0c2e315bc706bd632ebe3dcb4d56d","observation_id":"ecab6659-bcd9-4830-b22c-fc8806bb7690","resolution":{"observed_at":"2026-08-07T12:32:13.796724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.577665Z","title":"Adam can converge without any modification on update rules,","venue":null,"work_id":"e2498213-b8be-4253-a3c0-79221129cd00","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.160780Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d16aab1ba010268e22c20ca1d1ddd43c70e53668e54da31b6530f976dce3effb","observation_id":"e352ead6-1c47-41b3-bc03-eb2b45a03bd6","resolution":{"observed_at":"2026-08-07T12:32:13.638004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.489132Z","title":"Dimension-free exponentiated gradient,","venue":null,"work_id":"387b56f3-1786-454f-9dc9-4cb175c0c8ca","year":2013},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.289944Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:51bdd1e4210fff18023bc2bd8f138bdc28559003c32174ffee8fda01be192167","observation_id":"271324d1-7365-438e-bde2-96e3958a4331","resolution":{"observed_at":"2026-08-07T12:32:13.527662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.369927Z","title":"Unconstrained online linear learning in hilbert spaces: Minimax algorithms and normal approximations,","venue":null,"work_id":"8edf240f-38e7-4f89-849a-300dc55db7f7","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.377162Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:b3c74a69ad2c876ae69fa34c7c2c5beb32149ec87d200b7bf65b8abf80fd15ed","observation_id":"d8304df5-bea4-4a43-a352-5fe597d5a3fa","resolution":{"observed_at":"2026-08-07T12:32:13.428361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.207586Z","title":"Coin betting and parameter-free online learn- ing,","venue":null,"work_id":"523f469c-0228-4857-9dac-9a843546d191","year":2016},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.454456Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:ed0328ca7897e5eaa18024e0603c6e08dfd3e444cd63981c2a2dd1133e5475c2","observation_id":"ccd6f11a-1e90-4ef1-9ac7-e83d20f66abd","resolution":{"observed_at":"2026-08-07T12:32:13.275341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:13.063226Z","title":"Making sgd parameter-free,","venue":null,"work_id":"580ac93c-30a6-4b4f-9b68-6e65aaf25804","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.536441Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:d03daa7fb9ad9a19ba310faf281e2b9095bd6e822ee0e2fd739c5e5cc5aaebbb","observation_id":"5d85a160-287b-4016-a495-e53b40f41126","resolution":{"observed_at":"2026-08-07T12:32:13.163077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.834602Z","title":"Dog is sgd’s best friend: A parameter-free dynamic step size schedule,","venue":null,"work_id":"141c5839-0e70-4119-9551-2823b33b771c","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.636490Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:8d21f9cfc40b4045be824fb0981bc94e7256523eed7698447d502b25f2b8e1a0","observation_id":"b222335b-bb1b-4b56-a626-52ef6ff1dc97","resolution":{"observed_at":"2026-08-07T12:32:12.941014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.632859Z","title":"Dowg unleashed: An efficient universal parameter-free gradient descent method,","venue":null,"work_id":"13d4dffc-be75-4518-af4e-238ffde48407","year":2023},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.717996Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:f03b6a8073c91dfa4b24f1cd7e1ba7ba9b778c18b72c593249fa26257a7cb2e0","observation_id":"584ff79f-a319-43c9-949d-b04eb10a058b","resolution":{"observed_at":"2026-08-07T12:32:12.706506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19444","last_updated":"2026-05-31T16:34:26Z","snapshot_observed_at":"2026-07-06T20:13:31.499259Z","submitted_at":"2024-12-27T04:22:02Z","title":"Towards Simple and Provable Parameter-Free Adaptive Gradient Methods","version":2},"cited_work":{"arxiv_id":"2412.19444","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19444","snapshot_observed_at":"2026-08-07T12:32:09.949912Z","title":"Towards Simple and Provable Parameter-Free Adaptive Gradient Methods","venue":"cs.LG","work_id":"0c6cf786-562b-4dc9-9661-dd9398c3436c","year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.793867Z"},"links":{"cited_paper":"/paper/2412.19444","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:68cc6702ddd7651dfa9e22e4e679b2f4ca42f2b91443892b8046d1274ee40a23","observation_id":"78bc8145-df67-48db-b8aa-820041ac313a","resolution":{"observed_at":"2026-08-07T12:32:10.057644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.433269Z","title":"Sgd and hogwild! convergence without the bounded gra- dients assumption,","venue":null,"work_id":"7e441d1d-aa52-475b-a4c3-7fe93a30f827","year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.857984Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:2fedb93036bee1ba539e0d4038765a7aa30deef37e47d221efed71bd428ca840","observation_id":"f8208e1a-3ae7-4b5c-953b-7cbea32ddb01","resolution":{"observed_at":"2026-08-07T12:32:12.559912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.242683Z","title":"Smoothness- adaptive sharpness-aware minimization for finding flatter minima,","venue":null,"work_id":"09524e7d-df0a-412b-b7e5-d4c8178e62bc","year":null},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:08.955070Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:bb08db12f459340204f723f1b1f553740a042182307c1823cd96607295b1ffb5","observation_id":"6d5b7cc0-36d0-49a5-b056-15b24638ebc9","resolution":{"observed_at":"2026-08-07T12:32:12.303888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:12.009148Z","title":"Online to offline conversions, universality and adaptive minibatch sizes,","venue":null,"work_id":"c4e18aef-f977-4c06-8c66-a634c8affa7a","year":2017},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.039195Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:9adaa3b7f0833fd6b15880fe6c65d6fe3f7abd4dcc99e0b75352d509e9abcdb5","observation_id":"baefaa49-6c9a-4aad-a1ed-a5605369138d","resolution":{"observed_at":"2026-08-07T12:32:12.107206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.881396Z","title":"Adagrad stepsizes: Sharp conver- gence over nonconvex landscapes,","venue":null,"work_id":"8509c81b-380c-4cff-8a25-852f38af5c2a","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.118026Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:135587f108e15cfc10504808cb344710e3d3c2ec7717c04682f3993402e48dfb","observation_id":"c216cb0c-b19d-43eb-97b5-752ebc2472cd","resolution":{"observed_at":"2026-08-07T12:32:11.926845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.168263Z","title":"A sufficient condition for convergences of adam and rmsprop,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.168263Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:5722dc9913fcdf31413a20ef927a7f610e9d84ffdc3113a2eddddf327b19e463","observation_id":"bcdace04-800e-4a28-90c6-85e2170d6709","resolution":{"observed_at":"2026-08-07T12:32:09.168263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.677775Z","title":"Iteration complexity of randomized block- coordinate descent methods for minimizing a composite function,","venue":null,"work_id":"d166ebda-5220-4e39-a2ab-14c4f151f66a","year":2014},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.266884Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:b7c738d22617e03d123eb322fe6413e015542323bcaf658b63586f006d56f925","observation_id":"b37270b4-21e6-44a6-9b64-748782f9bcc2","resolution":{"observed_at":"2026-08-07T12:32:11.750407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07114","last_updated":"2024-02-11T06:21:18Z","snapshot_observed_at":"2026-07-06T17:28:31.413289Z","submitted_at":"2024-02-11T06:21:18Z","title":"Towards Quantifying the Preconditioning Effect of Adam","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07114","snapshot_observed_at":"2026-08-07T12:32:09.342636Z","title":"Towards quantifying the preconditioning effect of adam,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.342636Z"},"links":{"cited_paper":"/paper/2402.07114","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:073a34ae0e8c81e2a5b8dbc518cc65d45e2228cf0161995d02818b02c79acd64","observation_id":"d405c03b-d678-4e81-8188-b51250455d11","resolution":{"observed_at":"2026-08-07T12:32:09.342636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.490869Z","title":"Robust- ness to unbounded smoothness of generalized signsgd,","venue":null,"work_id":"565f83ee-02a5-432d-a064-27dd0df1a37d","year":2022},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.421215Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:7228ece7191cc0d291dc08c4acec71d0ceead795bad889b3d776df52a362a6b3","observation_id":"af036d5b-075c-4143-88e5-2d06c5aee956","resolution":{"observed_at":"2026-08-07T12:32:11.575857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.512342Z","title":"Gradient-based learning applied to document recognition,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.512342Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:708ed82e494099b89fca9cf3cc7e6a3a294010e5323142c7423f3fe1a068ebe2","observation_id":"ab517c8a-c1e3-4390-8037-74d41a710ed5","resolution":{"observed_at":"2026-08-07T12:32:09.512342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:09.605342Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.605342Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:088cc30908944e409028028e74fe18f7edca45d2e301653c52d0c8e176e220a3","observation_id":"ecface3b-421c-4b41-a51b-b716c654e726","resolution":{"observed_at":"2026-08-07T12:32:09.605342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:11.196853Z","title":"Why are adaptive methods good for attention models?","venue":null,"work_id":"ef6b40ae-9917-475c-96d0-cc01432c2530","year":2020},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.710987Z"},"links":{"citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:8aa9f82b02967a805d829b8f7b814f8d1c77bab5b8604b88b1454e518f09554a","observation_id":"8b85ff26-7427-4fc5-a9bd-5d5712ba7017","resolution":{"observed_at":"2026-08-07T12:32:11.340852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T12:32:09.807584Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:09.807584Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:682827fb970dbad6e9831f4a4ed0882014ea966b20252379895dc96053183095","observation_id":"acf80601-11ef-404c-9cb6-8441dd8ca7e4","resolution":{"observed_at":"2026-08-07T12:32:09.807584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":6,"verified_fuzzy":34},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2505.24399."}