{"as_of":"2026-08-12T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6536e62348f9264affc119ff2f3fe2322bcfe4de777ec4c041af377795dc793","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:23:05.364651Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:34:48.195468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T05:37:19.252093Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"cited_work":{"arxiv_id":"2412.19529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonconvex stochastic optimization under heavy-tailed noises: Optimal convergence without gradient clipping","venue":null,"work_id":"2329ea9b-97ac-43ee-a35e-c85f624f29e7","year":2024},"citing_paper":{"arxiv_id":"2605.11850","last_updated":"2026-05-12T09:36:13Z","snapshot_observed_at":"2026-08-11T10:43:39.565980Z","submitted_at":"2026-05-12T09:36:13Z","title":"Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:34:48.195468Z"},"links":{"cited_paper":"/paper/2412.19529","citing_paper":"/paper/2605.11850"},"observation_digest":"sha256:bffeaa1b77be6b406532c902a757df8d29924dc0e46260d0f2693c68182cbdc8","observation_id":"411c530c-4a62-4b55-a653-5c317d1eed7e","resolution":{"observed_at":"2026-05-13T05:37:19.253844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.19529/citation-record","integrity":"/paper/2412.19529/integrity","json":"/paper/2412.19529/citation-record.json","paper":"/paper/2412.19529"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.160353Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.160353Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:7847c8fd1e4fe442d1a7e9aa1760d722470c87b18916dba422dd3971bec0ca1a","observation_id":"0fc28118-baf3-49a6-b1eb-9b8ff1e4a8eb","resolution":{"observed_at":"2026-08-11T00:23:05.160353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.165327Z","title":"Lower bounds for non-convex stochastic optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.165327Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:9a7c38b8bb1f53dc189f8e41702e7988d47c788f928d7f2e0c342801feb1d94f","observation_id":"24bcfccf-0945-4922-83e1-30dc3419e7ef","resolution":{"observed_at":"2026-08-11T00:23:05.165327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.170048Z","title":"Optimization methods for large-scale machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.170048Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:ed0658f68f1c92b7f27ed4d2cb495c54d4744e66c3a4215ea950b9632a236e3d","observation_id":"d3ad11f4-6b02-432f-9a2e-524cc9b75066","resolution":{"observed_at":"2026-08-11T00:23:05.170048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:06.001792Z","title":"Extrapolation and interpolation of quasi-linear operators on martingales","venue":null,"work_id":"0a6cb3c3-2a70-4406-b682-c2541a21b1ca","year":1970},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.174249Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:b1d7315644b3b65ccb7088f36958d838f14c441a070dff278730fc8e116424d9","observation_id":"fc9be62a-f9e0-4c6e-9034-0fac49ad27a5","resolution":{"observed_at":"2026-08-11T00:23:06.005562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.991129Z","title":"Martingale transforms","venue":null,"work_id":"b3896d6e-56eb-4af5-9c2b-bd24469a6caa","year":1966},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.178054Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:061a6f86ae972823ce839a725bc2b6ec7380d8fb94ab25e506e07155a562dd21","observation_id":"a04d6d5b-be21-48a0-9ad1-7c5435dcad12","resolution":{"observed_at":"2026-08-11T00:23:05.994834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.978955Z","title":"Lower bounds for finding stationary points i","venue":null,"work_id":"60be04f5-f59e-4f98-bf05-489c576f8696","year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.181956Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:c6af37bc573752db4e7b506017f0b0c106a908f15d7b5a76f9b0a7d59a3b2a5a","observation_id":"ad4242fa-2a07-4bc1-be10-f72ca3ff91d1","resolution":{"observed_at":"2026-08-11T00:23:05.983749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.967541Z","title":"Generalized-smooth nonconvex optimization is as efficient as smooth nonconvex optimization","venue":null,"work_id":"8a114a09-1ea6-4f4e-99a7-d0dea67709c7","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.185848Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:0750c43f7d963575308a6f0ed045c7a323dd4352fb09a20792b6c3e9c36fb47a","observation_id":"2b4ca97b-f132-46bd-9581-fe7ede0f56e8","resolution":{"observed_at":"2026-08-11T00:23:05.971418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.956753Z","title":"Robustness to unbounded smoothness of generalized signsgd","venue":null,"work_id":"395c50cf-e77a-473b-b8f4-68e9fa3ed7a1","year":2022},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.190382Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:d1e582afd36fa78a7e28348b980d20069c1985c8bb2eef45a34a003100c76324","observation_id":"ad5105ba-d011-475e-91a7-7c4bba9741f7","resolution":{"observed_at":"2026-08-11T00:23:05.960483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.945756Z","title":"Momentum improves normalized SGD","venue":null,"work_id":"c2dc11ad-dc90-47bf-ade9-934e28b2a538","year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.195061Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:a91d8e732ec27b0fd794b8a7eaeb641dd230005f29538708106eed31913bed9c","observation_id":"2c750b12-965d-46cb-9e03-0e660ef42e10","resolution":{"observed_at":"2026-08-11T00:23:05.949463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.935082Z","title":"High-probability bounds for non-convex stochastic optimization with heavy tails","venue":null,"work_id":"117f8308-c19a-47ab-90bb-82d03bbfd3ce","year":2021},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.198729Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:e5737a2f88613acb5baf2730d8068ce5642297eae33ac1a7d0453ccd4fefb01a","observation_id":"a16ab0f0-9084-4c36-aa29-4531ae374c28","resolution":{"observed_at":"2026-08-11T00:23:05.938843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.924728Z","title":"On the intergrability of the martingale square function","venue":null,"work_id":"d0c87660-65f1-43af-a632-33e6d5b7b408","year":1970},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.202455Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:076758d8f9f2bca6c4650d0fca9be4e410035ae3e961ba857e16658649448d50","observation_id":"80b17b9a-bb29-414c-9873-9c2b50e97c26","resolution":{"observed_at":"2026-08-11T00:23:05.928488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.206190Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.206190Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:2f42ab3d0ba690435adcd094f6cdd5d9b77802c0d6d00c81ebf1d2b0eb9e3bf5","observation_id":"afd19ac1-36ca-4c2c-8f98-181502c26e4b","resolution":{"observed_at":"2026-08-11T00:23:05.206190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.908060Z","title":"Beyond uniform smoothness: A stopped analysis of adaptive sgd","venue":null,"work_id":"f225cce1-8799-4605-bf65-2410e6904df0","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.209701Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:3027ef6503948d0f3fdbf2afdc94b5281e3445fb7796d9621369ffc79507e33d","observation_id":"58aea4d7-3ec7-4d56-8a4e-71a109f52808","resolution":{"observed_at":"2026-08-11T00:23:05.911746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.213244Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.213244Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:346403618b370f13a1fc141cbe7fc589246aa6b8afb3200068e0e37e628e113f","observation_id":"35ad4cc9-880d-4bf3-8011-0a57d2d20282","resolution":{"observed_at":"2026-08-11T00:23:05.213244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.891728Z","title":"High-probability convergence for composite and distributed stochastic minimization and variational inequalities with heavy-tailed noise","venue":null,"work_id":"250f034f-ac76-4416-bc45-4884115352a3","year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.216626Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:c949042b8628dea2da2d5efb51de42437da998514107fc1caa8f3aa4c78e4b62","observation_id":"f6c1cbb4-d6d2-4e45-a082-e09f526ac253","resolution":{"observed_at":"2026-08-11T00:23:05.895550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.220660Z","title":"Beyond convexity: Stochastic quasi-convex optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.220660Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:7894d2ac3d17baa24435e69f55d34837d1d6b065999c9595c54080e3b51bb073","observation_id":"75b954ad-2c0f-4a4a-a7f2-e71bf02b0ded","resolution":{"observed_at":"2026-08-11T00:23:05.220660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13794","last_updated":"2024-09-13T13:28:04Z","snapshot_observed_at":"2026-08-10T20:11:47.948779Z","submitted_at":"2024-02-21T13:24:14Z","title":"Revisiting Convergence of AdaGrad with Relaxed Assumptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13794","snapshot_observed_at":"2026-08-11T00:23:05.225264Z","title":"Revisiting convergence of adagrad with relaxed assumptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.225264Z"},"links":{"cited_paper":"/paper/2402.13794","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:4d60f3a48c525cc3497fdb187fbc28fa9f2d4ea6e097773784cba40bbb1b2c12","observation_id":"ee49d851-ff89-406e-a56a-2afb4caed0c7","resolution":{"observed_at":"2026-08-11T00:23:05.225264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13849","last_updated":"2025-07-09T12:01:30Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:01Z","title":"From Gradient Clipping to Normalization for Heavy Tailed SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13849","snapshot_observed_at":"2026-08-11T00:23:05.229100Z","title":"From gradient clipping to normalization for heavy tailed sgd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.229100Z"},"links":{"cited_paper":"/paper/2410.13849","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:f751d7742c2888d912719abc21640c03612dd71ac54f52a938fe93ccbff378b6","observation_id":"1a407fcb-ee45-407f-bae5-678c604665f2","resolution":{"observed_at":"2026-08-11T00:23:05.229100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.875070Z","title":"Parameter-agnostic optimization under relaxed smoothness","venue":null,"work_id":"597b7804-7813-4abf-b604-2bd715491731","year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.233151Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:c94618da04f1c63311ad41f375194e6079590d86f033560e15257974b97e1e69","observation_id":"8ee79d4f-0f3a-4261-827b-e32fd7b80bba","resolution":{"observed_at":"2026-08-11T00:23:05.879086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.864087Z","title":"Non-convex distributionally robust optimization: Non-asymptotic analysis","venue":null,"work_id":"54e4f906-8627-45db-b3d3-984db47f0c79","year":2021},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.236891Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:6aebc38de5fab78f1769412cfeda218b0fa6a6bc11e274478bdeb05ca22066c6","observation_id":"77125654-26d1-4b33-8fa1-ae009d22de61","resolution":{"observed_at":"2026-08-11T00:23:05.868128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T00:23:05.240285Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.240285Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:4090b09e6effc4916785b85976f6dc00c164e2f0c8a97ce52237fcd0fc2e5f1b","observation_id":"46a386e5-9403-452e-a034-af1360ef99b3","resolution":{"observed_at":"2026-08-11T00:23:05.240285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.853355Z","title":"Convergence and efficiency of subgradient methods for quasiconvex minimization","venue":null,"work_id":"8529ff80-005f-4f63-8436-ff13311f8cbb","year":2001},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.243723Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:6a488476449dbef04e777349eaf802f026ce8ec23a10db8e7545bb200200ae9d","observation_id":"638ce608-afd1-4407-9a37-5c6c522e82ea","resolution":{"observed_at":"2026-08-11T00:23:05.857095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.841949Z","title":"Accelerated zeroth-order method for non-smooth stochastic convex optimization problem with infinite variance","venue":null,"work_id":"de7b8024-ce20-48a7-b2e1-2d78bc729d3d","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.247430Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:e3c0c98cbcafca0e404ff65ebe82ced9cb66259fbdf94ce1b367ee4f43a36b9a","observation_id":"5fa88c4b-f563-4aae-bc01-ea316aca6af1","resolution":{"observed_at":"2026-08-11T00:23:05.845941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.250868Z","title":"First-order and stochastic optimization methods for machine learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.250868Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:a214ab4351a4a3db2f4d8d96066fd690fd3590d7cf8f5a6a7fd47f5494bbbba8","observation_id":"ebd65b1a-f0c5-4cf6-a42e-a3ce8600a10e","resolution":{"observed_at":"2026-08-11T00:23:05.250868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.04831","last_updated":"2016-11-15T13:56:24Z","snapshot_observed_at":"2026-08-06T21:38:44.874589Z","submitted_at":"2016-11-15T13:56:24Z","title":"The Power of Normalization: Faster Evasion of Saddle Points","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.04831","snapshot_observed_at":"2026-08-11T00:23:05.255061Z","title":"The power of normalization: Faster evasion of saddle points","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.255061Z"},"links":{"cited_paper":"/paper/1611.04831","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:2a6a529598db9198480f29b1497b4c45d4835d53a662c8d83dc7b9a7d906755f","observation_id":"a0ca87c4-de89-4b4b-af29-4e7be5e90b01","resolution":{"observed_at":"2026-08-11T00:23:05.255061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.824765Z","title":"Convex and non-convex optimization under generalized smoothness","venue":null,"work_id":"da5ab0fc-5caa-4651-ba6e-c982cedf3a37","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.258995Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:d9963dde44a21ee75d06b67654949544b48a7994a639031f9cb0e077298ce985","observation_id":"132f5c5f-bb67-4e2a-80ea-35306b4bf7d1","resolution":{"observed_at":"2026-08-11T00:23:05.828707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.813370Z","title":"Convergence of adam under relaxed assumptions","venue":null,"work_id":"23f47713-85c2-4d5b-b30f-74ecffe0cc17","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.262381Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:b52a3141ec6b4126a5a147be4408cd3e218956c83c8c5a2a9ae93ed8a4c38c61","observation_id":"e3645a8f-7a53-4e4c-978f-e0e5c03231de","resolution":{"observed_at":"2026-08-11T00:23:05.817103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.802101Z","title":"High-probability bound for non-smooth non-convex stochastic optimization with heavy tails","venue":null,"work_id":"4f86df4e-271f-4c9e-973b-d0879b013727","year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.266084Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:e8b3f48cc885c14c63ee876899fc1d5b4b3dec17e16a4ed26c983dd7fa199937","observation_id":"81e46ea8-f965-42e2-9c13-137eec65ac64","resolution":{"observed_at":"2026-08-11T00:23:05.806122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12277","last_updated":"2023-05-20T04:12:11Z","snapshot_observed_at":"2026-08-11T00:42:27.327821Z","submitted_at":"2023-03-22T03:05:28Z","title":"Stochastic Nonsmooth Convex Optimization with Heavy-Tailed Noises: High-Probability Bound, In-Expectation Rate and Initial Distance Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12277","snapshot_observed_at":"2026-08-11T00:23:05.269460Z","title":"Stochastic nonsmooth convex optimization with heavy-tailed noises","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.269460Z"},"links":{"cited_paper":"/paper/2303.12277","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:14c2df82c6564b3f1020dea88ddc1f47ed6a8b178c601f4d22afb30529bef21c","observation_id":"9b9e4e8e-941d-4737-9bfa-7d0161702bc8","resolution":{"observed_at":"2026-08-11T00:23:05.269460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06032","last_updated":"2023-10-28T03:26:32Z","snapshot_observed_at":"2026-08-12T12:51:43.310595Z","submitted_at":"2023-02-13T00:22:28Z","title":"Near-Optimal Non-Convex Stochastic Optimization under Generalized Smoothness","version":2},"cited_work":{"arxiv_id":"2302.06032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06032","snapshot_observed_at":"2026-08-11T00:23:05.556712Z","title":"Near-Optimal Non-Convex Stochastic Optimization under Generalized Smoothness","venue":"cs.LG","work_id":"dc36c88e-80de-4fad-b34b-8002fe469f54","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.273144Z"},"links":{"cited_paper":"/paper/2302.06032","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:4b130d304442521e1f4017b0c0f75081d458ffa53fcaa9dc2ea66d7ab1fb7139","observation_id":"011f68f0-915a-4656-ba06-fdcf2690a83b","resolution":{"observed_at":"2026-08-11T00:23:05.562657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.790847Z","title":"Breaking the lower bound with (little) structure: Acceleration in non-convex stochastic optimization with heavy-tailed noise","venue":null,"work_id":"4394587b-5448-45f1-8534-71f2fe968408","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.276793Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:85eef79751c970ac0c41b14354d0ca683f3ae92c35bd81c4d7a31e1adbe93490","observation_id":"80e220e5-3bbd-4626-8174-1ce74974eca4","resolution":{"observed_at":"2026-08-11T00:23:05.795062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.780132Z","title":"Brendan McMahan and Matthew J","venue":null,"work_id":"ff24bf81-d604-46cd-806c-275bc6c2d958","year":2010},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.280377Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:61d90814abb1a3780ab9a6a365ccaeb66657a5f7644ca09adae3817ddc569ad4","observation_id":"8c848301-a694-4ceb-a6c3-bd1c76924c35","resolution":{"observed_at":"2026-08-11T00:23:05.783834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.769316Z","title":"Convergence of gradient descent on separable data","venue":null,"work_id":"3b91c140-f450-4354-9e25-73494e124026","year":2019},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.283937Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:ed9ba3d1b5071f71837d820c5b9ae726a48b4af66533f9fcbb3ddf5c051fc6f5","observation_id":"95a200f2-69dc-4234-98d9-d6fb1b0aa4cd","resolution":{"observed_at":"2026-08-11T00:23:05.773141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.287926Z","title":"Lectures on convex optimization, volume 137","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.287926Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:3ea5d22356e5ce72571aedc6b572db3e751448cdea0dbb89a91c803a0164bc02","observation_id":"339e4444-5c6e-4323-ac52-d31237d0a8d7","resolution":{"observed_at":"2026-08-11T00:23:05.287926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.291488Z","title":"Minimization methods for nonsmooth convex and quasiconvex functions","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.291488Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:edc5e808d749f74de57ae78092994aa748d122c0fd38330459a292d36dc3e9c3","observation_id":"fd650228-1fa1-4104-994f-d706340f71d2","resolution":{"observed_at":"2026-08-11T00:23:05.291488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.743239Z","title":"Improved convergence in high probability of clipped gradient methods with heavy tailed noise","venue":null,"work_id":"ec4d4789-240d-4586-97c9-bca9c3f6aa6d","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.296096Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:7f41473436abde1e7bc2dd8bccf45269bf6ae63fc56b7c8e0813c9cdfc48b7b2","observation_id":"e66b33ec-86c6-4d0d-a181-cb0598653329","resolution":{"observed_at":"2026-08-11T00:23:05.747536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.732033Z","title":"Breaking the heavy-tailed noise barrier in stochastic optimization problems","venue":null,"work_id":"39f0b410-5b18-48f8-b602-ce12fe3dc6f5","year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.299813Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:d8c18bea59f3d04808667b5ec0f0e036e12192af8583347975f5dd97a5d9828f","observation_id":"62e710e2-5c40-4598-b580-5d1b39161451","resolution":{"observed_at":"2026-08-11T00:23:05.735972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.721378Z","title":"On equivalence of martingale tail bounds and deterministic regret inequalities","venue":null,"work_id":"d591971a-f01b-424b-923e-e1b2a4e2eacd","year":2017},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.303409Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:de3135ecb2ec6f56407f842fb7284645dae43adaf68246e6f300fd5d9390fd06","observation_id":"5b44bcd0-0498-4aee-ab37-f4294002ddf1","resolution":{"observed_at":"2026-08-11T00:23:05.725144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.307200Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.307200Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:ec4cf168a10c65758b9a36dcddf1a9cb65bd8f97426d96003e1edd56b288840b","observation_id":"1f43cce4-4eeb-450d-bbb9-3781d43cb2a0","resolution":{"observed_at":"2026-08-11T00:23:05.307200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.703355Z","title":"High-probability bounds for stochastic optimization and variational inequalities: the case of unbounded variance","venue":null,"work_id":"aea0f684-88df-4172-a0ba-b54d091ce2b0","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.310737Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:86f4cbf12e20fccdd93f3184255d6bf913f7743b989b0af60c35709a8d14b81d","observation_id":"262ab119-b5b0-4809-9591-85ae4bcf5d8f","resolution":{"observed_at":"2026-08-11T00:23:05.707260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.00018","last_updated":"2019-11-29T16:56:02Z","snapshot_observed_at":"2026-07-06T08:40:59.491813Z","submitted_at":"2019-11-29T16:56:02Z","title":"On the Heavy-Tailed Theory of Stochastic Gradient Descent for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.00018","snapshot_observed_at":"2026-08-11T00:23:05.314264Z","title":"u rb \\\"u zbalaban, Thanh Huy Nguyen, Ga \\","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.314264Z"},"links":{"cited_paper":"/paper/1912.00018","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:2c19afbf3d6920d7c0b61c91650947f8cd8dfbdf78633bb03a93763114e96070","observation_id":"13d035c6-4109-4359-8599-e2fe27fa8e5d","resolution":{"observed_at":"2026-08-11T00:23:05.314264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.692511Z","title":"A tail-index analysis of stochastic gradient noise in deep neural networks","venue":null,"work_id":"b64cb4cb-61c1-41da-b794-bd79a92282dd","year":2019},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.318112Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:aea89c067a72aaf23440f655c5f44616a3be26e88ee839629259a783a0b51946","observation_id":"d6f61eb8-111b-476c-acda-1c1211037043","resolution":{"observed_at":"2026-08-11T00:23:05.696259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.321472Z","title":"Gradient normalization provably benefits nonconvex sgd under heavy-tailed noise","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.321472Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:c9bf93fdb7f552a41ff2b91362892ccf0b283a34ac65c4076478ec21f613e6e1","observation_id":"0afb4bcc-8ae6-46d0-b042-7fc16b8c506d","resolution":{"observed_at":"2026-08-11T00:23:05.321472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.325034Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.325034Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:7bf10315a02c22f037ba8ac5a054da78adbdadbcdca0ec33a69b406d3561872f","observation_id":"d1a17774-fafa-4920-8f77-1e7301bea51e","resolution":{"observed_at":"2026-08-11T00:23:05.325034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.675537Z","title":"Convergence of adagrad for non-convex objectives: Simple proofs and relaxed assumptions","venue":null,"work_id":"774b4295-9653-4c9f-83c2-bbae4dc3e877","year":2023},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.328428Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:e58514a3266950d6fa67d0de18eccacd8f15547b25227d92c0aac9f90b6b15e7","observation_id":"30285a24-ec49-4c23-acc5-adf26fa2ae50","resolution":{"observed_at":"2026-08-11T00:23:05.679329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15146","last_updated":"2024-03-22T11:57:51Z","snapshot_observed_at":"2026-07-06T17:48:59.440247Z","submitted_at":"2024-03-22T11:57:51Z","title":"On the Convergence of Adam under Non-uniform Smoothness: Separability from SGDM and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15146","snapshot_observed_at":"2026-08-11T00:23:05.332066Z","title":"On the convergence of adam under non-uniform smoothness: Separability from sgdm and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.332066Z"},"links":{"cited_paper":"/paper/2403.15146","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:29961076682ecdb11e8a2627a60afadb9a34766b64532281dbea607974fb5e75","observation_id":"3ea02deb-cf8d-4a4e-acb3-1c5831536187","resolution":{"observed_at":"2026-08-11T00:23:05.332066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-11T00:23:05.335736Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.335736Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:9655fa1a4cf9d83f23ca0ed5f0e36eaafae323e64bdd0cec89923ff903f90e7e","observation_id":"807b14e1-fd80-477c-832e-25c3c34487bf","resolution":{"observed_at":"2026-08-11T00:23:05.335736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-11T00:23:05.339526Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.339526Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:21d2feab38c395412f218ebf7b116606bce0ba3ccd9fdf843ead35b93c5fe6f3","observation_id":"3b9e8fe4-1f53-4c19-af55-00a91c1fa4b4","resolution":{"observed_at":"2026-08-11T00:23:05.339526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.343597Z","title":"Improved analysis of clipping algorithms for non-convex optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.343597Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:aa349e47e71a03d36eda302377707d3de3cec534047835c81cdfe8073b347f34","observation_id":"dc5a44f9-b838-4056-9a91-5a5472e3f179","resolution":{"observed_at":"2026-08-11T00:23:05.343597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.658639Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":"79b510d0-9ae7-4229-b690-06eba7da0bc5","year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.346964Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:cd6e95779f8544135f8743c0d6a03a2671cbbadc1081488ed6c1d34aefce2e04","observation_id":"41ec6a0c-d5c0-421d-b1dd-170400ff3825","resolution":{"observed_at":"2026-08-11T00:23:05.662393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.350245Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020 c","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.350245Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:6282443c8e1339ed095432b5431da528ef3931452bdfae9903b5a98571943158","observation_id":"1e9764ac-5c63-4251-b2a9-30925eb9bfb2","resolution":{"observed_at":"2026-08-11T00:23:05.350245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.641232Z","title":"Parameter-free regret in high probability with heavy tails","venue":null,"work_id":"4ada704e-1f70-4f23-b5a7-fe5dd9321d4b","year":2022},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.353870Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:9aaa9f524800428b33f2d85ff708314d71bac60046881a4ca9833a75e768b77a","observation_id":"b318596c-0bea-45b7-889a-c199c38b5511","resolution":{"observed_at":"2026-08-11T00:23:05.645301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.357279Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.357279Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:80e52965ae9ee5cea63476e4973af6397288fc12459d55869fc724ec5c42eb67","observation_id":"60e2cdf6-d79d-4105-89e5-052ddd30fd9d","resolution":{"observed_at":"2026-08-11T00:23:05.357279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.360942Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.360942Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:19eb6d38da78ec93d147ba7c149868f93226d6be54fce0a75c9aeceeb9db0a36","observation_id":"e5e25932-8001-4f9d-a7f1-8691e04d1534","resolution":{"observed_at":"2026-08-11T00:23:05.360942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:23:05.617861Z","title":"denotes the set of natural numbers (excluding 0 )","venue":null,"work_id":"76a19963-42c2-4d66-ab0e-d5f70df2b035","year":null},"citing_paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T00:23:05.364651Z"},"links":{"citing_paper":"/paper/2412.19529"},"observation_digest":"sha256:123f83b6396677aa1e9769d6dc7efd335e81093251e1019701904fa39c14c191","observation_id":"e6d7eb5e-8a71-4dee-8029-dab6d8102179","resolution":{"observed_at":"2026-08-11T00:23:05.621655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19529","last_updated":"2025-05-29T03:42:49Z","latest_version":4,"primary_category":"math.OC","snapshot_observed_at":"2026-08-12T11:48:25.205232Z","submitted_at":"2024-12-27T08:46:46Z","title":"Nonconvex Stochastic Optimization under Heavy-Tailed Noises: Optimal Convergence without Gradient Clipping"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2412.19529."}