{"as_of":"2026-08-09T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfad2757229d300b6462bc3209f076c7d00b91f414e0acd3016c6c2b7c0b60d1","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:21:03.040227Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.05657/citation-record","integrity":"/paper/2602.05657/integrity","json":"/paper/2602.05657/citation-record.json","paper":"/paper/2602.05657"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-03T04:20:54.416850Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.416850Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:3cc396fef8162e411d74f367f19957967e721677b1450d16f709f886aa9bd729","observation_id":"c872434e-6588-4d31-b88b-f01ff1233cf8","resolution":{"observed_at":"2026-08-03T04:20:54.416850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.471922Z","title":"A stochastic approximation method,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.471922Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:5e8c197171a465f928de331da8c6bd76ad15bda1ef702811ba8f4377e5198fca","observation_id":"eba39e29-0a00-42b0-bb40-40177a1b3f12","resolution":{"observed_at":"2026-08-03T04:20:54.471922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.570116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.570116Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:2902a5df99642df0e38b99f99b03ad083ff88b1cf1323f8eed87a8d3bf7f80df","observation_id":"1e9e8c6c-ad36-4de8-bc90-e10b953e03ce","resolution":{"observed_at":"2026-08-03T04:20:54.570116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.652016Z","title":"Robust stochastic approximation approach to stochastic programming,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.652016Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:e3bc09fb21e8f4e055106f05afbc1495995aec7a6a9f848bf453ac0e44067b63","observation_id":"d8aa6507-dfbe-463f-b2e8-9f1145e80615","resolution":{"observed_at":"2026-08-03T04:20:54.652016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.734870Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.734870Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:52115337f322e7e00800e90335b3c34a40080bfd5159207b5b49ac343de4abc2","observation_id":"0d778fd5-bff3-4e86-93e8-658bf12b2bc7","resolution":{"observed_at":"2026-08-03T04:20:54.734870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.774131Z","title":"Lower bounds for non-convex stochastic optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.774131Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:df1760944ea0fdf6a17673eea12778bed9272bdff05a247fe3d5a5f0e84280b1","observation_id":"af8dd58e-ae79-4af6-98c3-ed660300f127","resolution":{"observed_at":"2026-08-03T04:20:54.774131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.831118Z","title":"Imagenet classification with deep convo- lutional neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.831118Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:7981aa6bfd3538cb0603cc9b7ec4e8d9e94f52469b7abb5d8d9c39862201b3db","observation_id":"75a4c71e-e74a-4e34-8adc-ba3c30b265c2","resolution":{"observed_at":"2026-08-03T04:20:54.831118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.888334Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.888334Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:6300cf3a795fc1f77588dc9f39d4462f8f14c47cfa247462df52bb339ced496a","observation_id":"0f81d109-a3d5-4b01-a215-ccb5ddac9b1d","resolution":{"observed_at":"2026-08-03T04:20:54.888334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.941798Z","title":"BERT: Pre-training of deep bidirec- tional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.941798Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c97eb37ef4358fa16d7b50bfeff1d5b47c2d7c4a8cca08a2e27a0a1c457392e3","observation_id":"754309e0-1efd-49e1-8b92-cdbf9616877f","resolution":{"observed_at":"2026-08-03T04:20:54.941798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:54.993367Z","title":"Training Compute-Optimal Large Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:54.993367Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:845530748634655de38f0f2814c72a2be16bfba6e1f549c2f9a22cc2668a139b","observation_id":"8335058d-9871-4fab-b229-aeb4df32a206","resolution":{"observed_at":"2026-08-03T04:20:54.993367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.077931Z","title":"Dembo and O","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.077931Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:d1cbb2a526bdfa0efac81fde2b62dd0dd04549ec8e6bff2bd95b26a87e43544f","observation_id":"9a10a911-3a46-4e57-8ada-fcb23504c8d1","resolution":{"observed_at":"2026-08-03T04:20:55.077931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.153059Z","title":"High probability conver- gence of stochastic gradient methods,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.153059Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:dbe555b38ff1d2597ec82dc7c30c843a44f6372a2ef31b1d0211077e3431e048","observation_id":"0ef98f80-6695-44fc-b266-d2cd21e9f1b6","resolution":{"observed_at":"2026-08-03T04:20:55.153059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.234141Z","title":"High-probability bounds for non-convex stochastic opti- mization with heavy tails,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.234141Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:359fee66debd78d64db40919737da14f9cc954a8965ddf4fe8274bd2c7833818","observation_id":"bfad895f-644d-46b5-b70f-d022f7d7e89d","resolution":{"observed_at":"2026-08-03T04:20:55.234141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.316099Z","title":"Improved convergence in high probability of clipped gradient methods with heavy tailed noise,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.316099Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:a3647e16704f2c6acaadd25a4aea4d9fb0c409f4734000b049d3a49bb0bdae58","observation_id":"396856df-3f56-4ff8-91ef-e2b9d2d81fa5","resolution":{"observed_at":"2026-08-03T04:20:55.316099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.423784Z","title":"Optimal High-probability Convergence of Nonlinear SGD under Heavy-tailed Noise via Symmetrization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.423784Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:e7b8fc63b5631ebafe9a5c97f28abb673ca6309da1efcb1df8876638683a4de7","observation_id":"b4421911-7790-4621-ae77-5c436ef5e2e6","resolution":{"observed_at":"2026-08-03T04:20:55.423784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.572000Z","title":"Large Deviation Upper Bounds and Improved MSE Rates of Nonlinear SGD: Heavy-Tailed Noise and Power of Symme- try,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.572000Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:d3608cb1a4d2b8edd6282c23ce9b1a41c0879f304fabee8f27a9e9f6f5f71043","observation_id":"28a3e9b4-add9-4611-a215-a3d681a7611d","resolution":{"observed_at":"2026-08-03T04:20:55.572000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.655572Z","title":"Armacki,High-Probability and Large Deviations Techniques for Design and Analysis of Large-Scale and Distributed Learning Systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.655572Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:da4cc6006b6821b98dd1545ebc096d9cfbb2444655068d1355a850e3afa51f56","observation_id":"ae534bf0-48f0-4482-ad79-fb7e3be927c6","resolution":{"observed_at":"2026-08-03T04:20:55.655572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.787873Z","title":"An optimal method for stochastic composite optimization,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.787873Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:039d72c50aef906c755a8b135918578f2af809a24692ad8304db24c3e0dccb0d","observation_id":"2b5e3b03-86de-4bd4-b951-d5071b2f6857","resolution":{"observed_at":"2026-08-03T04:20:55.787873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.895987Z","title":"Beyond the regret minimization barrier: optimal algorithms for stochastic strongly-convex optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.895987Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4e94284fc98829bcc79e8f772c29c6118cc7e4fb9792e37ac62419c397a5fab7","observation_id":"cbb2ef33-6a8e-4c41-9189-47f27aa300a4","resolution":{"observed_at":"2026-08-03T04:20:55.895987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:55.991002Z","title":"Tight analyses for non-smooth stochastic gradient descent,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:55.991002Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:69ba04002528f8834a219676c7175e5fed98ec72372b3517d6e75cd75457e115","observation_id":"5b6dea72-b49f-4779-bbcd-512ee5a3212c","resolution":{"observed_at":"2026-08-03T04:20:55.991002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.072097Z","title":"A high probability analysis of adaptive sgd with momentum,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.072097Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4035c9d6d896412e08dd24cf05e708271a04912cf532cb2809945f935189ff70","observation_id":"0232f455-3402-4b5c-8748-a7083cee9d57","resolution":{"observed_at":"2026-08-03T04:20:56.072097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.126453Z","title":"Revisiting the Last-Iterate Convergence of Stochastic Gradient Methods,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.126453Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:76ebc0c1d9ef2116056dba48455e7a2cb47b5ce98837738089a0ab2d8c300e10","observation_id":"2f5dafa8-adb9-4670-aebb-24821d3da842","resolution":{"observed_at":"2026-08-03T04:20:56.126453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.227940Z","title":"Stochastic optimization with heavy-tailed noise via accelerated gradient clipping,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.227940Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:65f9b757a720c6e1affeffc34a3df8ea5392fd4d644cfbff7c35d984faf19e02","observation_id":"6a8c36bd-cffa-4863-937d-ce2f054e0420","resolution":{"observed_at":"2026-08-03T04:20:56.227940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05958","last_updated":"2024-08-30T13:35:31Z","snapshot_observed_at":"2026-08-01T22:45:18.859486Z","submitted_at":"2021-06-10T17:54:21Z","title":"High Probability Complexity Bounds for Non-Smooth Stochastic Optimization with Heavy-Tailed Noise","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05958","snapshot_observed_at":"2026-08-03T04:20:56.309480Z","title":"Near-optimal high probability complexity bounds for non-smooth stochastic optimization with heavy- tailed noise,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.309480Z"},"links":{"cited_paper":"/paper/2106.05958","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:7f1de410d4f661d6bfa153108cc5eff09dd9459f6526a6937a5aef5e6ac836ac","observation_id":"5e6d2cc4-fa2e-4530-81dd-b9625ba37f25","resolution":{"observed_at":"2026-08-03T04:20:56.309480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08567","last_updated":"2024-04-14T21:29:23Z","snapshot_observed_at":"2026-08-04T09:54:55.662157Z","submitted_at":"2022-08-17T23:05:05Z","title":"High Probability Bounds for Stochastic Subgradient Schemes with Heavy Tailed Noise","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08567","snapshot_observed_at":"2026-08-03T04:20:56.398349Z","title":"High probability bounds for stochas- tic subgradient schemes with heavy tailed noise,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.398349Z"},"links":{"cited_paper":"/paper/2208.08567","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:d75f00a50003bcc724a48db9b1b6b51cd4cc516237c074fb9dd4cfe231c452ca","observation_id":"aaea9517-0813-474e-8200-32c4b9d5038b","resolution":{"observed_at":"2026-08-03T04:20:56.398349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.505203Z","title":"High probability guarantees for nonconvex stochastic gradient descent with heavy tails,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.505203Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:1d365ef73584e4d013bc2bb04435aaab9f7ba4568d08b0c39f28f4ce25ba99ca","observation_id":"634188f8-fbfc-47e9-90ed-a4a9334a170d","resolution":{"observed_at":"2026-08-03T04:20:56.505203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07142","last_updated":"2023-12-12T10:24:32Z","snapshot_observed_at":"2026-07-06T17:00:20.655757Z","submitted_at":"2023-12-12T10:24:32Z","title":"General Tail Bounds for Non-Smooth Stochastic Mirror Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07142","snapshot_observed_at":"2026-08-03T04:20:56.603866Z","title":"General tail bounds for non-smooth stochastic mirror de- scent,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.603866Z"},"links":{"cited_paper":"/paper/2312.07142","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:ef72482f1f9a202019973602cd58f726c6657ba4424b0a64d6aec110ce27d2ba","observation_id":"36adae79-ec89-4feb-b054-c040ed1ac495","resolution":{"observed_at":"2026-08-03T04:20:56.603866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.714370Z","title":"High Probability Convergence Bounds for Non-convex Stochastic Gradient Descent with Sub-Weibull Noise,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.714370Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:7badc741e8e7b84458dbf162e34af3129c00638b81481a0c5d6e70677bf199d5","observation_id":"616844c9-c9dd-49f8-9eaf-3ff091d2656c","resolution":{"observed_at":"2026-08-03T04:20:56.714370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.820353Z","title":"High-probability bounds for stochastic optimization and vari- ational inequalities: the case of unbounded variance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.820353Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:afbc4ade205a56267897992b6edfd3047ac1a26159040e8c23e8ca3e6fd9db75","observation_id":"3e04a9bb-25be-45d4-b111-38b4538e959a","resolution":{"observed_at":"2026-08-03T04:20:56.820353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:56.911990Z","title":"Breaking the lower bound with (little) structure: Accel- eration in non-convex stochastic optimization with heavy-tailed noise,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:56.911990Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:bf81db95f42b2496e75aaf04c925f2047388c43526de469abb5fe752846a6023","observation_id":"45ff2a2c-57d7-46a9-a98f-d001fe3c846a","resolution":{"observed_at":"2026-08-03T04:20:56.911990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.011451Z","title":"From Gradient Clipping to Normalization for Heavy Tailed SGD,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.011451Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:1a91cba9eab2cd863f4261f21af859b6a079fc60a5702193878a079a91bc9470","observation_id":"826f19e8-bdac-4841-b932-701f19c683ba","resolution":{"observed_at":"2026-08-03T04:20:57.011451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07923","last_updated":"2025-05-27T15:31:20Z","snapshot_observed_at":"2026-08-08T23:26:23.316471Z","submitted_at":"2025-02-11T19:54:11Z","title":"Sign Operator for Coping with Heavy-Tailed Noise in Non-Convex Optimization: High Probability Bounds Under $(L_0, L_1)$-Smoothness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07923","snapshot_observed_at":"2026-08-03T04:20:57.128342Z","title":"Sign Operator for Coping with Heavy-Tailed Noise: High Probability Convergence Bounds with Exten- sions to Distributed Optimization and Comparison Oracle,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.128342Z"},"links":{"cited_paper":"/paper/2502.07923","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:bad14aecde4cb90e52c81f207deed61b8648ecf95d85822434304735af0ee5af","observation_id":"366e9823-8238-435f-9bdf-87946c3be793","resolution":{"observed_at":"2026-08-03T04:20:57.128342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.218017Z","title":"High- probability Convergence Bounds for Online Nonlinear Stochastic Gradient Descent un- der Heavy-tailed Noise,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.218017Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:ae3ec863ad25976a01c61cbe2e212ba5216437af1655bc61f6a25ab5aab9d943","observation_id":"d52f6695-2656-4cee-9c81-d66e8c586b86","resolution":{"observed_at":"2026-08-03T04:20:57.218017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.283059Z","title":"Large deviations,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.283059Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:7f8024d0a6936e1979a79fdc4f0aea1ea4f9c16a2ff388357e595810ade8b136","observation_id":"4b075620-4284-4f70-8124-49c0aa81d5c5","resolution":{"observed_at":"2026-08-03T04:20:57.283059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.368102Z","title":"Ellis,Entropy, Large Deviations, and Statistical Mechanics","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.368102Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4d697e929703d6c6bd7857a577006fed4bb730531fac101175fcde149e511ec6","observation_id":"7e22a57e-6853-4812-b480-b6cf1a26c3a1","resolution":{"observed_at":"2026-08-03T04:20:57.368102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.439819Z","title":"The large deviation approach to statistical mechanics,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.439819Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:1c286f7a3faf9ca030e343b7028c89574030d1997afb830e9e250c790e3f92b7","observation_id":"6ea68ae7-258a-407d-b34f-1fed0889ffe0","resolution":{"observed_at":"2026-08-03T04:20:57.439819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.533290Z","title":"Distributed detection via gaussian running consensus: Large deviations asymptotic analysis,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.533290Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:5f9efc31696b7bae30be7ca9a37306adc49b39652ff311b040341f7759501202","observation_id":"d469353e-4568-42a3-bcdf-6a7ef4958d55","resolution":{"observed_at":"2026-08-03T04:20:57.533290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.616825Z","title":"Large deviations performance of consensus+innovations distributed detection with non-gaussian observa- tions,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.616825Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:d5ff9169df246955e96c777253268f05d4b8bf6807d66d1be57fe3731a4a3c62","observation_id":"15248d46-d021-4c33-88a7-12aa17ba5f61","resolution":{"observed_at":"2026-08-03T04:20:57.616825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.711235Z","title":"Large deviations analysis of adaptive distributed detection,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.711235Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:a287d3d893ca97ada35729ca2c4770d794a1efe7b25ae5d5b69ddc8d01f40067","observation_id":"e54ce035-6643-4024-88b1-40dc4e1df122","resolution":{"observed_at":"2026-08-03T04:20:57.711235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.809851Z","title":"Diffusion-Based Adaptive Distributed Detection: Steady-State Performance in the Slow Adaptation Regime,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.809851Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:cd81ed4525637c9b1e38e3ef27f1cb9256ba66832e47e8e05d6b909fcc202cd6","observation_id":"446b228b-dda4-44d7-9a09-2ec05d1427b0","resolution":{"observed_at":"2026-08-03T04:20:57.809851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.911108Z","title":"Distributed Detection Over Adaptive Networks: Refined Asymptotics and the Role of Connectivity,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.911108Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:1531a4a5be7bc68ab6827c97a75a9cb7645b9c7d073a43d58df12f1986df5809","observation_id":"644630ed-e54a-4cba-b9fe-ba31e0972566","resolution":{"observed_at":"2026-08-03T04:20:57.911108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:57.982899Z","title":"Adaptive social learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.982899Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:f19a329dccca50c8be0ad94dd5f72873d8d822dbcbcdc36e6e32e956edcb33ff","observation_id":"4b18d6d0-7442-4d5e-ab96-f36586e31efd","resolution":{"observed_at":"2026-08-03T04:20:57.982899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.059930Z","title":"Inaccuracy rates for distributed inference over random networks with ap- plications to social learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.059930Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:37f455f8d073b40240bdee9333846616ef54c5c1e9f412151d9cc93253ee5991","observation_id":"12188cf2-ff5c-4c22-8374-bc17d0d2c14b","resolution":{"observed_at":"2026-08-03T04:20:58.059930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.153068Z","title":"Matta, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.153068Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:050db2a5dc8dea46d3d2327ed861aa15ba442383b003a051f6198eb0a5793a40","observation_id":"1eb92454-0f2a-46a1-9682-467642e0e75b","resolution":{"observed_at":"2026-08-03T04:20:58.153068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.259198Z","title":"Statistical hypothesis testing based on machine learning: Large deviations analysis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.259198Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:b388f7663465e2e5da029bafb773e0c6099e3e84c7eaee954d69a82b0fe7785e","observation_id":"81591201-fcc0-43e9-8c3c-2a4934de207c","resolution":{"observed_at":"2026-08-03T04:20:58.259198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.322529Z","title":"Lindhe,Topics on Large Deviations in Artificial Intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.322529Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c229f3e19d62298199583cb44e91b39a5029253cf30395648b8c606f5cae2816","observation_id":"9ac2d24f-a1ea-492c-bd65-e4188814cea2","resolution":{"observed_at":"2026-08-03T04:20:58.322529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.408125Z","title":"On the diffusion approximation of nonconvex stochastic gradient descent,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.408125Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:a802532630f842ec7d09152d6cd1475954052aaf5c01f210cf856bc8fce4411b","observation_id":"0e43e719-8d1a-40b4-936b-cf31bfd0f556","resolution":{"observed_at":"2026-08-03T04:20:58.408125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.514924Z","title":"Large deviations rates for stochastic gradient descent with strongly convex functions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.514924Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:b129b7a2debfcdd684c1506f9934e682c2059e4af89f0bca3362be90b67af8eb","observation_id":"32fd876d-f777-4a1a-b3c4-8301f177e774","resolution":{"observed_at":"2026-08-03T04:20:58.514924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.621172Z","title":"A large deviations perspective on policy gradient algorithms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.621172Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:78e6062ff4de8b2ddbde22dc649e5093be75d8c583101fb7c4e70d95843b3965","observation_id":"59072f50-2d32-4382-879d-7fec25c7a976","resolution":{"observed_at":"2026-08-03T04:20:58.621172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.709875Z","title":"What is the long-run distri- bution of stochastic gradient descent? A large deviations analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.709875Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c24b49eb4d1f305ab9f269684f1011dc13cd6aac3c84b10aa576a0a28ae24997","observation_id":"669c76c3-55c5-4898-96a8-622aeb9e479d","resolution":{"observed_at":"2026-08-03T04:20:58.709875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.825927Z","title":"The global convergence of stochastic gradient descent in non-convex landscapes: Sharp estimates via large devia- tions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.825927Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:fa8787dcec981973d754bce242a3d69eb78110df0bc44fc10bb5aaf752b73be0","observation_id":"2aeff284-36a5-48d9-8fe1-4885d9e5280e","resolution":{"observed_at":"2026-08-03T04:20:58.825927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:58.931335Z","title":"Accelerated gradient methods with biased gradient estimates: Risk sensitivity, high-probability guarantees, and large deviation bounds,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:58.931335Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c0fa60cd0d63938e4692f930b7129d6d524bffcbd256d542e538ba7e747eb587","observation_id":"f832892f-dac9-48db-9d9e-d0b62cace5a7","resolution":{"observed_at":"2026-08-03T04:20:58.931335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.003550Z","title":"On the difficulty of training recurrent neu- ral networks,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.003550Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:0b3c0d784edd7f3a51c87e90e860617ebf391fd4cc7bc7f5c7dd2a7949e92698","observation_id":"6aa95349-002c-47c3-a367-4e4400e45fe3","resolution":{"observed_at":"2026-08-03T04:20:59.003550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.109640Z","title":"A tail-index analysis of stochastic gra- dient noise in deep neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.109640Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:5a529e75bef179803c6872acb7b4c5db916d06c1946dff6d1a7dd797e839cb9d","observation_id":"5865e802-eb15-4bd7-918f-4706f5d0ed8f","resolution":{"observed_at":"2026-08-03T04:20:59.109640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.189864Z","title":"Why are adaptive methods good for attention models?,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.189864Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:554fed7f34bc6a116e6b2d9363668eee3855d1c1f3a594b83f67481118904658","observation_id":"ea833266-1915-40cc-a557-9461db7809ec","resolution":{"observed_at":"2026-08-03T04:20:59.189864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.280873Z","title":"The heavy-tail phenomenon in sgd,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.280873Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:f5ca4135f83f967257451fb1fd0490220b1374014adb92e08c6e5ccc8c97bde9","observation_id":"03903ade-3371-4236-8051-93dfd513b8c7","resolution":{"observed_at":"2026-08-03T04:20:59.280873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.379613Z","title":"Why gradient clipping accelerates train- ing: A theoretical justification for adaptivity,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.379613Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:93ff942a9d8a3e72c47d541af814c99d894ead0f472aa9a91cbb4e1f46cd4031","observation_id":"b0f173b3-cfc5-4d24-8e15-64ba8caa654a","resolution":{"observed_at":"2026-08-03T04:20:59.379613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.498038Z","title":"Understanding Clipping for Feder- ated Learning: Convergence and Client-Level Differential Privacy,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.498038Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4bc73ba5cd99fda19ec5e8f68bbc135282b64b72e8724dba70a5f01d00b123ec","observation_id":"018d3e45-4b3d-4dd3-81e0-629dcbd37b14","resolution":{"observed_at":"2026-08-03T04:20:59.498038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T04:20:59.631926Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.631926Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:78860ebc2d2f0a0f2eef57ffbf94748af9c24d2a2197465707eeaac6788dd0cd","observation_id":"a7121bbf-1f65-420c-bf5d-2fae22585a15","resolution":{"observed_at":"2026-08-03T04:20:59.631926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T04:20:59.725615Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.725615Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:f2220b29c518bc6e22d07469e9ffc8fc6ad910de8b1ee705df25df38db9cb1b4","observation_id":"0a4cf264-7aaf-4613-946b-fcef40be745c","resolution":{"observed_at":"2026-08-03T04:20:59.725615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.833167Z","title":"Safe model-based reinforce- ment learning with stability guarantees,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.833167Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:9f33d7649f4990f1cb853a72f5cda29f6f21b1dc9e681a5997156ff533edf04a","observation_id":"63498b5d-8330-4f12-b5a8-2df896b6fc70","resolution":{"observed_at":"2026-08-03T04:20:59.833167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:20:59.917962Z","title":"On the almost sure conver- gence of stochastic gradient descent in non-convex problems,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:59.917962Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:3764ee7834c7f1d03abb4c4f28f9677f879d5e1708662be4bbfaa11b94115c53","observation_id":"2bc5ec51-3ac1-4344-9398-af8728b7664a","resolution":{"observed_at":"2026-08-03T04:20:59.917962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.029870Z","title":"Efficient and accu- rate estimation of lipschitz constants for deep neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.029870Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:1581b6fa67ae5fb82622a3fa9f35df3233f0eb614d2030c6e75133762aed471a","observation_id":"23d2fef0-b94f-4486-8eb1-83b2a31fb880","resolution":{"observed_at":"2026-08-03T04:21:00.029870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.173664Z","title":"On lipschitz bounds of general convolutional neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.173664Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:66830822287d3a20b9b4b0cbc4ad2698f11441441d57671fa0706144bfcecd8c","observation_id":"ba6b53f6-76ac-4659-b9dd-486ad4a498d5","resolution":{"observed_at":"2026-08-03T04:21:00.173664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.293292Z","title":"Lipschitz certificates for layered network struc- tures driven by averaged activation operators,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.293292Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:e60a2dea6f03b7c8d32993233bf4a07548a6bce10e4f29aae49f64b7aa46d28f","observation_id":"859e75d8-7d83-4a94-b89c-ba7efce3ef09","resolution":{"observed_at":"2026-08-03T04:21:00.293292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.392847Z","title":"Rethinking lipschitz neural networks and certified robustness: A boolean function perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.392847Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:78c0cb97fe9ef95c4354a8dde4ab39563ed91481db28a8c898a1fa6ce88ed254","observation_id":"18ff867b-23cb-4b88-9b86-bb34f70e61ec","resolution":{"observed_at":"2026-08-03T04:21:00.392847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.478452Z","title":"The lipschitz constant of self-attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.478452Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:9e71078c3e1f2e66806327e578cea4f12d466d5b2f105c307af47d4b233fcb84","observation_id":"b5717a6b-4648-4446-bb88-39de01d93c28","resolution":{"observed_at":"2026-08-03T04:21:00.478452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.565974Z","title":"Improved analysis of clipping algorithms for non-convex optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.565974Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:fb33b597bda6d01f15108076b9e7faf49ec8f4ff95c3efbd28455349579a1daa","observation_id":"73f8bfa6-8d69-456f-9c59-76e33c8058fa","resolution":{"observed_at":"2026-08-03T04:21:00.565974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.688069Z","title":"Convergence of adam under relaxed assump- tions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.688069Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:69fdeb178fb573833eccf1c44b45d503d9bbe1c289eb12d0b0492b67a44af34b","observation_id":"53ed9878-2cb8-4fdc-a356-b34090ca04e7","resolution":{"observed_at":"2026-08-03T04:21:00.688069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.840185Z","title":"The price of adaptivity in stochastic convex optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.840185Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:430762d2ac277abbe58f30e221403ccf83f266d6abd749d06dce95a7ee1cd52e","observation_id":"920fc0c9-f540-4b1a-8e93-46a930d673e9","resolution":{"observed_at":"2026-08-03T04:21:00.840185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:00.987850Z","title":"Making gradient descent optimal for strongly convex stochastic optimization,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:00.987850Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:dd28bfa684cb67493216e5f70979796290c2900a4d5cad074fcf458d4041d0c2","observation_id":"ac0a8342-4da7-448b-b26f-a1e5e51be958","resolution":{"observed_at":"2026-08-03T04:21:00.987850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.127748Z","title":"Optimal stochastic approximation algorithms for strongly convex stochastic composite optimization i: A generic algorithmic framework,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.127748Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:136272493f496854810df81c93c87533f9ef4ff749f27dfe05328bd046ad21c5","observation_id":"e25fed18-5e65-4340-9a6e-01f5052d99b2","resolution":{"observed_at":"2026-08-03T04:21:01.127748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.221131Z","title":"An improved analysis of stochastic gradient descent with momentum,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.221131Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:17fcae4fec7daabefe36aba7e8adfeade68dc4c92e0d92e3499c116e791653fd","observation_id":"a7ace59c-251d-4553-b3b5-53cfd907849a","resolution":{"observed_at":"2026-08-03T04:21:01.221131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.318561Z","title":"Distributed Pareto Optimization via Diffusion Strategies,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.318561Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:99df7dfd596a226caa981c51d2562e2fd2226db7bbbf61cfe527354a3744e2ba","observation_id":"154c9865-b0da-4fd3-82d5-16fb14eb01c8","resolution":{"observed_at":"2026-08-03T04:21:01.318561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.446990Z","title":"Better theory for SGD in the nonconvex world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.446990Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:3b14583e4c73eb4bdbf28a2a384214a3dc584eab7cacadc159a964ba46c0082d","observation_id":"28088e53-2da6-4132-a6ec-67df68f2799b","resolution":{"observed_at":"2026-08-03T04:21:01.446990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.581643Z","title":"Non- linear gradient mappings and stochastic optimization: A general framework with appli- cations to heavy-tail noise,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.581643Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:0f540d4760c1b51550fabda471a45e156ef3bc60c41515f98744b7b5457a0592","observation_id":"6514e671-4a30-4c76-9b61-4b13d836b5ac","resolution":{"observed_at":"2026-08-03T04:21:01.581643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.680795Z","title":"Nonconvex stochastic optimization under heavy-tailed noises: Op- timal convergence without gradient clipping,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.680795Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:e9d76d434c0956a935200131fd2419b1f9b5a39118c8e8f1d3e8beefb4a1ee11","observation_id":"336a1e9c-2b8d-4589-995b-99fb2b2dc7ea","resolution":{"observed_at":"2026-08-03T04:21:01.680795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.779695Z","title":"Revisiting gradient normalization and clipping for non- convex sgd under heavy-tailed noise: Necessity, sufficiency, and acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.779695Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c9f3ff29017632c8f0f8956e0bf788619fdfed5429c2ad17eed7a82ffaf33a94","observation_id":"be4f8a0d-2833-4aa7-a299-89f568f3a002","resolution":{"observed_at":"2026-08-03T04:21:01.779695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:01.874097Z","title":"Gradient convergence in gradient methods with errors,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:01.874097Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:bde4ce6889ae7b37a45039c94dd2d3d3b096b71d21b0f794072b09d797eb8271","observation_id":"5ce41586-4c2c-46a6-9e9f-b6aa9ba657e9","resolution":{"observed_at":"2026-08-03T04:21:01.874097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.004635Z","title":"On the convergence of stochastic gradient descent with adaptive stepsizes,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.004635Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:fd3963a6e1c3ab419f9451c330453f3de106e7915e1588383e6c6ec065e4470d","observation_id":"02987cf8-cfdf-414d-9ce2-0537b679c141","resolution":{"observed_at":"2026-08-03T04:21:02.004635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.104242Z","title":"Almost sure convergence rates for stochastic gradient descent and stochastic heavy ball,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.104242Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:49698b7ca1fc40f8196b4e06f2cb463f634e74cac9c1eeeba34df886d3fca47b","observation_id":"dfd0accc-195a-4e82-905c-6b27f460fb31","resolution":{"observed_at":"2026-08-03T04:21:02.104242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.192682Z","title":"Convex and non-convex opti- mization under generalized smoothness,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.192682Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:15a5388f4988ffd46d4a0ee57f293197b3ed300899691db872a8d57c6768ab1a","observation_id":"be16adb1-361b-453f-983f-855bc7a34b81","resolution":{"observed_at":"2026-08-03T04:21:02.192682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.252421Z","title":"Does Standard Nonconvex SGD Really Diverge under Heavy-Tailed Noise?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.252421Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:43d73f185d57e54a812425b113b152a47b03cbf8a8f4d6f713bb2f09e3d698e1","observation_id":"03e86d2c-95ab-41ce-9ecc-b058c4d52291","resolution":{"observed_at":"2026-08-03T04:21:02.252421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.297092Z","title":"Can sgd handle heavy-tailed noise?,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.297092Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:a320d42a6be14266deefbe462b488449c674f3ef551cfa2c126af0c0de1f6f05","observation_id":"bfdd59c8-0fdd-4e39-a084-c98a16c38a82","resolution":{"observed_at":"2026-08-03T04:21:02.297092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.340790Z","title":"NIST Digital Library of Mathematical Functions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.340790Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:a208445c6110af2525eb52099b53f90cfa7bb038427446275b40e3474dec3fce","observation_id":"7739d66f-a3ee-4951-a026-6c73989e96b5","resolution":{"observed_at":"2026-08-03T04:21:02.340790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.376817Z","title":"Robust Estimation of a Location Parameter,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.376817Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4147733785c3b79280850bd097f17642ef863993ecc7dc079e2f9efb59b333d6","observation_id":"38daa0ef-967b-4523-a521-c5dd7bedd153","resolution":{"observed_at":"2026-08-03T04:21:02.376817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.427757Z","title":"Gradient Based Clustering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.427757Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:56d41a74a6ce35314cb6750326832e5c15a9342dc5be24117c3140c417b0058c","observation_id":"ed1acffd-64da-454a-804a-21feaf619437","resolution":{"observed_at":"2026-08-03T04:21:02.427757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.470272Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.470272Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:e7920e163aa821bbedef0f806644fb743462202f1baccf2f483f258884f459fe","observation_id":"1e86b19a-43f2-4da9-bf00-c5b947a715de","resolution":{"observed_at":"2026-08-03T04:21:02.470272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.514086Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.514086Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:ac939d2817835960e04efb2957a5dd4ba18158610a15eea755d04baa71c38811","observation_id":"299d0fd8-d28e-4f93-befd-ccd42c5fd242","resolution":{"observed_at":"2026-08-03T04:21:02.514086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.543830Z","title":"Proof.The first claim follows directly from Assumption 3 and Definition 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.543830Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:b06a744e7661a82532d0048494ba534dc01ab1432ec9a92ca6fe4e802a0cb1ea","observation_id":"a29c322e-dd70-43c1-aed2-814181270649","resolution":{"observed_at":"2026-08-03T04:21:02.543830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.596715Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.596715Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:4228cc7ac76a4b8038174c478409fd3ab6cb35781f07efd125e95940cc794586","observation_id":"62152ad7-b3ce-4707-b892-87cb97a0fef0","resolution":{"observed_at":"2026-08-03T04:21:02.596715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.730708Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.730708Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:aab23ce9ec17323459ea705b79434db373abca77fac7719ddd41f62bf23ea2b4","observation_id":"acd72c83-33fa-49c5-887c-47da6a04f7da","resolution":{"observed_at":"2026-08-03T04:21:02.730708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.828840Z","title":"Proof.To prove the first part, note that from Assumption 2, the choice of clipping threshold in (42) and the definition ofB p, we have, for anyt≥B p ∥∇f(x t)∥ ≤G≤ γt 2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.828840Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:c8c38b59f29c49c2cbb464411b498e13665a09bcaa4533c560d5d6156b5a1592","observation_id":"0eda0391-13ef-41ec-a883-227aab40d4d4","resolution":{"observed_at":"2026-08-03T04:21:02.828840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:02.971989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:02.971989Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:7f762be64bc1bde55006226c81e9c452a6ae6f03855fe6f0f789660049039f36","observation_id":"9df927d3-6840-429a-b17d-62f14957b8cb","resolution":{"observed_at":"2026-08-03T04:21:02.971989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:21:03.040227Z","title":"Proof.Recall that we showed the following inequality in Appendix F, for allk≥1 f(x k+1)≤f(x k)− αk 2 ∥∇f(x k)∥2 −α k⟨∇f(x k), θu k ⟩+ αk 2 ∥θb k∥2 + α2 kγ2 kL 2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T04:21:03.040227Z"},"links":{"citing_paper":"/paper/2602.05657"},"observation_digest":"sha256:369fcd94c5ce3b8afe4c5aca98abcc6ddd31f40633a70a76f1f68c19f93ac540","observation_id":"846f0cbe-969a-4814-a616-e2a1381f28e5","resolution":{"observed_at":"2026-08-03T04:21:03.040227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.05657","last_updated":"2026-06-03T15:56:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:26:40.576564Z","submitted_at":"2026-02-05T13:41:13Z","title":"Tight Long-Term Tail Decay of (Clipped) SGD in Non-Convex Optimization"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 0 inbound Pith citation observations for arXiv:2602.05657."}