{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82363b4f341bb45f2f3500083a9dd5c07eff674ced8558c1bfb812d7c958e0a8","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:10:16.631122Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06464/citation-record","integrity":"/paper/2507.06464/integrity","json":"/paper/2507.06464/citation-record.json","paper":"/paper/2507.06464"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.198246Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"31ada89f-917b-4663-a5ab-494e26f12d36","year":2015},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.336936Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:02acbf8ec83c3f1d9bb84602bff8813cb1f34863034962c6295cd46aa582d42d","observation_id":"e944ecc4-1240-4dbb-8a4b-37159c5297a8","resolution":{"observed_at":"2026-08-06T19:10:17.201901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.187987Z","title":"Attention is all you need,","venue":null,"work_id":"3def1e0a-e58d-4a5c-bbc7-10681376cc56","year":2017},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.455074Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:742c096d5640f9016cafad812b845545e8344c6ee3fb54a8d8248859cfeb9726","observation_id":"e6e02f0c-d61c-4d6f-80e1-ea04028cd716","resolution":{"observed_at":"2026-08-06T19:10:17.191786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.458605Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.458605Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:959cee2d612d510e73297d60cfeeb83fdb7f45d7d38ca27b0da331ac4df775bf","observation_id":"130b3ed3-5f82-4fe6-8a9f-e2350eb1faee","resolution":{"observed_at":"2026-08-06T19:10:16.458605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.462151Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.462151Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:d98f406fa256fa161690ae5d87b8d2a86f85b5dbb2d797e98e366d84d419d02e","observation_id":"1a5ec753-fa43-4e58-b12d-202711d646bf","resolution":{"observed_at":"2026-08-06T19:10:16.462151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:10:16.465335Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.465335Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:8a6146778f14427902182157e331080e3a1a0ff37add30185574895a13592754","observation_id":"7091e28a-58fc-431a-b9f6-edc9e96e4b74","resolution":{"observed_at":"2026-08-06T19:10:16.465335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T19:10:16.468721Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.468721Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:37acbfbda81f7a126c89913362c72a833294ef346ca45f53ce1567d5a859c3d0","observation_id":"a7f18002-e37c-421a-998c-93439602f0dd","resolution":{"observed_at":"2026-08-06T19:10:16.468721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.471944Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.471944Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:e8f6714706d80061b4f95780a9714b03512b5bbdd5e4ed2781989b5f11b02a4e","observation_id":"c344c854-4c34-4e60-8ee5-4d7fa5be9619","resolution":{"observed_at":"2026-08-06T19:10:16.471944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T19:10:16.474845Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.474845Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:d345efaff2de16151419d25637fcae1ec075fa2ed412ba6c93692b8df3cf5cd3","observation_id":"99a15b1d-518d-42bd-9632-e3469bc87f4b","resolution":{"observed_at":"2026-08-06T19:10:16.474845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.478341Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.478341Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:ff969d0862dc09cf20dd369c500c7688235f3bd42fbf96a3168c4e0686464519","observation_id":"8c5b1c58-700a-4826-b81c-372942e56358","resolution":{"observed_at":"2026-08-06T19:10:16.478341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.481830Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoen- coders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.481830Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:9ee84db85a77c138afd2afc2c4ec52a5bc185f04b6d51409534cb82795cd4887","observation_id":"7ea6ca0d-f1a1-4b7c-acfd-602228e86852","resolution":{"observed_at":"2026-08-06T19:10:16.481830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.485548Z","title":"Imagenet classification with deep convolutional neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.485548Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:e7ae6f442e6e8389abfe18795089ff1b09c70d47064e36d03831097e8f35261e","observation_id":"c1825759-aff8-4476-ad47-2cf31d09d429","resolution":{"observed_at":"2026-08-06T19:10:16.485548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.488397Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.488397Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:24cce8f67471b5983390ab43b810cb8a69aa374405528a92a06770909d2933c3","observation_id":"c49b5738-5629-45bf-9d39-f9530cbe0292","resolution":{"observed_at":"2026-08-06T19:10:16.488397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06675","last_updated":"2023-05-08T21:49:57Z","snapshot_observed_at":"2026-08-02T01:29:22.350700Z","submitted_at":"2023-02-13T20:27:30Z","title":"Symbolic Discovery of Optimization Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06675","snapshot_observed_at":"2026-08-06T19:10:16.490853Z","title":"Symbolic discovery of opti- mization algorithms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.490853Z"},"links":{"cited_paper":"/paper/2302.06675","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:5267e331149ed822077d3048fb4e6e1517babac28fe84dd9158eab7768a55e6c","observation_id":"95fdae10-305a-4e29-92b0-50fbe1e9c141","resolution":{"observed_at":"2026-08-06T19:10:16.490853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-06T19:10:16.493852Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.493852Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7b485ab852eff7b45abf50f525e7590852ece1c6279a57448d519a450a9c1240","observation_id":"387290f7-6e61-4fbb-9549-3f7e6b456b20","resolution":{"observed_at":"2026-08-06T19:10:16.493852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.497361Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.497361Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:8dc7c0887762507f4e5cbd9c2bfd900066f8ecc6c42192c6170a95c812f117b0","observation_id":"64c549bf-2a0d-45a2-921e-0411c3fa38b6","resolution":{"observed_at":"2026-08-06T19:10:16.497361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.132929Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent,","venue":null,"work_id":"cc0dd7c3-fb29-44d0-a919-136e45d1fe34","year":2012},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.499783Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:c93d580b1dfb8e80c5e6f8241aa68dfeaf393f132bd01ca19327ee68da5c8da6","observation_id":"9034aef6-356b-4b25-bf4d-b3a7e75faeb4","resolution":{"observed_at":"2026-08-06T19:10:17.137025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-07-06T03:02:42.105044Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-06T19:10:16.502866Z","title":"Adadelta: an adaptive learning rate method,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.502866Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:8fe1a0ed0d8b27a98d1604f33684a1f9547ea86ef54f6b3b1d9a9c3278b595fb","observation_id":"8ba9cd53-5f3c-4235-a11e-ac7c73ec22b0","resolution":{"observed_at":"2026-08-06T19:10:16.502866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.120976Z","title":"Incorporating nesterov momentum into adam,","venue":null,"work_id":"24000363-033d-4343-973a-d6e76b9b0e06","year":2016},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.506673Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:c8dc9f661e2a64c97aa8277e9bcd589dc60065b100fe3bc99f2dcc7727ed1c0c","observation_id":"8fad584c-c762-4759-acd9-db97b754c220","resolution":{"observed_at":"2026-08-06T19:10:17.124513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.509896Z","title":"On the convergence of adam and beyond,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.509896Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7270b3af7a8a15ea837030e3ca7d0a25fc488aa824ae11e9e336843c7bc414d2","observation_id":"b424d17a-bdd7-4d6d-84f5-938ee379f839","resolution":{"observed_at":"2026-08-06T19:10:16.509896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T19:10:16.513195Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.513195Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:cca8bd5b7894fbb4815ffad2f4933ecc51082bc04423acd90754413f2ce0ba43","observation_id":"6bf20935-3052-4582-a149-eba073699fa4","resolution":{"observed_at":"2026-08-06T19:10:16.513195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.104876Z","title":"Adabelief optimizer: Adapting stepsizes by the belief in observed gradients,","venue":null,"work_id":"84b4846e-0033-43e1-b90a-97a4ed423dbf","year":2020},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.516431Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:2f9cadb0afd837ea7e92a74d72980b945398006be5b51155151a8f61ad08a480","observation_id":"882ac5b3-d99a-4380-afc0-42040410dad4","resolution":{"observed_at":"2026-08-06T19:10:17.109013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.094378Z","title":"Adafactor: Adaptive learning rates with sub- linear memory cost,","venue":null,"work_id":"4fe8e29b-24e7-4775-8c6f-8e57e5c2d528","year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.518984Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:78e8812e3906f9db7f6924aec6c3f06851cc584fd72f3783783963d235836ff1","observation_id":"f6cc7300-be44-4848-8327-9827f0c8109d","resolution":{"observed_at":"2026-08-06T19:10:17.097992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.084928Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech dnns,","venue":null,"work_id":"158e3ee4-964b-44f8-ab56-60e5c0c3a520","year":2014},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.521637Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:a25dacc3ab1e35f5505064e8f14e66dfc91664eb5cbed7fa9635492905f19ff0","observation_id":"d39444e8-0734-4f72-98ad-07c53c256862","resolution":{"observed_at":"2026-08-06T19:10:17.088592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.074549Z","title":"Signsgd: Compressed optimisation for non-convex problems,","venue":null,"work_id":"244cc11c-88ec-4129-9ad5-675c6523b800","year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.524327Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:44f4d2f47fefbb4cd0b45531a98386dec1cc52b2f18d12b107ed8dd13b55e487","observation_id":"ebea6fa2-4ce9-47dd-be8e-5ba659eea44f","resolution":{"observed_at":"2026-08-06T19:10:17.078021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.064050Z","title":"Momentum ensures convergence of SIGNSGD under weaker assumptions,","venue":null,"work_id":"b28e4671-0cf8-4168-b6d0-2831dee31fff","year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.526948Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7144f735ed39cab6e886349b0022fb72f727d2dd834bc5758dfd148421744f6e","observation_id":"e926c48a-d74f-4e96-8149-97437b6e9db3","resolution":{"observed_at":"2026-08-06T19:10:17.067344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-06T19:10:16.530074Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.530074Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:efaf5edda02e0df799784d1c8c2159ac8f6a0ea4462ab48e228a9320a494de95","observation_id":"8a4e6230-10b8-41d4-9d9c-120d5a4c958b","resolution":{"observed_at":"2026-08-06T19:10:16.530074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.052015Z","title":"A direct adaptive method for faster backpropagation learning: The rprop algorithm,","venue":null,"work_id":"29a05d6a-96b8-49ca-b333-54e124a2d0c2","year":1993},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.533409Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:731bb546b5e040a3d4d6ff3ba18bf97f0232182ce07923a87df90b6835fb56d3","observation_id":"82b4b94f-b472-4f8f-addb-70900f8590bd","resolution":{"observed_at":"2026-08-06T19:10:17.055958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.042503Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech DNNs","venue":null,"work_id":"90da88ab-6a28-4681-9294-5fc3c9ddcf73","year":2014},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.535835Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:50aac22c3336cb41c1f7ab6c0c60b66396dee4f6d3aa8a1869b12a7de34bd367","observation_id":"8824a63e-45a6-459f-97fd-1ec59887e172","resolution":{"observed_at":"2026-08-06T19:10:17.045610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05898","last_updated":"2025-07-01T15:59:19Z","snapshot_observed_at":"2026-07-06T16:29:55.892584Z","submitted_at":"2023-10-09T17:41:29Z","title":"Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05898","snapshot_observed_at":"2026-08-06T19:10:16.538230Z","title":"Lion secretly solves constrained optimization: As lyapunov predicts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.538230Z"},"links":{"cited_paper":"/paper/2310.05898","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:2d10c63bfb630413e2f9ad23a7ab02127ba23252052eff29926c641d10ea1b71","observation_id":"afb2ed8b-b8f9-47ed-bb3d-4140897acc52","resolution":{"observed_at":"2026-08-06T19:10:16.538230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.032448Z","title":"Dissecting Adam: The sign, magnitude and variance of stochastic gradients,","venue":null,"work_id":"890c9304-ae2e-48b9-959c-819cb2dfa9e9","year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.541329Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:c834c1c1870fa5b6065ed31fb2dd915b7eb088b2cefe2c0e5f6c13959958be4e","observation_id":"6036972d-a558-4688-963c-b919c3331931","resolution":{"observed_at":"2026-08-06T19:10:17.035995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-06T19:10:16.543726Z","title":"Heavy- tailed class imbalance and why Adam outperforms gradient descent on language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.543726Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:9bbf8d7ee2948563897b5461915baaafb89605e31a33a0ce64b434f3c22ebeac","observation_id":"03e8a653-b280-4c7a-9d79-158e223e8596","resolution":{"observed_at":"2026-08-06T19:10:16.543726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.021965Z","title":"A method of solving a convex programming problem with convergence rate o\\bigl(kˆ2\\bigr),","venue":null,"work_id":"a3c0cb43-b591-473a-aba4-874d8ef22caa","year":1983},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.546651Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:a1a0d54b5bf9f33c35e63b99f62f2036680c7078f5d1c18f50d1892cfbcd5994","observation_id":"0b7b1394-3226-48cb-a8e0-b8b9b09a1f9a","resolution":{"observed_at":"2026-08-06T19:10:17.025018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:17.011190Z","title":"Springer Science & Business Media, 2013, vol","venue":null,"work_id":"94abf1d9-f873-4ce2-afb3-f120607a4578","year":2013},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.549317Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:fb91bab8a985e8a29cfab9ddb67601a06c6eb700f29e83a00b00f78d3a233a0e","observation_id":"9d6fc65c-1ed3-4412-add0-8e36cd225a20","resolution":{"observed_at":"2026-08-06T19:10:17.015378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.999822Z","title":"Adan: Adaptive nesterov momentum algorithm for faster optimizing deep models,","venue":null,"work_id":"e291ce3f-07fa-41f0-ba7d-6b9ab852bc5e","year":2024},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.551946Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:e4c812d5bfe24c5049d2b80999b1b96f9c9748844e8a7a5300f304112df06300","observation_id":"1f9894cf-5e9c-4c60-9bb3-92b9b905aecf","resolution":{"observed_at":"2026-08-06T19:10:17.003645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.988045Z","title":"Win: Weight-decay-integrated nesterov acceleration for adaptive gradient algorithms,","venue":null,"work_id":"db630abb-8e49-4b6c-a931-1733935ab495","year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.555136Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:6e9d1e6a22f3575616e9bc96615ad216074b27052c3e2024fd8b6ff5bc7955cb","observation_id":"17c3485f-f796-4d31-97c8-1e15f18f969d","resolution":{"observed_at":"2026-08-06T19:10:16.991917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-06T19:10:16.558707Z","title":"Glm-130b: An open bilingual pre-trained model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.558707Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:8ae056f32ee112e8c412c17e1284a4ff717e400abb98e702f8a0e69250f55c17","observation_id":"7e6bf4ef-121e-415e-a5f8-4efda35ca0fd","resolution":{"observed_at":"2026-08-06T19:10:16.558707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T19:10:16.561798Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.561798Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:3db6cb56ed8525cf6144321e13bb99e0f21bd076f61ff55924f919989878408b","observation_id":"fef1eb67-c197-4ee5-84c5-067f88733fc4","resolution":{"observed_at":"2026-08-06T19:10:16.561798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-06T19:10:16.564494Z","title":"Baichuan 2: Open large-scale language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.564494Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:26fa9400da5c7b7146b672cf2454fb435612166b7fa1588b62643e3253366e47","observation_id":"4389efc2-d313-4583-8363-821f45cddab5","resolution":{"observed_at":"2026-08-06T19:10:16.564494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15424","last_updated":"2022-11-08T04:56:12Z","snapshot_observed_at":"2026-08-04T20:59:00.235287Z","submitted_at":"2022-10-27T13:43:27Z","title":"What Language Model to Train if You Have One Million GPU Hours?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15424","snapshot_observed_at":"2026-08-06T19:10:16.567629Z","title":"What language model to train if you have one million gpu hours?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.567629Z"},"links":{"cited_paper":"/paper/2210.15424","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:9cf89d2dabcbf3500271657203e67728b3b40c4ce590eb97cfafbc029f2aaa18","observation_id":"a65fb9e5-510a-45de-9c7b-e09761f73eb6","resolution":{"observed_at":"2026-08-06T19:10:16.567629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-06T19:10:16.570768Z","title":"A theory on adam insta- bility in large-scale machine learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.570768Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:4d0eb4ab7e82b433685f90e69b8e662005a047ca0aa299b3aba67431dfb25e5b","observation_id":"6c436ba2-b562-42f2-af4e-208e2df607d3","resolution":{"observed_at":"2026-08-06T19:10:16.570768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08129","last_updated":"2019-03-05T21:42:13Z","snapshot_observed_at":"2026-08-06T09:06:12.885773Z","submitted_at":"2019-02-21T16:36:13Z","title":"A Mean Field Theory of Batch Normalization","version":2},"cited_work":{"arxiv_id":"1902.08129","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.08129","snapshot_observed_at":"2026-08-06T19:10:16.748367Z","title":"A Mean Field Theory of Batch Normalization","venue":"cs.NE","work_id":"4aecb44b-a5ba-4357-9937-742753c3aa7d","year":2019},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.573719Z"},"links":{"cited_paper":"/paper/1902.08129","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:b35d9a2d6fe292488586f4f830aa431275f89d2f522333e9c59c59193c862936","observation_id":"4a9a43cc-6d72-4ab3-a56a-d57d4b7aaa05","resolution":{"observed_at":"2026-08-06T19:10:16.753519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08249","last_updated":"2023-10-01T18:34:20Z","snapshot_observed_at":"2026-08-05T21:16:18.814991Z","submitted_at":"2020-04-17T13:59:07Z","title":"Understanding the Difficulty of Training Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08249","snapshot_observed_at":"2026-08-06T19:10:16.577022Z","title":"Understanding the difficulty of training transformers,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.577022Z"},"links":{"cited_paper":"/paper/2004.08249","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:d5950f4232388a9d14346392b7705416d803e9cf3ee8f7d73b23feaec145673f","observation_id":"81412f7d-d3c9-443f-b776-78d06309f9d7","resolution":{"observed_at":"2026-08-06T19:10:16.577022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.978183Z","title":"On layer normalization in the trans- former architecture,","venue":null,"work_id":"2fdf60e4-5784-4bf2-b0e1-f51c2e8b9e80","year":2020},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.580127Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:248a1f8daf4c17169407d0d2f4f507328894cdc78bc96627f98cf7135605d0a5","observation_id":"ae162317-639b-4c10-8aa0-87babd01ece8","resolution":{"observed_at":"2026-08-06T19:10:16.981559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.964600Z","title":"The lipschitz constant of self- attention,","venue":null,"work_id":"1342fe30-bccc-4ddc-89e2-b462cf8c0b78","year":2021},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.583966Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:d8da611b75f813c889ea3d8ee294889adf0fca2da924fbe00b347b7623ccab5b","observation_id":"2652fda8-ca7c-4f19-9ce7-dd05b222d562","resolution":{"observed_at":"2026-08-06T19:10:16.969465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09856","last_updated":"2023-04-19T17:59:39Z","snapshot_observed_at":"2026-08-05T20:51:18.362913Z","submitted_at":"2023-04-19T17:59:39Z","title":"LipsFormer: Introducing Lipschitz Continuity to Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09856","snapshot_observed_at":"2026-08-06T19:10:16.586759Z","title":"Lipsformer: In- troducing lipschitz continuity to vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.586759Z"},"links":{"cited_paper":"/paper/2304.09856","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7d341214ae0f97abc88d096d8c2f75353afea0a7608b2081dfff45f50261dfc7","observation_id":"8dfbbdde-7c7e-47bd-8fd7-2af0221cade8","resolution":{"observed_at":"2026-08-06T19:10:16.586759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.951853Z","title":"Signal propagation in transformers: Theoretical perspectives and the role of rank collapse,","venue":null,"work_id":"da60a03b-c3e6-48df-947a-3b967c6a4cca","year":2022},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.589251Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:0d91e9c05f7425e0226596f15212e0b8aeed6c1f250fc5e2b814b071b4df4faf","observation_id":"8c0381e7-1410-476e-9265-b2dbab2a4363","resolution":{"observed_at":"2026-08-06T19:10:16.955532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-06T16:48:51.552941Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-06T19:10:16.591929Z","title":"On the variance of the adaptive learning rate and beyond,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.591929Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:2397d10195f91ef94f25e0970f7fb7ddc66c5e92a4c6fb123a3f8046e6fa3d95","observation_id":"218ef676-cdc5-4fff-9afb-a88f3cad0e79","resolution":{"observed_at":"2026-08-06T19:10:16.591929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04815","last_updated":"2024-06-06T03:57:32Z","snapshot_observed_at":"2026-07-06T15:40:00.975837Z","submitted_at":"2023-06-07T22:37:11Z","title":"Catapults in SGD: spikes in the training loss and their impact on generalization through feature learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04815","snapshot_observed_at":"2026-08-06T19:10:16.595651Z","title":"Catapults in sgd: spikes in the training loss and their impact on generalization through feature learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.595651Z"},"links":{"cited_paper":"/paper/2306.04815","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:33d0c17a6363ac2bf7885ef72ae9c859af957e5907448ca96f9a6e0e44dea0d0","observation_id":"b1702c3e-1070-4189-83a0-ceba8119b40e","resolution":{"observed_at":"2026-08-06T19:10:16.595651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12133","last_updated":"2024-10-05T05:40:02Z","snapshot_observed_at":"2026-08-04T08:01:47.209871Z","submitted_at":"2023-05-20T07:57:15Z","title":"Loss Spike in Training Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12133","snapshot_observed_at":"2026-08-06T19:10:16.598782Z","title":"Loss spike in training neural networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.598782Z"},"links":{"cited_paper":"/paper/2305.12133","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:ad39d3cd420f98064c5909e9f4704b2aaa561d9bd09765687f1bdbb73ffa2ebe","observation_id":"ee2e7d3e-cdc5-4a94-90b3-ffc1a0050369","resolution":{"observed_at":"2026-08-06T19:10:16.598782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.942124Z","title":"Stochasticity of deterministic gradient descent: Large learning rate for multiscale objective function,","venue":null,"work_id":"c52e00aa-3288-4bd5-be0e-706ed4d98d65","year":2020},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.601925Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7425ca9cfd6adac228bfb8f79ff65c19d596a30958ba953d2093f8af9370b963","observation_id":"05f8d309-aa58-4cf9-ab76-89e4d31a7e70","resolution":{"observed_at":"2026-08-06T19:10:16.945621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.02941","last_updated":"2019-03-10T00:48:35Z","snapshot_observed_at":"2026-08-07T09:56:34.669633Z","submitted_at":"2018-08-08T21:14:07Z","title":"On the Convergence of A Class of Adam-Type Algorithms for Non-Convex Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.02941","snapshot_observed_at":"2026-08-06T19:10:16.605575Z","title":"On the convergence of a class of adam-type algorithms for non-convex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.605575Z"},"links":{"cited_paper":"/paper/1808.02941","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:d324ae873f6cd0624dcf14a75b41ce0acc0d426fd0a54b8bb98d1e4f65e4b6c5","observation_id":"0665f40e-517a-40fa-9b6b-57ba587a69f1","resolution":{"observed_at":"2026-08-06T19:10:16.605575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-06T19:10:16.608689Z","title":"A simple convergence proof of adam and adagrad,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.608689Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:c9bc4031696120fbb13ca4004ccc27d431d41ac2c95ca6beb98cf27155d2f95a","observation_id":"aa8ccb70-02cc-4385-9382-1b1296c7d6a0","resolution":{"observed_at":"2026-08-06T19:10:16.608689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06766","last_updated":"2018-11-20T21:57:15Z","snapshot_observed_at":"2026-07-06T06:50:53.164182Z","submitted_at":"2018-07-18T03:58:02Z","title":"Convergence guarantees for RMSProp and ADAM in non-convex optimization and an empirical comparison to Nesterov acceleration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06766","snapshot_observed_at":"2026-08-06T19:10:16.611740Z","title":"Convergence guarantees for rmsprop and adam in non-convex optimization and an empirical compar- ison to nesterov acceleration,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.611740Z"},"links":{"cited_paper":"/paper/1807.06766","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:4ace9288785b97cd8e29778fa9562179f63a80dc9c5f0ed7a9fec79046bd53f4","observation_id":"2da32d6b-006e-4c34-9b9f-d5b321245e07","resolution":{"observed_at":"2026-08-06T19:10:16.611740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.931747Z","title":"Adam can converge without any modification on update rules,","venue":null,"work_id":"fe48032b-7d94-4828-841f-c4230eca1bea","year":2022},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.614982Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:f106d5deb653caf1971013d609a655d9261c211da22182b2e6a65a4682baa076","observation_id":"c793896d-c0f0-4540-b1f4-ba65969027a9","resolution":{"observed_at":"2026-08-06T19:10:16.935092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.921026Z","title":"Convergence of adam under relaxed assumptions,","venue":null,"work_id":"5f462723-b310-4d9b-90d7-48f68011ae7b","year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.617374Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:3275c771f4c3edbd94117505ad7203a109db94f8ec98fb256b29eec68c2ac20a","observation_id":"edb696f8-338f-4603-bc9b-65aa87994a2a","resolution":{"observed_at":"2026-08-06T19:10:16.925114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03982","last_updated":"2025-02-22T03:07:15Z","snapshot_observed_at":"2026-07-06T17:26:10.790336Z","submitted_at":"2024-02-06T13:19:26Z","title":"On Convergence of Adam for Stochastic Optimization under Relaxed Assumptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03982","snapshot_observed_at":"2026-08-06T19:10:16.619880Z","title":"On convergence of adam for stochastic optimization under relaxed assumptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.619880Z"},"links":{"cited_paper":"/paper/2402.03982","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:0a27d277f91866bac05e13f41e38794b9e2acfa0c788673bde22670c9e58be33","observation_id":"aef5e537-b67a-4191-baf8-44b8ee68e314","resolution":{"observed_at":"2026-08-06T19:10:16.619880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.912256Z","title":"Lower bounds for non-convex stochastic optimization,","venue":null,"work_id":"e037adba-aeb3-41e0-bd61-1db7433b6cf4","year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.622696Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:b4c9b9a124050352b6428365d5dd6bd19c88ba794a777cd386af018836d71a9b","observation_id":"d412bbce-b75e-4338-85a1-8d95ec0c4527","resolution":{"observed_at":"2026-08-06T19:10:16.915141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.625262Z","title":"A stochastic approximation method,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.625262Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:0d690b99a8fc27f6a5472e48b5179ee89c3e327b5824e5ddf67ad05ece63fef8","observation_id":"8aa29741-fb40-45e8-9b6f-6eb49c4d653a","resolution":{"observed_at":"2026-08-06T19:10:16.625262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:10:16.628081Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.628081Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:152e5aae7c2ec6504214967ef1aa8cd98a811780ab9fee6fdad4aff17ef790c8","observation_id":"37318d86-763a-4520-a46e-43cf4fa59af7","resolution":{"observed_at":"2026-08-06T19:10:16.628081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:10:16.895610Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"3c305ad2-1865-4b78-b056-67cdbd5b9e0f","year":2019},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.631122Z"},"links":{"citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:7c6fcf3a7efd720c3aa0001f4c3ac4afd0147240e5a373d01956a10e89652c99","observation_id":"ef273616-c7fa-4b26-957c-cf3618c69d17","resolution":{"observed_at":"2026-08-06T19:10:16.898796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2507.06464."}