{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:2LKG2GC6RRBIGB4I24POAHZGE7","short_pith_number":"pith:2LKG2GC6","schema_version":"1.0","canonical_sha256":"d2d46d185e8c42830788d71ee01f2627dd41981a1711da34066f7a3f926b1b3b","source":{"kind":"arxiv","id":"2104.14840","version":7},"attestation_state":"computed","paper":{"title":"Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"math.OC","authors_text":"Rong Jin, Tianbao Yang, Wotao Yin, Yi Xu, Zhishuai Guo","submitted_at":"2021-04-30T08:50:24Z","abstract_excerpt":"Although adaptive optimization algorithms have been successful in many applications, there are still some mysteries in terms of convergence analysis that have not been unraveled. This paper provides a novel non-convex analysis of adaptive optimization to uncover some of these mysteries. Our contributions are three-fold. First, we show that an increasing or large enough momentum parameter for the first-order moment used in practice is sufficient to ensure the convergence of adaptive algorithms whose adaptive scaling factors of the step size are bounded. Second, our analysis gives insights for p"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2104.14840","kind":"arxiv","version":7},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"math.OC","submitted_at":"2021-04-30T08:50:24Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"1d270b07188ea2902ceafc4fb91386f065dbacefe1a1cec78e7be8f5586738d8","abstract_canon_sha256":"918199f21f9ae3e9efc00d32c458dc9c4956a44ee4ad47b0678e8c67ed64854d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:44:34.895642Z","signature_b64":"bmhs4/ASJZRJ01mPqcbiea+WPpJvUfNSDD691mSfEPHbTM7tsOLdpMRFwDug2s6g+DVZHCpc90vhyHBxAi5CBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d2d46d185e8c42830788d71ee01f2627dd41981a1711da34066f7a3f926b1b3b","last_reissued_at":"2026-07-05T10:44:34.895115Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:44:34.895115Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"math.OC","authors_text":"Rong Jin, Tianbao Yang, Wotao Yin, Yi Xu, Zhishuai Guo","submitted_at":"2021-04-30T08:50:24Z","abstract_excerpt":"Although adaptive optimization algorithms have been successful in many applications, there are still some mysteries in terms of convergence analysis that have not been unraveled. This paper provides a novel non-convex analysis of adaptive optimization to uncover some of these mysteries. Our contributions are three-fold. First, we show that an increasing or large enough momentum parameter for the first-order moment used in practice is sufficient to ensure the convergence of adaptive algorithms whose adaptive scaling factors of the step size are bounded. Second, our analysis gives insights for p"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2104.14840","kind":"arxiv","version":7},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2104.14840/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2104.14840","created_at":"2026-07-05T10:44:34.895177+00:00"},{"alias_kind":"arxiv_version","alias_value":"2104.14840v7","created_at":"2026-07-05T10:44:34.895177+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2104.14840","created_at":"2026-07-05T10:44:34.895177+00:00"},{"alias_kind":"pith_short_12","alias_value":"2LKG2GC6RRBI","created_at":"2026-07-05T10:44:34.895177+00:00"},{"alias_kind":"pith_short_16","alias_value":"2LKG2GC6RRBIGB4I","created_at":"2026-07-05T10:44:34.895177+00:00"},{"alias_kind":"pith_short_8","alias_value":"2LKG2GC6","created_at":"2026-07-05T10:44:34.895177+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2502.07222","citing_title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","ref_index":23,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7","json":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7.json","graph_json":"https://pith.science/api/pith-number/2LKG2GC6RRBIGB4I24POAHZGE7/graph.json","events_json":"https://pith.science/api/pith-number/2LKG2GC6RRBIGB4I24POAHZGE7/events.json","paper":"https://pith.science/paper/2LKG2GC6"},"agent_actions":{"view_html":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7","download_json":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7.json","view_paper":"https://pith.science/paper/2LKG2GC6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2104.14840&json=true","fetch_graph":"https://pith.science/api/pith-number/2LKG2GC6RRBIGB4I24POAHZGE7/graph.json","fetch_events":"https://pith.science/api/pith-number/2LKG2GC6RRBIGB4I24POAHZGE7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7/action/storage_attestation","attest_author":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7/action/author_attestation","sign_citation":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7/action/citation_signature","submit_replication":"https://pith.science/pith/2LKG2GC6RRBIGB4I24POAHZGE7/action/replication_record"}},"created_at":"2026-07-05T10:44:34.895177+00:00","updated_at":"2026-07-05T10:44:34.895177+00:00"}