{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:PFBH5KUGS2JLTBVVMXDOXBFJP5","short_pith_number":"pith:PFBH5KUG","schema_version":"1.0","canonical_sha256":"79427eaa869692b986b565c6eb84a97f548b4343249af2c3df9e68a3ce7b2c60","source":{"kind":"arxiv","id":"2211.02254","version":1},"attestation_state":"computed","paper":{"title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Dhruv Malik, Kaiqi Jiang, Yuanzhi Li","submitted_at":"2022-11-04T04:05:57Z","abstract_excerpt":"Adaptive optimization methods are well known to achieve superior convergence relative to vanilla gradient methods. The traditional viewpoint in optimization, particularly in convex optimization, explains this improved performance by arguing that, unlike vanilla gradient schemes, adaptive algorithms mimic the behavior of a second-order method by adapting to the global geometry of the loss function. We argue that in the context of neural network optimization, this traditional viewpoint is insufficient. Instead, we advocate for a local trajectory analysis. For iterate trajectories produced by run"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2211.02254","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2022-11-04T04:05:57Z","cross_cats_sorted":["math.OC","stat.ML"],"title_canon_sha256":"741d092d9da0a42ec37dc3583bb93f0d8084e109dc70a64a4b57bae5ed45ee9a","abstract_canon_sha256":"f0a754b5734865e3a112b066283192476ba50fbfb74c99f254d2a24d48248556"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:13:13.274570Z","signature_b64":"kmy8Ro5ZKpkLB5atJ4/x30G6h6FSY8CwcwPrhqIzSYfF4feIFbfLAEWy/jczIYZaiUXF1qUrA/bjVlKOko2KCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"79427eaa869692b986b565c6eb84a97f548b4343249af2c3df9e68a3ce7b2c60","last_reissued_at":"2026-07-05T05:13:13.274150Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:13:13.274150Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Dhruv Malik, Kaiqi Jiang, Yuanzhi Li","submitted_at":"2022-11-04T04:05:57Z","abstract_excerpt":"Adaptive optimization methods are well known to achieve superior convergence relative to vanilla gradient methods. The traditional viewpoint in optimization, particularly in convex optimization, explains this improved performance by arguing that, unlike vanilla gradient schemes, adaptive algorithms mimic the behavior of a second-order method by adapting to the global geometry of the loss function. We argue that in the context of neural network optimization, this traditional viewpoint is insufficient. Instead, we advocate for a local trajectory analysis. For iterate trajectories produced by run"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2211.02254","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2211.02254/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2211.02254","created_at":"2026-07-05T05:13:13.274203+00:00"},{"alias_kind":"arxiv_version","alias_value":"2211.02254v1","created_at":"2026-07-05T05:13:13.274203+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2211.02254","created_at":"2026-07-05T05:13:13.274203+00:00"},{"alias_kind":"pith_short_12","alias_value":"PFBH5KUGS2JL","created_at":"2026-07-05T05:13:13.274203+00:00"},{"alias_kind":"pith_short_16","alias_value":"PFBH5KUGS2JLTBVV","created_at":"2026-07-05T05:13:13.274203+00:00"},{"alias_kind":"pith_short_8","alias_value":"PFBH5KUG","created_at":"2026-07-05T05:13:13.274203+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.12543","citing_title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","ref_index":10,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5","json":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5.json","graph_json":"https://pith.science/api/pith-number/PFBH5KUGS2JLTBVVMXDOXBFJP5/graph.json","events_json":"https://pith.science/api/pith-number/PFBH5KUGS2JLTBVVMXDOXBFJP5/events.json","paper":"https://pith.science/paper/PFBH5KUG"},"agent_actions":{"view_html":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5","download_json":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5.json","view_paper":"https://pith.science/paper/PFBH5KUG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2211.02254&json=true","fetch_graph":"https://pith.science/api/pith-number/PFBH5KUGS2JLTBVVMXDOXBFJP5/graph.json","fetch_events":"https://pith.science/api/pith-number/PFBH5KUGS2JLTBVVMXDOXBFJP5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5/action/storage_attestation","attest_author":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5/action/author_attestation","sign_citation":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5/action/citation_signature","submit_replication":"https://pith.science/pith/PFBH5KUGS2JLTBVVMXDOXBFJP5/action/replication_record"}},"created_at":"2026-07-05T05:13:13.274203+00:00","updated_at":"2026-07-05T05:13:13.274203+00:00"}