{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:74RUDLYXOWEGHRKK4U4B423G3H","short_pith_number":"pith:74RUDLYX","schema_version":"1.0","canonical_sha256":"ff2341af17758863c54ae5381e6b66d9e63ba5048333b6b32315b00204ed02c5","source":{"kind":"arxiv","id":"2405.16397","version":3},"attestation_state":"computed","paper":{"title":"AdaFisher: Adaptive Second Order Optimization via Fisher Information","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC"],"primary_cat":"cs.LG","authors_text":"Damien Martins Gomes, Eugene Belilovsky, Guy Wolf, Mahdi S. Hosseini, Yanlei Zhang","submitted_at":"2024-05-26T01:25:02Z","abstract_excerpt":"First-order optimization methods are currently the mainstream in training deep neural networks (DNNs). Optimizers like Adam incorporate limited curvature information by employing the diagonal matrix preconditioning of the stochastic gradient during the training. Despite their widespread, second-order optimization algorithms exhibit superior convergence properties compared to their first-order counterparts e.g. Adam and SGD. However, their practicality in training DNNs is still limited due to increased per-iteration computations compared to the first-order methods. We present \\emph{AdaFisher}--"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.16397","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-26T01:25:02Z","cross_cats_sorted":["math.OC"],"title_canon_sha256":"696cc45050d151244c8a40f32ebcf2a028974a527748e94f0520b12570a67336","abstract_canon_sha256":"56130f5e3e02b4aa224bf8f0decadbf296c2614662e483a4e7581115fad39cdf"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:28:16.738502Z","signature_b64":"SJNhI7P83r5SMCO7xteSvrY3iBUy9+Y8ibNANkPvQaTHkc+IW5gBxam7O72Pt+tf4jTLdX8S9EmXM0jm0xg8CQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ff2341af17758863c54ae5381e6b66d9e63ba5048333b6b32315b00204ed02c5","last_reissued_at":"2026-07-05T10:28:16.737764Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:28:16.737764Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AdaFisher: Adaptive Second Order Optimization via Fisher Information","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC"],"primary_cat":"cs.LG","authors_text":"Damien Martins Gomes, Eugene Belilovsky, Guy Wolf, Mahdi S. Hosseini, Yanlei Zhang","submitted_at":"2024-05-26T01:25:02Z","abstract_excerpt":"First-order optimization methods are currently the mainstream in training deep neural networks (DNNs). Optimizers like Adam incorporate limited curvature information by employing the diagonal matrix preconditioning of the stochastic gradient during the training. Despite their widespread, second-order optimization algorithms exhibit superior convergence properties compared to their first-order counterparts e.g. Adam and SGD. However, their practicality in training DNNs is still limited due to increased per-iteration computations compared to the first-order methods. We present \\emph{AdaFisher}--"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.16397","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.16397/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.16397","created_at":"2026-07-05T10:28:16.737846+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.16397v3","created_at":"2026-07-05T10:28:16.737846+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.16397","created_at":"2026-07-05T10:28:16.737846+00:00"},{"alias_kind":"pith_short_12","alias_value":"74RUDLYXOWEG","created_at":"2026-07-05T10:28:16.737846+00:00"},{"alias_kind":"pith_short_16","alias_value":"74RUDLYXOWEGHRKK","created_at":"2026-07-05T10:28:16.737846+00:00"},{"alias_kind":"pith_short_8","alias_value":"74RUDLYX","created_at":"2026-07-05T10:28:16.737846+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.08352","citing_title":"Convergence Analysis of Newton's Method for Neural Networks in the Overparameterized Limit","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08352","citing_title":"Convergence Analysis of Newton's Method for Neural Networks in the Overparameterized Limit","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H","json":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H.json","graph_json":"https://pith.science/api/pith-number/74RUDLYXOWEGHRKK4U4B423G3H/graph.json","events_json":"https://pith.science/api/pith-number/74RUDLYXOWEGHRKK4U4B423G3H/events.json","paper":"https://pith.science/paper/74RUDLYX"},"agent_actions":{"view_html":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H","download_json":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H.json","view_paper":"https://pith.science/paper/74RUDLYX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.16397&json=true","fetch_graph":"https://pith.science/api/pith-number/74RUDLYXOWEGHRKK4U4B423G3H/graph.json","fetch_events":"https://pith.science/api/pith-number/74RUDLYXOWEGHRKK4U4B423G3H/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H/action/timestamp_anchor","attest_storage":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H/action/storage_attestation","attest_author":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H/action/author_attestation","sign_citation":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H/action/citation_signature","submit_replication":"https://pith.science/pith/74RUDLYXOWEGHRKK4U4B423G3H/action/replication_record"}},"created_at":"2026-07-05T10:28:16.737846+00:00","updated_at":"2026-07-05T10:28:16.737846+00:00"}