{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2012:EQTGNVMHTRMHW74SV55Q5V2AW7","short_pith_number":"pith:EQTGNVMH","schema_version":"1.0","canonical_sha256":"242666d5879c587b7f92af7b0ed740b7d0c61692c0f4f103a324ec1198ed579d","source":{"kind":"arxiv","id":"1212.5701","version":1},"attestation_state":"computed","paper":{"title":"ADADELTA: An Adaptive Learning Rate Method","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Matthew D. Zeiler","submitted_at":"2012-12-22T15:46:49Z","abstract_excerpt":"We present a novel per-dimension learning rate method for gradient descent called ADADELTA. The method dynamically adapts over time using only first order information and has minimal computational overhead beyond vanilla stochastic gradient descent. The method requires no manual tuning of a learning rate and appears robust to noisy gradient information, different model architecture choices, various data modalities and selection of hyperparameters. We show promising results compared to other methods on the MNIST digit classification task using a single machine and on a large scale voice dataset"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1212.5701","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2012-12-22T15:46:49Z","cross_cats_sorted":[],"title_canon_sha256":"d9535d5011182e0b66cc5b5be264ea4176903142dcca2c073a8d71348cf551d8","abstract_canon_sha256":"67bdc6a56879597a0ec2b9b29697590f77e9886228f8cc287af5af708866838a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-05-18T03:37:51.710504Z","signature_b64":"6voO9GC5g8zFScXkFckWztXnZt3dMLpxqaNcB+0FANyPsZokOThWJg/VzwLX+EJh3bFNuBnKCFjIMOPrJIGxBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"242666d5879c587b7f92af7b0ed740b7d0c61692c0f4f103a324ec1198ed579d","last_reissued_at":"2026-05-18T03:37:51.709825Z","signature_status":"signed_v1","first_computed_at":"2026-05-18T03:37:51.709825Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ADADELTA: An Adaptive Learning Rate Method","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Matthew D. Zeiler","submitted_at":"2012-12-22T15:46:49Z","abstract_excerpt":"We present a novel per-dimension learning rate method for gradient descent called ADADELTA. The method dynamically adapts over time using only first order information and has minimal computational overhead beyond vanilla stochastic gradient descent. The method requires no manual tuning of a learning rate and appears robust to noisy gradient information, different model architecture choices, various data modalities and selection of hyperparameters. We show promising results compared to other methods on the MNIST digit classification task using a single machine and on a large scale voice dataset"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1212.5701","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1212.5701","created_at":"2026-05-18T03:37:51.709948+00:00"},{"alias_kind":"arxiv_version","alias_value":"1212.5701v1","created_at":"2026-05-18T03:37:51.709948+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1212.5701","created_at":"2026-05-18T03:37:51.709948+00:00"},{"alias_kind":"pith_short_12","alias_value":"EQTGNVMHTRMH","created_at":"2026-05-18T12:27:04.183437+00:00"},{"alias_kind":"pith_short_16","alias_value":"EQTGNVMHTRMHW74S","created_at":"2026-05-18T12:27:04.183437+00:00"},{"alias_kind":"pith_short_8","alias_value":"EQTGNVMH","created_at":"2026-05-18T12:27:04.183437+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":41,"internal_anchor_count":28,"sample":[{"citing_arxiv_id":"2606.14970","citing_title":"Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning","ref_index":48,"is_internal_anchor":true},{"citing_arxiv_id":"2606.11791","citing_title":"bAdag: an adaptive block coordinate gradient method for smooth nonconvex functions","ref_index":96,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10383","citing_title":"A stochastic gradient algorithm for non-separable optimization with convergence guarantee","ref_index":3,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10126","citing_title":"Pareto-Guided Teacher Alignment for Fair Personalized Text Generation","ref_index":99,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00486","citing_title":"PAPA: Online Personalized Active Preference Alignment","ref_index":33,"is_internal_anchor":true},{"citing_arxiv_id":"2606.03953","citing_title":"Introduction to stochastic gradient methods","ref_index":49,"is_internal_anchor":true},{"citing_arxiv_id":"2606.01474","citing_title":"Voronoi-Elitism Genetic Algorithm: A Generic Derivative-Free Routine With Theory and Implementation for Statistical Optimization","ref_index":38,"is_internal_anchor":true},{"citing_arxiv_id":"2605.15512","citing_title":"Auto-Conditioned Frank-Wolfe Algorithms","ref_index":64,"is_internal_anchor":true},{"citing_arxiv_id":"2605.28240","citing_title":"De-risking solutions to optimization problems","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2605.29273","citing_title":"A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"1906.09426","citing_title":"End-to-End ASR for Code-switched Hindi-English Speech","ref_index":31,"is_internal_anchor":true},{"citing_arxiv_id":"1907.00036","citing_title":"Novel Suboptimal approaches for Hyperparameter Tuning of Deep Neural Network [under the shelf of Optical Communication]","ref_index":39,"is_internal_anchor":true},{"citing_arxiv_id":"1906.11604","citing_title":"Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion","ref_index":49,"is_internal_anchor":true},{"citing_arxiv_id":"1906.11600","citing_title":"Dealing with Topological Information within a Fully Convolutional Neural Network","ref_index":9,"is_internal_anchor":true},{"citing_arxiv_id":"1907.01957","citing_title":"End-to-End Speech Recognition with High-Frame-Rate Features Extraction","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"1907.03698","citing_title":"TrackNet: A Deep Learning Network for Tracking High-speed and Tiny Objects in Sports Applications","ref_index":26,"is_internal_anchor":true},{"citing_arxiv_id":"1907.06916","citing_title":"Single-bit-per-weight deep convolutional neural networks without batch-normalization layers for embedded systems","ref_index":21,"is_internal_anchor":true},{"citing_arxiv_id":"1907.06836","citing_title":"Quality-aware skill translation models for expert finding on StackOverflow","ref_index":22,"is_internal_anchor":true},{"citing_arxiv_id":"1907.09008","citing_title":"signADAM: Learning Confidences for Deep Neural Networks","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"1907.10418","citing_title":"Improving Malaria Parasite Detection from Red Blood Cell using Deep Convolutional Neural Networks","ref_index":46,"is_internal_anchor":true},{"citing_arxiv_id":"1907.10726","citing_title":"Cross-Attention End-to-End ASR for Two-Party Conversations","ref_index":46,"is_internal_anchor":true},{"citing_arxiv_id":"1907.11857","citing_title":"Many could be better than all: A novel instance-oriented algorithm for Multi-modal Multi-label problem","ref_index":27,"is_internal_anchor":true},{"citing_arxiv_id":"2212.08989","citing_title":"Deep learning applied to computational mechanics: A comprehensive review, state of the art, and the classics","ref_index":56,"is_internal_anchor":true},{"citing_arxiv_id":"2601.12238","citing_title":"On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2605.16017","citing_title":"Accelerated Gradient Descent for Faster Convergence with Minimal Overhead","ref_index":42,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7","json":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7.json","graph_json":"https://pith.science/api/pith-number/EQTGNVMHTRMHW74SV55Q5V2AW7/graph.json","events_json":"https://pith.science/api/pith-number/EQTGNVMHTRMHW74SV55Q5V2AW7/events.json","paper":"https://pith.science/paper/EQTGNVMH"},"agent_actions":{"view_html":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7","download_json":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7.json","view_paper":"https://pith.science/paper/EQTGNVMH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1212.5701&json=true","fetch_graph":"https://pith.science/api/pith-number/EQTGNVMHTRMHW74SV55Q5V2AW7/graph.json","fetch_events":"https://pith.science/api/pith-number/EQTGNVMHTRMHW74SV55Q5V2AW7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7/action/storage_attestation","attest_author":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7/action/author_attestation","sign_citation":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7/action/citation_signature","submit_replication":"https://pith.science/pith/EQTGNVMHTRMHW74SV55Q5V2AW7/action/replication_record"}},"created_at":"2026-05-18T03:37:51.709948+00:00","updated_at":"2026-05-18T03:37:51.709948+00:00"}