{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:FAO6OGKWHAQ4TQIIHRC76D44S5","short_pith_number":"pith:FAO6OGKW","schema_version":"1.0","canonical_sha256":"281de719563821c9c1083c45ff0f9c97677438c1ec146f7c207cb939f19c8f98","source":{"kind":"arxiv","id":"2110.02861","version":2},"attestation_state":"computed","paper":{"title":"8-bit Optimizers via Block-wise Quantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Luke Zettlemoyer, Mike Lewis, Sam Shleifer, Tim Dettmers","submitted_at":"2021-10-06T15:43:20Z","abstract_excerpt":"Stateful optimizers maintain gradient statistics over time, e.g., the exponentially smoothed sum (SGD with momentum) or squared sum (Adam) of past gradient values. This state can be used to accelerate optimization compared to plain stochastic gradient descent but uses memory that might otherwise be allocated to model parameters, thereby limiting the maximum size of models trained in practice. In this paper, we develop the first optimizers that use 8-bit statistics while maintaining the performance levels of using 32-bit optimizer states. To overcome the resulting computational, quantization, a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2110.02861","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2021-10-06T15:43:20Z","cross_cats_sorted":[],"title_canon_sha256":"764b4da5b14458928b23324402b38cb19bb62725a46dbae0978ade484c14a6a4","abstract_canon_sha256":"29a1007fc86d3c8973274c10f9415a43968bce5fed2f99cfebc86b55cfd8c10d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:32:51.924825Z","signature_b64":"Vik9Q9yOzDF/nwQQPPXa06Jb7J/wwACbCQlal7ejdfVSRGbdK0mPq8dQgHOGVnn01rBi6Da9+olmSlFYdqzMCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"281de719563821c9c1083c45ff0f9c97677438c1ec146f7c207cb939f19c8f98","last_reissued_at":"2026-07-05T04:32:51.924332Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:32:51.924332Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"8-bit Optimizers via Block-wise Quantization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Luke Zettlemoyer, Mike Lewis, Sam Shleifer, Tim Dettmers","submitted_at":"2021-10-06T15:43:20Z","abstract_excerpt":"Stateful optimizers maintain gradient statistics over time, e.g., the exponentially smoothed sum (SGD with momentum) or squared sum (Adam) of past gradient values. This state can be used to accelerate optimization compared to plain stochastic gradient descent but uses memory that might otherwise be allocated to model parameters, thereby limiting the maximum size of models trained in practice. In this paper, we develop the first optimizers that use 8-bit statistics while maintaining the performance levels of using 32-bit optimizer states. To overcome the resulting computational, quantization, a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2110.02861","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2110.02861/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2110.02861","created_at":"2026-07-05T04:32:51.924390+00:00"},{"alias_kind":"arxiv_version","alias_value":"2110.02861v2","created_at":"2026-07-05T04:32:51.924390+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2110.02861","created_at":"2026-07-05T04:32:51.924390+00:00"},{"alias_kind":"pith_short_12","alias_value":"FAO6OGKWHAQ4","created_at":"2026-07-05T04:32:51.924390+00:00"},{"alias_kind":"pith_short_16","alias_value":"FAO6OGKWHAQ4TQII","created_at":"2026-07-05T04:32:51.924390+00:00"},{"alias_kind":"pith_short_8","alias_value":"FAO6OGKW","created_at":"2026-07-05T04:32:51.924390+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":24,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24447","citing_title":"P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17800","citing_title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.14970","citing_title":"Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09864","citing_title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27737","citing_title":"Bounded-Compute Multimodal Regression for Product-Rating Prediction","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02624","citing_title":"TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering","ref_index":109,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00539","citing_title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2512.12677","citing_title":"Fine-Tuning Causal LLMs for Text Classification: Embedding-Based vs. Instruction-Based Approaches","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2501.07237","citing_title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2501.17549","citing_title":"Query-Aware Learnable Graph Pooling Tokens as Prompt for Large Language Models","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2603.26603","citing_title":"Sustainability Is Not Linear: Quantifying Performance, Energy, and Privacy Trade-offs in On-Device Intelligence","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17552","citing_title":"Q-LocalAdam: Memory-Efficient Client-Side Adaptive Optimization for Edge Federated Learning","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2510.25977","citing_title":"NeuronMLP: Efficient LLM Inference via Singular Value Decomposition Compression and Tiling on AWS Trainium","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2601.11568","citing_title":"AdaFRUGAL: Adaptive Memory-Efficient Training with Dynamic Control","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2601.13684","citing_title":"HeteroCache: A Dynamic Retrieval Approach to Heterogeneous KV Cache Compression for Long-Context LLM Inference","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2202.12837","citing_title":"Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?","ref_index":167,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24820","citing_title":"Salca: A Sparsity-Aware Hardware Accelerator for Efficient Long-Context Attention Decoding","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23467","citing_title":"Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24785","citing_title":"Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05794","citing_title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06836","citing_title":"STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01870","citing_title":"Maistros: A Greek Large Language Model Adapted Through Knowledge Distillation From Large Reasoning Models","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5","json":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5.json","graph_json":"https://pith.science/api/pith-number/FAO6OGKWHAQ4TQIIHRC76D44S5/graph.json","events_json":"https://pith.science/api/pith-number/FAO6OGKWHAQ4TQIIHRC76D44S5/events.json","paper":"https://pith.science/paper/FAO6OGKW"},"agent_actions":{"view_html":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5","download_json":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5.json","view_paper":"https://pith.science/paper/FAO6OGKW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2110.02861&json=true","fetch_graph":"https://pith.science/api/pith-number/FAO6OGKWHAQ4TQIIHRC76D44S5/graph.json","fetch_events":"https://pith.science/api/pith-number/FAO6OGKWHAQ4TQIIHRC76D44S5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5/action/storage_attestation","attest_author":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5/action/author_attestation","sign_citation":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5/action/citation_signature","submit_replication":"https://pith.science/pith/FAO6OGKWHAQ4TQIIHRC76D44S5/action/replication_record"}},"created_at":"2026-07-05T04:32:51.924390+00:00","updated_at":"2026-07-05T04:32:51.924390+00:00"}