{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:55FVKBP5FC5QCY5ESL6ZJD5EKQ","short_pith_number":"pith:55FVKBP5","schema_version":"1.0","canonical_sha256":"ef4b5505fd28bb0163a492fd948fa45427a37800739d4c845a730ed18d4b04b4","source":{"kind":"arxiv","id":"2310.18313","version":2},"attestation_state":"computed","paper":{"title":"FP8-LM: Training FP8 Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Bolin Ni, Chen Li, Guoshuai Zhao, Han Hu, Houwen Peng, Jia Ning, Jingcheng Hu, Joe Chau, Kan Wu, Miaosen Zhang, Peng Cheng, Ruihang Li, Ruizhe Wang, Shuguang Liu, Yifan Xiong, Yixuan Wei, Yuxiang Yang, Ze Liu, Zheng Zhang, Ziyue Yang","submitted_at":"2023-10-27T17:59:51Z","abstract_excerpt":"In this paper, we explore FP8 low-bit data formats for efficient training of large language models (LLMs). Our key insight is that most variables, such as gradients and optimizer states, in LLM training can employ low-precision data formats without compromising model accuracy and requiring no changes to hyper-parameters. Specifically, we propose a new FP8 automatic mixed-precision framework for training LLMs. This framework offers three levels of FP8 utilization to streamline mixed-precision and distributed parallel training for LLMs. It gradually incorporates 8-bit gradients, optimizer states"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.18313","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-10-27T17:59:51Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"3c811e3704ba7d1eeb1ea9b3f29d7dd01add521a6285c6b2b93f5c0e31aa8fe7","abstract_canon_sha256":"4cd97b51d6c32b9747c4d556f88991c8ec9d0aa28a1c987a5bfbad88b5eb685c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:25:47.453817Z","signature_b64":"srsiYgSZR+jTqw0vXxdlkEGDs1YAxmDShWEX636vWiiOvA7qdolEP1k2hDxzJxk2FKdorZ8fhUyhXm9WziwsCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ef4b5505fd28bb0163a492fd948fa45427a37800739d4c845a730ed18d4b04b4","last_reissued_at":"2026-07-05T07:25:47.453367Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:25:47.453367Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FP8-LM: Training FP8 Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Bolin Ni, Chen Li, Guoshuai Zhao, Han Hu, Houwen Peng, Jia Ning, Jingcheng Hu, Joe Chau, Kan Wu, Miaosen Zhang, Peng Cheng, Ruihang Li, Ruizhe Wang, Shuguang Liu, Yifan Xiong, Yixuan Wei, Yuxiang Yang, Ze Liu, Zheng Zhang, Ziyue Yang","submitted_at":"2023-10-27T17:59:51Z","abstract_excerpt":"In this paper, we explore FP8 low-bit data formats for efficient training of large language models (LLMs). Our key insight is that most variables, such as gradients and optimizer states, in LLM training can employ low-precision data formats without compromising model accuracy and requiring no changes to hyper-parameters. Specifically, we propose a new FP8 automatic mixed-precision framework for training LLMs. This framework offers three levels of FP8 utilization to streamline mixed-precision and distributed parallel training for LLMs. It gradually incorporates 8-bit gradients, optimizer states"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.18313","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.18313/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.18313","created_at":"2026-07-05T07:25:47.453422+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.18313v2","created_at":"2026-07-05T07:25:47.453422+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.18313","created_at":"2026-07-05T07:25:47.453422+00:00"},{"alias_kind":"pith_short_12","alias_value":"55FVKBP5FC5Q","created_at":"2026-07-05T07:25:47.453422+00:00"},{"alias_kind":"pith_short_16","alias_value":"55FVKBP5FC5QCY5E","created_at":"2026-07-05T07:25:47.453422+00:00"},{"alias_kind":"pith_short_8","alias_value":"55FVKBP5","created_at":"2026-07-05T07:25:47.453422+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07494","citing_title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10493","citing_title":"Achieving Cloud-Grade SLOs for Local Mixture-of-Experts Inference through CPU-GPU Hybrid Design","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26189","citing_title":"Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27918","citing_title":"Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00539","citing_title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2412.04468","citing_title":"NVILA: Efficient Frontier Visual Language Models","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2510.08008","citing_title":"Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04212","citing_title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2512.12131","citing_title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13907","citing_title":"AIS: Adaptive Importance Sampling for Quantized RL","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02525","citing_title":"AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00539","citing_title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00539","citing_title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","ref_index":88,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15416","citing_title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ","json":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ.json","graph_json":"https://pith.science/api/pith-number/55FVKBP5FC5QCY5ESL6ZJD5EKQ/graph.json","events_json":"https://pith.science/api/pith-number/55FVKBP5FC5QCY5ESL6ZJD5EKQ/events.json","paper":"https://pith.science/paper/55FVKBP5"},"agent_actions":{"view_html":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ","download_json":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ.json","view_paper":"https://pith.science/paper/55FVKBP5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.18313&json=true","fetch_graph":"https://pith.science/api/pith-number/55FVKBP5FC5QCY5ESL6ZJD5EKQ/graph.json","fetch_events":"https://pith.science/api/pith-number/55FVKBP5FC5QCY5ESL6ZJD5EKQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ/action/storage_attestation","attest_author":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ/action/author_attestation","sign_citation":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ/action/citation_signature","submit_replication":"https://pith.science/pith/55FVKBP5FC5QCY5ESL6ZJD5EKQ/action/replication_record"}},"created_at":"2026-07-05T07:25:47.453422+00:00","updated_at":"2026-07-05T07:25:47.453422+00:00"}