{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:RBUJI5HTJABKCDHF6ZOLD4RHJN","short_pith_number":"pith:RBUJI5HT","schema_version":"1.0","canonical_sha256":"88689474f34802a10ce5f65cb1f2274b655541e5cef4dd17dae652740dc3e67a","source":{"kind":"arxiv","id":"2504.07866","version":2},"attestation_state":"computed","paper":{"title":"Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Baojun Wang, Bin Wang, Bo Wang, Boxiao Liu, Can Chen, Changzheng Zhang, Dandan Tu, Dong Li, Duyu Tang, Fei Mi, Fisher Yu, Hui Jin, Jiansheng Wei, Jiarui Qin, Jinpeng Li, Jun Zhao, Kaikai Song, Lin Li, Liqun Deng, Minghui Xu, Naifu Zhang, Nianzu Zheng, Peng Guo, Qiang Li, Rongju Ruan, Ruiming Tang, Shengjun Cheng, Tianyu Guo, Wei Guo, Wei He, Wei Li, Weiwen Liu, Wenyong Huang, Wulong Liu, Xiaojun Meng, Xinyi Dai, Xueyu Wu, Yaoyuan Wang, Yasheng Wang, Yehui Tang, Yichun Yin, Yin Li, Yonghan Dong, Yue Li, Yufei Wang, Yujun Li, Yunhe Wang, Yunsheng Ni, Yu Pan, Zhe Liu, Zhenhe Zhang, Zhicheng Liu","submitted_at":"2025-04-10T15:41:51Z","abstract_excerpt":"We present Pangu Ultra, a Large Language Model (LLM) with 135 billion parameters and dense Transformer modules trained on Ascend Neural Processing Units (NPUs). Although the field of LLM has been witnessing unprecedented advances in pushing the scale and capability of LLM in recent years, training such a large-scale model still involves significant optimization and system challenges. To stabilize the training process, we propose depth-scaled sandwich normalization, which effectively eliminates loss spikes during the training process of deep models. We pre-train our model on 13.2 trillion diver"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.07866","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-04-10T15:41:51Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"f64b59b301622953155af65e79b1a44c52050a1182f8d1ce1fbc7cc91a935797","abstract_canon_sha256":"8cc6ee5602d9d8c82db9015d91a53ccd0e313387f33a045469e83ac1c5500d6d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:47:40.185978Z","signature_b64":"BNn1/ktnCC+YPDEKlN93OPc17CNIs9roRtQ76M+1I9JS9qOweYjfswLLUUWAkVo4zjBy2K72ie6OkJG+/ej9Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"88689474f34802a10ce5f65cb1f2274b655541e5cef4dd17dae652740dc3e67a","last_reissued_at":"2026-07-05T10:47:40.185454Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:47:40.185454Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Pangu Ultra: Pushing the Limits of Dense Large Language Models on Ascend NPUs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Baojun Wang, Bin Wang, Bo Wang, Boxiao Liu, Can Chen, Changzheng Zhang, Dandan Tu, Dong Li, Duyu Tang, Fei Mi, Fisher Yu, Hui Jin, Jiansheng Wei, Jiarui Qin, Jinpeng Li, Jun Zhao, Kaikai Song, Lin Li, Liqun Deng, Minghui Xu, Naifu Zhang, Nianzu Zheng, Peng Guo, Qiang Li, Rongju Ruan, Ruiming Tang, Shengjun Cheng, Tianyu Guo, Wei Guo, Wei He, Wei Li, Weiwen Liu, Wenyong Huang, Wulong Liu, Xiaojun Meng, Xinyi Dai, Xueyu Wu, Yaoyuan Wang, Yasheng Wang, Yehui Tang, Yichun Yin, Yin Li, Yonghan Dong, Yue Li, Yufei Wang, Yujun Li, Yunhe Wang, Yunsheng Ni, Yu Pan, Zhe Liu, Zhenhe Zhang, Zhicheng Liu","submitted_at":"2025-04-10T15:41:51Z","abstract_excerpt":"We present Pangu Ultra, a Large Language Model (LLM) with 135 billion parameters and dense Transformer modules trained on Ascend Neural Processing Units (NPUs). Although the field of LLM has been witnessing unprecedented advances in pushing the scale and capability of LLM in recent years, training such a large-scale model still involves significant optimization and system challenges. To stabilize the training process, we propose depth-scaled sandwich normalization, which effectively eliminates loss spikes during the training process of deep models. We pre-train our model on 13.2 trillion diver"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.07866","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.07866/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.07866","created_at":"2026-07-05T10:47:40.185517+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.07866v2","created_at":"2026-07-05T10:47:40.185517+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.07866","created_at":"2026-07-05T10:47:40.185517+00:00"},{"alias_kind":"pith_short_12","alias_value":"RBUJI5HTJABK","created_at":"2026-07-05T10:47:40.185517+00:00"},{"alias_kind":"pith_short_16","alias_value":"RBUJI5HTJABKCDHF","created_at":"2026-07-05T10:47:40.185517+00:00"},{"alias_kind":"pith_short_8","alias_value":"RBUJI5HT","created_at":"2026-07-05T10:47:40.185517+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN","json":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN.json","graph_json":"https://pith.science/api/pith-number/RBUJI5HTJABKCDHF6ZOLD4RHJN/graph.json","events_json":"https://pith.science/api/pith-number/RBUJI5HTJABKCDHF6ZOLD4RHJN/events.json","paper":"https://pith.science/paper/RBUJI5HT"},"agent_actions":{"view_html":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN","download_json":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN.json","view_paper":"https://pith.science/paper/RBUJI5HT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.07866&json=true","fetch_graph":"https://pith.science/api/pith-number/RBUJI5HTJABKCDHF6ZOLD4RHJN/graph.json","fetch_events":"https://pith.science/api/pith-number/RBUJI5HTJABKCDHF6ZOLD4RHJN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN/action/storage_attestation","attest_author":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN/action/author_attestation","sign_citation":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN/action/citation_signature","submit_replication":"https://pith.science/pith/RBUJI5HTJABKCDHF6ZOLD4RHJN/action/replication_record"}},"created_at":"2026-07-05T10:47:40.185517+00:00","updated_at":"2026-07-05T10:47:40.185517+00:00"}