{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:3DSE5OWAWHLAGSWDL2KJ3IZ6SN","short_pith_number":"pith:3DSE5OWA","schema_version":"1.0","canonical_sha256":"d8e44ebac0b1d6034ac35e949da33e935f8b528d59a4f83931a5a3389903bfe0","source":{"kind":"arxiv","id":"2503.17924","version":1},"attestation_state":"computed","paper":{"title":"WLB-LLM: Workload-Balanced 4D Parallelism for Large Language Model Training","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.DC","authors_text":"Anna Cai, Chris Cai, Jianyu Huang, Jie Wang, Shikai Li, Weiwei Chu, Xinfeng Xie, Yuchen Hao, Yue Guan, Yufei Ding, Zaifeng Pan, Zheng Wang","submitted_at":"2025-03-23T03:40:45Z","abstract_excerpt":"In this work, we present WLB-LLM, a workLoad-balanced 4D parallelism for large language model training. We first thoroughly analyze the workload imbalance issue in LLM training and identify two primary sources of imbalance at the pipeline parallelism and context parallelism levels. Then, to address the imbalance issue, at the pipeline parallelism level, WLB-LLM incorporates a workload-aware variable-length document packing method to balance the computation and communication workload across micro-batches. Additionally, at the context parallelism level, WLB-LLM introduces a novel fine-grained pe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.17924","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.DC","submitted_at":"2025-03-23T03:40:45Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"9ce11c5a8132cfdb72b6d53d5f92ffbff221b580dbed3eb7425d5ac9bb8fab79","abstract_canon_sha256":"a047e6f19d78601a3cd0c847b3317f6a4b3f9092e370a6de9a889f267ba1a219"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:37:58.674416Z","signature_b64":"BWIRrap42Y/K0ehEFF9qab3B0s5C+cs6zrTaReZ25UpM6E5e6yvWIBPnadO0nuk7vfwJ8CsFzlXAsu5DuqqJDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d8e44ebac0b1d6034ac35e949da33e935f8b528d59a4f83931a5a3389903bfe0","last_reissued_at":"2026-07-05T10:37:58.673895Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:37:58.673895Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"WLB-LLM: Workload-Balanced 4D Parallelism for Large Language Model Training","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.DC","authors_text":"Anna Cai, Chris Cai, Jianyu Huang, Jie Wang, Shikai Li, Weiwei Chu, Xinfeng Xie, Yuchen Hao, Yue Guan, Yufei Ding, Zaifeng Pan, Zheng Wang","submitted_at":"2025-03-23T03:40:45Z","abstract_excerpt":"In this work, we present WLB-LLM, a workLoad-balanced 4D parallelism for large language model training. We first thoroughly analyze the workload imbalance issue in LLM training and identify two primary sources of imbalance at the pipeline parallelism and context parallelism levels. Then, to address the imbalance issue, at the pipeline parallelism level, WLB-LLM incorporates a workload-aware variable-length document packing method to balance the computation and communication workload across micro-batches. Additionally, at the context parallelism level, WLB-LLM introduces a novel fine-grained pe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.17924","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.17924/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.17924","created_at":"2026-07-05T10:37:58.673953+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.17924v1","created_at":"2026-07-05T10:37:58.673953+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.17924","created_at":"2026-07-05T10:37:58.673953+00:00"},{"alias_kind":"pith_short_12","alias_value":"3DSE5OWAWHLA","created_at":"2026-07-05T10:37:58.673953+00:00"},{"alias_kind":"pith_short_16","alias_value":"3DSE5OWAWHLAGSWD","created_at":"2026-07-05T10:37:58.673953+00:00"},{"alias_kind":"pith_short_8","alias_value":"3DSE5OWA","created_at":"2026-07-05T10:37:58.673953+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2510.18830","citing_title":"MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2509.21275","citing_title":"InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08962","citing_title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","ref_index":55,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN","json":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN.json","graph_json":"https://pith.science/api/pith-number/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/graph.json","events_json":"https://pith.science/api/pith-number/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/events.json","paper":"https://pith.science/paper/3DSE5OWA"},"agent_actions":{"view_html":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN","download_json":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN.json","view_paper":"https://pith.science/paper/3DSE5OWA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.17924&json=true","fetch_graph":"https://pith.science/api/pith-number/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/graph.json","fetch_events":"https://pith.science/api/pith-number/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/action/storage_attestation","attest_author":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/action/author_attestation","sign_citation":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/action/citation_signature","submit_replication":"https://pith.science/pith/3DSE5OWAWHLAGSWDL2KJ3IZ6SN/action/replication_record"}},"created_at":"2026-07-05T10:37:58.673953+00:00","updated_at":"2026-07-05T10:37:58.673953+00:00"}