{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:W4WTH7TJIJHNE777PM65T3E4ZY","short_pith_number":"pith:W4WTH7TJ","schema_version":"1.0","canonical_sha256":"b72d33fe69424ed27fff7b3dd9ec9cce3753372ccd67d61f4685082161b9829e","source":{"kind":"arxiv","id":"2502.11058","version":1},"attestation_state":"computed","paper":{"title":"DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Amelie Chi Zhou, Bo Li, Junlin Huang, Rudan Yan, Shaohuai Shi, Xiaowen Chu, Xinglin Pan, Yuxin Wang, Zhenheng Tang, Zichen Tang","submitted_at":"2025-02-16T09:51:57Z","abstract_excerpt":"The growth of large language models (LLMs) increases challenges of accelerating distributed training across multiple GPUs in different data centers. Moreover, concerns about data privacy and data exhaustion have heightened interest in geo-distributed data centers. Communication in geo-distributed data parallel training (DDP) with stochastic gradient descent (S-SGD) is the main bottleneck in low-bandwidth environments. Local SGD mitigates communication overhead by reducing synchronization frequency, and recent studies have successfully applied it to geo-distributedly pre-train LLMs. However, we"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.11058","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.DC","submitted_at":"2025-02-16T09:51:57Z","cross_cats_sorted":[],"title_canon_sha256":"39fc47cf4e00ef4fa68102af948989fce07805f8839ce234984e774b8df2902c","abstract_canon_sha256":"a42dfef7e73a0e955ba09f43c271dc9be543d8ebae7b889df02f7ebc18250ce3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:03.053749Z","signature_b64":"hH0pihJ+1j/T6k89+WJDIGjnJ66ubbejzrOOQ+1Edptj2WOOj8I3fyQQo13udriJMHTvgphzdWpzQ+XYIvI/AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b72d33fe69424ed27fff7b3dd9ec9cce3753372ccd67d61f4685082161b9829e","last_reissued_at":"2026-07-05T10:15:03.053288Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:03.053288Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.DC","authors_text":"Amelie Chi Zhou, Bo Li, Junlin Huang, Rudan Yan, Shaohuai Shi, Xiaowen Chu, Xinglin Pan, Yuxin Wang, Zhenheng Tang, Zichen Tang","submitted_at":"2025-02-16T09:51:57Z","abstract_excerpt":"The growth of large language models (LLMs) increases challenges of accelerating distributed training across multiple GPUs in different data centers. Moreover, concerns about data privacy and data exhaustion have heightened interest in geo-distributed data centers. Communication in geo-distributed data parallel training (DDP) with stochastic gradient descent (S-SGD) is the main bottleneck in low-bandwidth environments. Local SGD mitigates communication overhead by reducing synchronization frequency, and recent studies have successfully applied it to geo-distributedly pre-train LLMs. However, we"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11058","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.11058/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.11058","created_at":"2026-07-05T10:15:03.053353+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.11058v1","created_at":"2026-07-05T10:15:03.053353+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11058","created_at":"2026-07-05T10:15:03.053353+00:00"},{"alias_kind":"pith_short_12","alias_value":"W4WTH7TJIJHN","created_at":"2026-07-05T10:15:03.053353+00:00"},{"alias_kind":"pith_short_16","alias_value":"W4WTH7TJIJHNE777","created_at":"2026-07-05T10:15:03.053353+00:00"},{"alias_kind":"pith_short_8","alias_value":"W4WTH7TJ","created_at":"2026-07-05T10:15:03.053353+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.07223","citing_title":"Compute Can't Handle the Truth: Why Communication Tax Prioritizes Memory and Interconnects in Modern AI Infrastructure","ref_index":209,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY","json":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY.json","graph_json":"https://pith.science/api/pith-number/W4WTH7TJIJHNE777PM65T3E4ZY/graph.json","events_json":"https://pith.science/api/pith-number/W4WTH7TJIJHNE777PM65T3E4ZY/events.json","paper":"https://pith.science/paper/W4WTH7TJ"},"agent_actions":{"view_html":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY","download_json":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY.json","view_paper":"https://pith.science/paper/W4WTH7TJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.11058&json=true","fetch_graph":"https://pith.science/api/pith-number/W4WTH7TJIJHNE777PM65T3E4ZY/graph.json","fetch_events":"https://pith.science/api/pith-number/W4WTH7TJIJHNE777PM65T3E4ZY/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY/action/timestamp_anchor","attest_storage":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY/action/storage_attestation","attest_author":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY/action/author_attestation","sign_citation":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY/action/citation_signature","submit_replication":"https://pith.science/pith/W4WTH7TJIJHNE777PM65T3E4ZY/action/replication_record"}},"created_at":"2026-07-05T10:15:03.053353+00:00","updated_at":"2026-07-05T10:15:03.053353+00:00"}