{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:JUIFUDBUOGE5QWPZTRM7HML7KN","short_pith_number":"pith:JUIFUDBU","schema_version":"1.0","canonical_sha256":"4d105a0c347189d859f99c59f3b17f535367130a04f822bc26572f248c5d0e9a","source":{"kind":"arxiv","id":"2310.12670","version":4},"attestation_state":"computed","paper":{"title":"Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.PF"],"primary_cat":"cs.DC","authors_text":"Amelie Chi Zhou, Bingsheng He, Shaohuai Shi, Xiaowen Chu, Xiaoyu Wu, Xinglin Pan, Xin He, Xueze Kang, Yang Zheng, Yuxin Wang, Zhenheng Tang","submitted_at":"2023-10-19T11:59:01Z","abstract_excerpt":"To efficiently scale large model (LM) training, researchers transition from data parallelism (DP) to hybrid parallelism (HP) on GPU clusters, which frequently experience hardware and software failures. Existing works introduce in-memory checkpointing optimizations that snapshot parameters to device memory for rapid failure recovery. However, these methods introduce severe resource competition between checkpointing and training, which can work under DP but can hardly scale under resource-intensive HP. To ensure low checkpointing overhead for hybrid-parallel training, this paper introduces a dis"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.12670","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.DC","submitted_at":"2023-10-19T11:59:01Z","cross_cats_sorted":["cs.PF"],"title_canon_sha256":"a5f88e90d461b1a7b383c93d649e31a3dc012a023f2261e71c1963aa78e8f409","abstract_canon_sha256":"d89c41bd51c0bfc183ca7c372ef79ba2ff90c5b204d85ba95ed8094ad5084501"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:56:45.809720Z","signature_b64":"pAti07Wi9DNf2rW0sbR++ABVp3H33PUTHf75zE57LDMSyZcIuxAQ7uT4Ri2/CBn/rGTEkM6HcQ81M5W55xRAAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4d105a0c347189d859f99c59f3b17f535367130a04f822bc26572f248c5d0e9a","last_reissued_at":"2026-07-05T08:56:45.809221Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:56:45.809221Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Fault-Tolerant Hybrid-Parallel Training at Scale with Reliable and Efficient In-memory Checkpointing","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.PF"],"primary_cat":"cs.DC","authors_text":"Amelie Chi Zhou, Bingsheng He, Shaohuai Shi, Xiaowen Chu, Xiaoyu Wu, Xinglin Pan, Xin He, Xueze Kang, Yang Zheng, Yuxin Wang, Zhenheng Tang","submitted_at":"2023-10-19T11:59:01Z","abstract_excerpt":"To efficiently scale large model (LM) training, researchers transition from data parallelism (DP) to hybrid parallelism (HP) on GPU clusters, which frequently experience hardware and software failures. Existing works introduce in-memory checkpointing optimizations that snapshot parameters to device memory for rapid failure recovery. However, these methods introduce severe resource competition between checkpointing and training, which can work under DP but can hardly scale under resource-intensive HP. To ensure low checkpointing overhead for hybrid-parallel training, this paper introduces a dis"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.12670","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.12670/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.12670","created_at":"2026-07-05T08:56:45.809280+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.12670v4","created_at":"2026-07-05T08:56:45.809280+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.12670","created_at":"2026-07-05T08:56:45.809280+00:00"},{"alias_kind":"pith_short_12","alias_value":"JUIFUDBUOGE5","created_at":"2026-07-05T08:56:45.809280+00:00"},{"alias_kind":"pith_short_16","alias_value":"JUIFUDBUOGE5QWPZ","created_at":"2026-07-05T08:56:45.809280+00:00"},{"alias_kind":"pith_short_8","alias_value":"JUIFUDBU","created_at":"2026-07-05T08:56:45.809280+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.04478","citing_title":"CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN","json":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN.json","graph_json":"https://pith.science/api/pith-number/JUIFUDBUOGE5QWPZTRM7HML7KN/graph.json","events_json":"https://pith.science/api/pith-number/JUIFUDBUOGE5QWPZTRM7HML7KN/events.json","paper":"https://pith.science/paper/JUIFUDBU"},"agent_actions":{"view_html":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN","download_json":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN.json","view_paper":"https://pith.science/paper/JUIFUDBU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.12670&json=true","fetch_graph":"https://pith.science/api/pith-number/JUIFUDBUOGE5QWPZTRM7HML7KN/graph.json","fetch_events":"https://pith.science/api/pith-number/JUIFUDBUOGE5QWPZTRM7HML7KN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN/action/storage_attestation","attest_author":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN/action/author_attestation","sign_citation":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN/action/citation_signature","submit_replication":"https://pith.science/pith/JUIFUDBUOGE5QWPZTRM7HML7KN/action/replication_record"}},"created_at":"2026-07-05T08:56:45.809280+00:00","updated_at":"2026-07-05T08:56:45.809280+00:00"}