{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2021:FD43YRPUU5LLVM62XS5MXDGZ55","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"deb3f179d33f955dab38ff7a11642ca6128524bb2d1ad4c7ece38819fc163474","cross_cats_sorted":["cs.DC"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2021-08-13T06:32:53Z","title_canon_sha256":"722ef2485bcb91b74dca82bfd4631f6d0d6a12b4f10fd30998d8a1b863e3a69f"},"schema_version":"1.0","source":{"id":"2108.06084","kind":"arxiv","version":4}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2108.06084","created_at":"2026-07-05T05:06:51Z"},{"alias_kind":"arxiv_version","alias_value":"2108.06084v4","created_at":"2026-07-05T05:06:51Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2108.06084","created_at":"2026-07-05T05:06:51Z"},{"alias_kind":"pith_short_12","alias_value":"FD43YRPUU5LL","created_at":"2026-07-05T05:06:51Z"},{"alias_kind":"pith_short_16","alias_value":"FD43YRPUU5LLVM62","created_at":"2026-07-05T05:06:51Z"},{"alias_kind":"pith_short_8","alias_value":"FD43YRPU","created_at":"2026-07-05T05:06:51Z"}],"graph_snapshots":[{"event_id":"sha256:ac006c7b70ca36fa80545d73801b2bb3a7b5ab7de27a8b55d69b0cf032d7383e","target":"graph","created_at":"2026-07-05T05:06:51Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2108.06084/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Recent works have demonstrated great success in pre-training large-scale autoregressive language models on massive GPUs. To reduce the wall-clock training time, a common practice is to increase the batch size and learning rate. However, such practice is often brittle and leads to a so-called stability-efficiency dilemma: increasing the batch sizes and learning rates leads to better training efficiency but can also result in training instability, leading to poor generalization accuracy or failed runs. To better understand this phenomenon, we conduct an in-depth analysis on large-scale pre-train","authors_text":"Conglong Li, Minjia Zhang, Yuxiong He","cross_cats":["cs.DC"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2021-08-13T06:32:53Z","title":"The Stability-Efficiency Dilemma: Investigating Sequence Length Warmup for Training GPT Models"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2108.06084","kind":"arxiv","version":4},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:3c1251ed73207c23c6e88654c1fc42d7083e96d96532695461541db6f65f0f6e","target":"record","created_at":"2026-07-05T05:06:51Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"deb3f179d33f955dab38ff7a11642ca6128524bb2d1ad4c7ece38819fc163474","cross_cats_sorted":["cs.DC"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2021-08-13T06:32:53Z","title_canon_sha256":"722ef2485bcb91b74dca82bfd4631f6d0d6a12b4f10fd30998d8a1b863e3a69f"},"schema_version":"1.0","source":{"id":"2108.06084","kind":"arxiv","version":4}},"canonical_sha256":"28f9bc45f4a756bab3dabcbacb8cd9ef5ad19928e64325ae0416a88dfb8683ec","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"28f9bc45f4a756bab3dabcbacb8cd9ef5ad19928e64325ae0416a88dfb8683ec","first_computed_at":"2026-07-05T05:06:51.743971Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T05:06:51.743971Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"weY4USCldldJEud4RfrEbFiL720ShcPgPggKWnjsN+7OudzKnSu7kkj+r5gBMEZccJ+36NphgW/DeiR4FAfbDw==","signature_status":"signed_v1","signed_at":"2026-07-05T05:06:51.744383Z","signed_message":"canonical_sha256_bytes"},"source_id":"2108.06084","source_kind":"arxiv","source_version":4}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:3c1251ed73207c23c6e88654c1fc42d7083e96d96532695461541db6f65f0f6e","sha256:ac006c7b70ca36fa80545d73801b2bb3a7b5ab7de27a8b55d69b0cf032d7383e"],"state_sha256":"4da0644a67f837541b48a36426cedd257e266182d6817f266a4c2b2bcb3e05b4"}