{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:V4ACOPCXRVDIKLMGBWVAUACPNA","short_pith_number":"pith:V4ACOPCX","schema_version":"1.0","canonical_sha256":"af00273c578d46852d860daa0a004f681517fd8b971d83bf385e1ce296d61af4","source":{"kind":"arxiv","id":"2411.13055","version":2},"attestation_state":"computed","paper":{"title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Emma Strubell, Jacob Kahn, Jared Fernandez, Kalyan Saladi, Leonid Shamis, Luca Wehrstedt, Mostafa Elhoushi, Yonatan Bisk","submitted_at":"2024-11-20T06:05:11Z","abstract_excerpt":"Dramatic increases in the capabilities of neural network models in recent years are driven by scaling model size, training data, and corresponding computational resources. To develop the exceedingly large networks required in modern applications, such as large language models (LLMs), model training is distributed across tens of thousands of hardware accelerators (e.g. GPUs), requiring orchestration of computation and communication across large computing clusters. In this work, we demonstrate that careful consideration of hardware configuration and parallelization strategy is critical for effec"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.13055","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-11-20T06:05:11Z","cross_cats_sorted":["cs.DC"],"title_canon_sha256":"d25ff177a2e9ae352637f663022832ae40de46ad72dbb326c1a8b2a0cd31f4b4","abstract_canon_sha256":"e906778f1a67cb92cc263242876a457bdf1b7cb8b53a8e7260b909420fc40311"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:48:21.605970Z","signature_b64":"n+U0iJWdLkCOQmhZ6fOlRGvNX+kOoiiFdsvM0DDUeSUaYWR0rzY1yRg79aTBgHd8MfCmF25HU4SHaoh6d22ZCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"af00273c578d46852d860daa0a004f681517fd8b971d83bf385e1ce296d61af4","last_reissued_at":"2026-07-05T10:48:21.605434Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:48:21.605434Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.DC"],"primary_cat":"cs.LG","authors_text":"Emma Strubell, Jacob Kahn, Jared Fernandez, Kalyan Saladi, Leonid Shamis, Luca Wehrstedt, Mostafa Elhoushi, Yonatan Bisk","submitted_at":"2024-11-20T06:05:11Z","abstract_excerpt":"Dramatic increases in the capabilities of neural network models in recent years are driven by scaling model size, training data, and corresponding computational resources. To develop the exceedingly large networks required in modern applications, such as large language models (LLMs), model training is distributed across tens of thousands of hardware accelerators (e.g. GPUs), requiring orchestration of computation and communication across large computing clusters. In this work, we demonstrate that careful consideration of hardware configuration and parallelization strategy is critical for effec"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.13055","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.13055/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.13055","created_at":"2026-07-05T10:48:21.605491+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.13055v2","created_at":"2026-07-05T10:48:21.605491+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.13055","created_at":"2026-07-05T10:48:21.605491+00:00"},{"alias_kind":"pith_short_12","alias_value":"V4ACOPCXRVDI","created_at":"2026-07-05T10:48:21.605491+00:00"},{"alias_kind":"pith_short_16","alias_value":"V4ACOPCXRVDIKLMG","created_at":"2026-07-05T10:48:21.605491+00:00"},{"alias_kind":"pith_short_8","alias_value":"V4ACOPCX","created_at":"2026-07-05T10:48:21.605491+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19789","citing_title":"Dynamic Core Allocation for Malleable Jobs with Unknown Speed-up Parameters","ref_index":21,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA","json":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA.json","graph_json":"https://pith.science/api/pith-number/V4ACOPCXRVDIKLMGBWVAUACPNA/graph.json","events_json":"https://pith.science/api/pith-number/V4ACOPCXRVDIKLMGBWVAUACPNA/events.json","paper":"https://pith.science/paper/V4ACOPCX"},"agent_actions":{"view_html":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA","download_json":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA.json","view_paper":"https://pith.science/paper/V4ACOPCX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.13055&json=true","fetch_graph":"https://pith.science/api/pith-number/V4ACOPCXRVDIKLMGBWVAUACPNA/graph.json","fetch_events":"https://pith.science/api/pith-number/V4ACOPCXRVDIKLMGBWVAUACPNA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA/action/storage_attestation","attest_author":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA/action/author_attestation","sign_citation":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA/action/citation_signature","submit_replication":"https://pith.science/pith/V4ACOPCXRVDIKLMGBWVAUACPNA/action/replication_record"}},"created_at":"2026-07-05T10:48:21.605491+00:00","updated_at":"2026-07-05T10:48:21.605491+00:00"}