{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:7GPYI7W74ENF4LEP6QFTHOKCW5","short_pith_number":"pith:7GPYI7W7","schema_version":"1.0","canonical_sha256":"f99f847edfe11a5e2c8ff40b33b942b752cca41031ae9847f9394e2e3168349a","source":{"kind":"arxiv","id":"2502.04164","version":2},"attestation_state":"computed","paper":{"title":"Efficient Distributed Optimization under Heavy-Tailed Noise","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Manzil Zaheer, Su Hyeong Lee, Tian Li","submitted_at":"2025-02-06T15:47:18Z","abstract_excerpt":"Distributed optimization has become the default training paradigm in modern machine learning due to the growing scale of models and datasets. To mitigate communication overhead, local updates are often applied before global aggregation, resulting in a nested optimization approach with inner and outer steps. However, heavy-tailed stochastic gradient noise remains a significant challenge, particularly in attention-based models, hindering effective training. In this work, we propose TailOPT, an efficient framework designed to address heavy-tailed noise by leveraging adaptive optimization or clipp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.04164","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-02-06T15:47:18Z","cross_cats_sorted":[],"title_canon_sha256":"16e68df10db98d683aeeb283cc82368b6f2b517e1e695ac716eefd8a92d612b5","abstract_canon_sha256":"a7d59045eb62f01f57e620750a07e56c6bf2f868b7ba01ddf0c9751c2fa1d56f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:53:43.965659Z","signature_b64":"DRXqv+OydtZxEu4kiTB+n2lNxslVyRAp5Zf/LUvYmDFvRxj/EiUEVH616Z1FcIFDEBWQPZoSo3JeNz74qVbvBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f99f847edfe11a5e2c8ff40b33b942b752cca41031ae9847f9394e2e3168349a","last_reissued_at":"2026-07-05T11:53:43.965189Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:53:43.965189Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Efficient Distributed Optimization under Heavy-Tailed Noise","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Manzil Zaheer, Su Hyeong Lee, Tian Li","submitted_at":"2025-02-06T15:47:18Z","abstract_excerpt":"Distributed optimization has become the default training paradigm in modern machine learning due to the growing scale of models and datasets. To mitigate communication overhead, local updates are often applied before global aggregation, resulting in a nested optimization approach with inner and outer steps. However, heavy-tailed stochastic gradient noise remains a significant challenge, particularly in attention-based models, hindering effective training. In this work, we propose TailOPT, an efficient framework designed to address heavy-tailed noise by leveraging adaptive optimization or clipp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.04164","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.04164/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.04164","created_at":"2026-07-05T11:53:43.965258+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.04164v2","created_at":"2026-07-05T11:53:43.965258+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.04164","created_at":"2026-07-05T11:53:43.965258+00:00"},{"alias_kind":"pith_short_12","alias_value":"7GPYI7W74ENF","created_at":"2026-07-05T11:53:43.965258+00:00"},{"alias_kind":"pith_short_16","alias_value":"7GPYI7W74ENF4LEP","created_at":"2026-07-05T11:53:43.965258+00:00"},{"alias_kind":"pith_short_8","alias_value":"7GPYI7W7","created_at":"2026-07-05T11:53:43.965258+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01720","citing_title":"A Note on Stability for Orthogonalized Matrix Momentum with Client Sampling","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2505.03736","citing_title":"Decentralized Nonconvex Optimization under Heavy-Tailed Noise: Normalization and Optimal Convergence","ref_index":35,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5","json":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5.json","graph_json":"https://pith.science/api/pith-number/7GPYI7W74ENF4LEP6QFTHOKCW5/graph.json","events_json":"https://pith.science/api/pith-number/7GPYI7W74ENF4LEP6QFTHOKCW5/events.json","paper":"https://pith.science/paper/7GPYI7W7"},"agent_actions":{"view_html":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5","download_json":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5.json","view_paper":"https://pith.science/paper/7GPYI7W7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.04164&json=true","fetch_graph":"https://pith.science/api/pith-number/7GPYI7W74ENF4LEP6QFTHOKCW5/graph.json","fetch_events":"https://pith.science/api/pith-number/7GPYI7W74ENF4LEP6QFTHOKCW5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5/action/storage_attestation","attest_author":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5/action/author_attestation","sign_citation":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5/action/citation_signature","submit_replication":"https://pith.science/pith/7GPYI7W74ENF4LEP6QFTHOKCW5/action/replication_record"}},"created_at":"2026-07-05T11:53:43.965258+00:00","updated_at":"2026-07-05T11:53:43.965258+00:00"}