{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:LW4VRSKDMINM3SA6PMVOKRUJRM","short_pith_number":"pith:LW4VRSKD","schema_version":"1.0","canonical_sha256":"5db958c943621acdc81e7b2ae546898b34cacd1462479e5a408d11df1950ba76","source":{"kind":"arxiv","id":"2506.01049","version":1},"attestation_state":"computed","paper":{"title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Dan Xu, Juanxi Tian, Siyuan Li, Wentao Zhang, Xin Jin, Zedong Wang, Zicheng Liu","submitted_at":"2025-06-01T15:30:37Z","abstract_excerpt":"Training large language models (LLMs) poses challenges due to their massive scale and heterogeneous architectures. While adaptive optimizers like AdamW help address gradient variations, they still struggle with efficient and effective parameter-wise learning rate estimation, resulting in training instability, slow convergence, and poor compatibility with parameter-efficient fine-tuning (PEFT) techniques. This work introduces Scaling with Gradient Grouping (SGG), an optimizer wrapper that improves adaptive learning rate estimation by dynamic grouping and group-specific scaling. SGG first groups"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.01049","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-06-01T15:30:37Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"f8cf1472a6dba9aa121de2ee4f7b7a33744042741182d83e04e9a7cdb6340e91","abstract_canon_sha256":"5e64dc10343262c1e7dd304164642b56cde3ea93a188ce8fa36be4b7ee99e58b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:13:45.094242Z","signature_b64":"mMAimT/InsuurGeLpQqZNADLZS98S2tBGL2W9mJjPG7UaD4ncZ7jt+VaELmyMET34QHpOsmm/xxgCgYARJApAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5db958c943621acdc81e7b2ae546898b34cacd1462479e5a408d11df1950ba76","last_reissued_at":"2026-07-05T11:13:45.093814Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:13:45.093814Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Dan Xu, Juanxi Tian, Siyuan Li, Wentao Zhang, Xin Jin, Zedong Wang, Zicheng Liu","submitted_at":"2025-06-01T15:30:37Z","abstract_excerpt":"Training large language models (LLMs) poses challenges due to their massive scale and heterogeneous architectures. While adaptive optimizers like AdamW help address gradient variations, they still struggle with efficient and effective parameter-wise learning rate estimation, resulting in training instability, slow convergence, and poor compatibility with parameter-efficient fine-tuning (PEFT) techniques. This work introduces Scaling with Gradient Grouping (SGG), an optimizer wrapper that improves adaptive learning rate estimation by dynamic grouping and group-specific scaling. SGG first groups"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.01049","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.01049/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.01049","created_at":"2026-07-05T11:13:45.093868+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.01049v1","created_at":"2026-07-05T11:13:45.093868+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.01049","created_at":"2026-07-05T11:13:45.093868+00:00"},{"alias_kind":"pith_short_12","alias_value":"LW4VRSKDMINM","created_at":"2026-07-05T11:13:45.093868+00:00"},{"alias_kind":"pith_short_16","alias_value":"LW4VRSKDMINM3SA6","created_at":"2026-07-05T11:13:45.093868+00:00"},{"alias_kind":"pith_short_8","alias_value":"LW4VRSKD","created_at":"2026-07-05T11:13:45.093868+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.05794","citing_title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM","json":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM.json","graph_json":"https://pith.science/api/pith-number/LW4VRSKDMINM3SA6PMVOKRUJRM/graph.json","events_json":"https://pith.science/api/pith-number/LW4VRSKDMINM3SA6PMVOKRUJRM/events.json","paper":"https://pith.science/paper/LW4VRSKD"},"agent_actions":{"view_html":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM","download_json":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM.json","view_paper":"https://pith.science/paper/LW4VRSKD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.01049&json=true","fetch_graph":"https://pith.science/api/pith-number/LW4VRSKDMINM3SA6PMVOKRUJRM/graph.json","fetch_events":"https://pith.science/api/pith-number/LW4VRSKDMINM3SA6PMVOKRUJRM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM/action/storage_attestation","attest_author":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM/action/author_attestation","sign_citation":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM/action/citation_signature","submit_replication":"https://pith.science/pith/LW4VRSKDMINM3SA6PMVOKRUJRM/action/replication_record"}},"created_at":"2026-07-05T11:13:45.093868+00:00","updated_at":"2026-07-05T11:13:45.093868+00:00"}