{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FZZECVVPM6FO2KI6MM5KH5DRBH","short_pith_number":"pith:FZZECVVP","schema_version":"1.0","canonical_sha256":"2e724156af678aed291e633aa3f47109fcb3cc13e362a5a1f6d1e70c942a5d91","source":{"kind":"arxiv","id":"2405.15682","version":4},"attestation_state":"computed","paper":{"title":"The Road Less Scheduled","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Aaron Defazio, Ahmed Khaled, Ashok Cutkosky, Harsh Mehta, Konstantin Mishchenko, Xingyu Alice Yang","submitted_at":"2024-05-24T16:20:46Z","abstract_excerpt":"Existing learning rate schedules that do not require specification of the optimization stopping step T are greatly out-performed by learning rate schedules that depend on T. We propose an approach that avoids the need for this stopping time by eschewing the use of schedules entirely, while exhibiting state-of-the-art performance compared to schedules across a wide family of problems ranging from convex problems to large-scale deep learning problems. Our Schedule-Free approach introduces no additional hyper-parameters over standard optimizers with momentum. Our method is a direct consequence of"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.15682","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-05-24T16:20:46Z","cross_cats_sorted":["cs.AI","math.OC","stat.ML"],"title_canon_sha256":"e3f18caee193919fdd63e1faac2ca5e4dd1c7130b8e3cd7018772b1cb1921a83","abstract_canon_sha256":"b8a23ec99be1b2724147fbf7a4fb5375d0edf7b9e8c7c6dc0b1ba3ae372099d9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:28:12.225957Z","signature_b64":"cWkX1+SW1TPVrvA9+4xFIK8iFu46AFrj77M76bS7Z+VWUcioA2bm3ZiA7wW9kNty8iXedlPtu3XS6me0h7eWAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2e724156af678aed291e633aa3f47109fcb3cc13e362a5a1f6d1e70c942a5d91","last_reissued_at":"2026-07-05T09:28:12.225544Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:28:12.225544Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Road Less Scheduled","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Aaron Defazio, Ahmed Khaled, Ashok Cutkosky, Harsh Mehta, Konstantin Mishchenko, Xingyu Alice Yang","submitted_at":"2024-05-24T16:20:46Z","abstract_excerpt":"Existing learning rate schedules that do not require specification of the optimization stopping step T are greatly out-performed by learning rate schedules that depend on T. We propose an approach that avoids the need for this stopping time by eschewing the use of schedules entirely, while exhibiting state-of-the-art performance compared to schedules across a wide family of problems ranging from convex problems to large-scale deep learning problems. Our Schedule-Free approach introduces no additional hyper-parameters over standard optimizers with momentum. Our method is a direct consequence of"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.15682","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.15682/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.15682","created_at":"2026-07-05T09:28:12.225600+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.15682v4","created_at":"2026-07-05T09:28:12.225600+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.15682","created_at":"2026-07-05T09:28:12.225600+00:00"},{"alias_kind":"pith_short_12","alias_value":"FZZECVVPM6FO","created_at":"2026-07-05T09:28:12.225600+00:00"},{"alias_kind":"pith_short_16","alias_value":"FZZECVVPM6FO2KI6","created_at":"2026-07-05T09:28:12.225600+00:00"},{"alias_kind":"pith_short_8","alias_value":"FZZECVVP","created_at":"2026-07-05T09:28:12.225600+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26894","citing_title":"Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21433","citing_title":"Central limit theorem for the averaged Adam optimizer","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05610","citing_title":"Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06458","citing_title":"In-Context Multiple Instance Learning","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01712","citing_title":"CoAction: Cross-task Correlation-aware Pareto Set Learning","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2502.07529","citing_title":"Training Deep Learning Models with Norm-Constrained LMOs","ref_index":173,"is_internal_anchor":false},{"citing_arxiv_id":"2603.14845","citing_title":"Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09949","citing_title":"From Syntax to Semantics: Unveiling the Emergence of Chirality in SMILES Translation Models","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24708","citing_title":"Scalable Hyperparameter-Divergent Ensemble Training with Automatic Learning Rate Exploration for Large Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21153","citing_title":"Image-Based Malware Type Classification on MalNet-Image Tiny: Effects of Multi-Scale Fusion, Transfer Learning, Data Augmentation, and Schedule-Free Optimization","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01712","citing_title":"CoAction: Cross-task Correlation-aware Pareto Set Learning","ref_index":27,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH","json":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH.json","graph_json":"https://pith.science/api/pith-number/FZZECVVPM6FO2KI6MM5KH5DRBH/graph.json","events_json":"https://pith.science/api/pith-number/FZZECVVPM6FO2KI6MM5KH5DRBH/events.json","paper":"https://pith.science/paper/FZZECVVP"},"agent_actions":{"view_html":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH","download_json":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH.json","view_paper":"https://pith.science/paper/FZZECVVP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.15682&json=true","fetch_graph":"https://pith.science/api/pith-number/FZZECVVPM6FO2KI6MM5KH5DRBH/graph.json","fetch_events":"https://pith.science/api/pith-number/FZZECVVPM6FO2KI6MM5KH5DRBH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH/action/storage_attestation","attest_author":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH/action/author_attestation","sign_citation":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH/action/citation_signature","submit_replication":"https://pith.science/pith/FZZECVVPM6FO2KI6MM5KH5DRBH/action/replication_record"}},"created_at":"2026-07-05T09:28:12.225600+00:00","updated_at":"2026-07-05T09:28:12.225600+00:00"}