{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:RCEJQYLZE476X25UPM437ADAUM","short_pith_number":"pith:RCEJQYLZ","schema_version":"1.0","canonical_sha256":"8888986179273febebb47b39bf8060a33626b9ae4d8076b26f82da13ca91f269","source":{"kind":"arxiv","id":"2302.06675","version":4},"attestation_state":"computed","paper":{"title":"Symbolic Discovery of Optimization Algorithms","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CV","cs.NE"],"primary_cat":"cs.LG","authors_text":"Chen Liang, Cho-Jui Hsieh, Da Huang, Esteban Real, Hieu Pham, Kaiyuan Wang, Quoc V. Le, Thang Luong, Xiangning Chen, Xuanyi Dong, Yao Liu, Yifeng Lu","submitted_at":"2023-02-13T20:27:30Z","abstract_excerpt":"We present a method to formulate algorithm discovery as program search, and apply it to discover optimization algorithms for deep neural network training. We leverage efficient search techniques to explore an infinite and sparse program space. To bridge the large generalization gap between proxy and target tasks, we also introduce program selection and simplification strategies. Our method discovers a simple and effective optimization algorithm, $\\textbf{Lion}$ ($\\textit{Evo$\\textbf{L}$ved S$\\textbf{i}$gn M$\\textbf{o}$me$\\textbf{n}$tum}$). It is more memory-efficient than Adam as it only keeps"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2302.06675","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-02-13T20:27:30Z","cross_cats_sorted":["cs.AI","cs.CL","cs.CV","cs.NE"],"title_canon_sha256":"18f0fa3d2eefe3f8951e908fe98597c453095408fc762b4c5ffb75c6aa1e4c73","abstract_canon_sha256":"77d6a4908d1d7c58e559d4c8aaf8f54f9daf8b2f58a407e1ab58854d897a3213"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:08:20.771857Z","signature_b64":"IEJ+T0adk9aIwIzGMyGwXs7HL4rwdrvqq0aDd+bFW+zpOavL9xagn2quq6fID4YWK3qZsqoknC1S8yC9HB5HDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8888986179273febebb47b39bf8060a33626b9ae4d8076b26f82da13ca91f269","last_reissued_at":"2026-07-05T06:08:20.771354Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:08:20.771354Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Symbolic Discovery of Optimization Algorithms","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.CV","cs.NE"],"primary_cat":"cs.LG","authors_text":"Chen Liang, Cho-Jui Hsieh, Da Huang, Esteban Real, Hieu Pham, Kaiyuan Wang, Quoc V. Le, Thang Luong, Xiangning Chen, Xuanyi Dong, Yao Liu, Yifeng Lu","submitted_at":"2023-02-13T20:27:30Z","abstract_excerpt":"We present a method to formulate algorithm discovery as program search, and apply it to discover optimization algorithms for deep neural network training. We leverage efficient search techniques to explore an infinite and sparse program space. To bridge the large generalization gap between proxy and target tasks, we also introduce program selection and simplification strategies. Our method discovers a simple and effective optimization algorithm, $\\textbf{Lion}$ ($\\textit{Evo$\\textbf{L}$ved S$\\textbf{i}$gn M$\\textbf{o}$me$\\textbf{n}$tum}$). It is more memory-efficient than Adam as it only keeps"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2302.06675","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2302.06675/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2302.06675","created_at":"2026-07-05T06:08:20.771418+00:00"},{"alias_kind":"arxiv_version","alias_value":"2302.06675v4","created_at":"2026-07-05T06:08:20.771418+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2302.06675","created_at":"2026-07-05T06:08:20.771418+00:00"},{"alias_kind":"pith_short_12","alias_value":"RCEJQYLZE476","created_at":"2026-07-05T06:08:20.771418+00:00"},{"alias_kind":"pith_short_16","alias_value":"RCEJQYLZE476X25U","created_at":"2026-07-05T06:08:20.771418+00:00"},{"alias_kind":"pith_short_8","alias_value":"RCEJQYLZ","created_at":"2026-07-05T06:08:20.771418+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":17,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07206","citing_title":"Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions","ref_index":69,"is_internal_anchor":true},{"citing_arxiv_id":"2606.25971","citing_title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","ref_index":152,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01455","citing_title":"Token Geometry","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29554","citing_title":"Optimizer Memory Makes Shuffle Order a First-Order Source of Fine-Tuning Noise","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17156","citing_title":"Sparse Mamba Decoder for Quantum Error Correction: Efficient Defect-Centric Processing of Surface Code Syndromes","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17156","citing_title":"Sparse Mamba Decoder for Quantum Error Correction: Efficient Defect-Centric Processing of Surface Code Syndromes","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2509.15816","citing_title":"On the Convergence of Muon and Beyond","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2601.10791","citing_title":"OmniMol: Transferring Particle Physics Knowledge to Molecular Dynamics with Point-Edge Transformers","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2311.16867","citing_title":"The Falcon Series of Open Language Models","ref_index":196,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09176","citing_title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.25550","citing_title":"Enhancing SignSGD: Small-Batch Convergence Analysis and a Hybrid Switching Strategy","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02317","citing_title":"Anon: Extrapolating Adaptivity Beyond SGD and Adam","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08358","citing_title":"Scalable Neural Decoders for Practical Fault-Tolerant Quantum Computation","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06458","citing_title":"Diffusion-Based Point-Cloud Generation of Heavy-Ion Events","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2304.07193","citing_title":"DINOv2: Learning Robust Visual Features without Supervision","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM","json":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM.json","graph_json":"https://pith.science/api/pith-number/RCEJQYLZE476X25UPM437ADAUM/graph.json","events_json":"https://pith.science/api/pith-number/RCEJQYLZE476X25UPM437ADAUM/events.json","paper":"https://pith.science/paper/RCEJQYLZ"},"agent_actions":{"view_html":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM","download_json":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM.json","view_paper":"https://pith.science/paper/RCEJQYLZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2302.06675&json=true","fetch_graph":"https://pith.science/api/pith-number/RCEJQYLZE476X25UPM437ADAUM/graph.json","fetch_events":"https://pith.science/api/pith-number/RCEJQYLZE476X25UPM437ADAUM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM/action/storage_attestation","attest_author":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM/action/author_attestation","sign_citation":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM/action/citation_signature","submit_replication":"https://pith.science/pith/RCEJQYLZE476X25UPM437ADAUM/action/replication_record"}},"created_at":"2026-07-05T06:08:20.771418+00:00","updated_at":"2026-07-05T06:08:20.771418+00:00"}