{"as_of":"2026-08-13T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b6624b5b220c7351188046d90e6a05e7f5ddafbd2a35abca73012c3c5e27df9","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:01:14.132591Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:30:37.510251Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12670","snapshot_observed_at":"2026-08-02T12:30:37.510251Z","title":"Celo: Training versatile learned optimizers on a compute diet.arXiv preprint arXiv:2501.12670,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20486","last_updated":"2026-06-02T15:21:53Z","snapshot_observed_at":"2026-08-09T06:20:15.643185Z","submitted_at":"2026-06-02T15:21:53Z","title":"OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:37.510251Z"},"links":{"cited_paper":"/paper/2501.12670","citing_paper":"/paper/2607.20486"},"observation_digest":"sha256:693ad2cc973d76b0f345671a14769c65087328b0ab427a9c746dbea37a8b9ecb","observation_id":"0b9ff42a-70c5-4c97-9992-36fc451b415f","resolution":{"observed_at":"2026-08-02T12:30:37.510251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12670/citation-record","integrity":"/paper/2501.12670/integrity","json":"/paper/2501.12670/citation-record.json","paper":"/paper/2501.12670"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:01:13.646263Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.646263Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:7795442cbf8732fb9617520b6f14dcef5950d0f29ac4d2508b95a1e84d864a1c","observation_id":"4347d918-1fc5-4c5d-95aa-69c2a15b35ae","resolution":{"observed_at":"2026-08-10T17:01:13.646263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.642487Z","title":"Bellemare","venue":null,"work_id":"cee23a8c-1827-4da1-b428-495ed70696a3","year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.652822Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:4fd860cbbc101945a4ef8503e6f48d874bd599883a8640383b2ff73ebf710b81","observation_id":"80a7f0bf-6db4-4ace-9b40-91cfcab737aa","resolution":{"observed_at":"2026-08-10T17:01:15.646662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00958","last_updated":"2021-06-07T19:36:13Z","snapshot_observed_at":"2026-08-13T19:12:04.809155Z","submitted_at":"2021-06-02T06:03:18Z","title":"A Generalizable Approach to Learning Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00958","snapshot_observed_at":"2026-08-10T17:01:13.658742Z","title":"A generalizable approach to learning optimizers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.658742Z"},"links":{"cited_paper":"/paper/2106.00958","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:00ba9d2db2ffa684340512fce5df9670e0ebae4188f42224ac78596b87e3be9a","observation_id":"7a5bb2a7-603e-40d6-9368-97a907769e2a","resolution":{"observed_at":"2026-08-10T17:01:13.658742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.665262Z","title":"Learning to learn by gradient descent by gradient descent","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.665262Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:9c42d405788f016a74cbfcb60afc72c157a92303f0eca7d1ab773b3d2235bc2d","observation_id":"2d062951-2c14-4e53-a0fe-33fb136df47a","resolution":{"observed_at":"2026-08-10T17:01:13.665262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.620494Z","title":"Memory efficient adaptive optimization","venue":null,"work_id":"6004faec-cdd4-4368-a977-64b26e431f16","year":2019},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.670247Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:154f387c15421b8bb8cdec238db10ded9cc7fc86d8b352543c8a3ec53302cfe9","observation_id":"e95d8392-1a02-4f9f-a3f5-e347ad2c3e94","resolution":{"observed_at":"2026-08-10T17:01:15.625486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-10T17:01:13.674827Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.674827Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8bd76fe742d44e8022587c54dfe2a04a52c8a723df8325f5e02219edb5be7918","observation_id":"62079a8e-a0d6-4aa8-a9c7-f2c5f763371d","resolution":{"observed_at":"2026-08-10T17:01:13.674827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.605275Z","title":"On the distance between two neural networks and the stability of learning","venue":null,"work_id":"81a8523e-6a10-4ac9-8140-be84085e35fd","year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.681986Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:7bdf67e1faec9ec0814c0dc772e2d308008b9e1c54a39c006388f5c23a06f330","observation_id":"785466b9-b9ed-4f5e-9d8b-a72adba928f8","resolution":{"observed_at":"2026-08-10T17:01:15.610602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.687237Z","title":"Optimization methods for large-scale machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.687237Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:20c8f38b3862929693494c53019cf0984148bdb45716421210558fdbfc771ce8","observation_id":"7640423f-1381-4df4-9baa-4b1da1e89771","resolution":{"observed_at":"2026-08-10T17:01:13.687237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.694248Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.694248Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:b17aea5d3bfe7efc04c3dc727127cb98f4f96295a3669a7c9ad4b49d3a804365","observation_id":"05417d44-e04d-440e-bf71-f8e5224a5e96","resolution":{"observed_at":"2026-08-10T17:01:13.694248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.709878Z","title":"JAX : composable transformations of P ython+ N um P y programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.709878Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:72ca0d796f6c8d24e8150882fdf082f2900b8e552e3bdb9a05094859b49d02bf","observation_id":"66357048-e451-432c-8031-77a2165cb7d8","resolution":{"observed_at":"2026-08-10T17:01:13.709878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.563740Z","title":"Large language models in machine translation","venue":null,"work_id":"3330b2e0-53b7-4e4a-a0a1-63182b5e9829","year":2007},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.715106Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:33fc340024872286436c90d35fd606073488b5aba7fec48740c15841ffc8afe6","observation_id":"f09f4c79-feb2-402f-a970-f713c85dd519","resolution":{"observed_at":"2026-08-10T17:01:15.568756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.719468Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.719468Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a9d962f472f851973b5e507a0c1ca9a2844ff5f6b91e40b16860747e1f367944","observation_id":"dde7f776-4662-4e9c-bd86-f8c375c5443b","resolution":{"observed_at":"2026-08-10T17:01:13.719468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.538783Z","title":"Mixtures of experts unlock parameter scaling for deep rl","venue":null,"work_id":"b4b31406-0ec0-45d9-adf8-0c055f9f394f","year":null},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.726402Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:75e222786c2c8eba6984282e7d49e4591702bf5d707708e1ac4f383d39851997","observation_id":"deb78c89-8b8d-487d-947f-90322ebe6191","resolution":{"observed_at":"2026-08-10T17:01:15.543585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-05T11:04:54.095339Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-08-10T17:01:13.731805Z","title":"One billion word benchmark for measuring progress in statistical language modeling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.731805Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:09a3f059bd8c5da0a034e4117419f1207b7c13301aa8536d6fa0e16c6c070be2","observation_id":"a36eb5e5-26a7-4f01-a796-db871d1bc958","resolution":{"observed_at":"2026-08-10T17:01:13.731805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.737031Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.737031Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:63c25a6d6d9833369d64c0cdc318a582786763c202bce284517aec1f3f7a4b1e","observation_id":"4f18e3e2-0b2e-41eb-a216-d57ca98508fb","resolution":{"observed_at":"2026-08-10T17:01:13.737031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05446","last_updated":"2020-06-16T00:58:12Z","snapshot_observed_at":"2026-08-06T08:58:02.295940Z","submitted_at":"2019-10-11T23:51:09Z","title":"On Empirical Comparisons of Optimizers for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05446","snapshot_observed_at":"2026-08-10T17:01:13.742205Z","title":"On empirical comparisons of optimizers for deep learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.742205Z"},"links":{"cited_paper":"/paper/1910.05446","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:906063359c415b2ebcb1b39fb5b10f0b012bcb829fe3585ae37c755b55534caa","observation_id":"0bb80bd2-b840-49fa-a56e-227d6ef5c06d","resolution":{"observed_at":"2026-08-10T17:01:13.742205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.514031Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"f3ea26f4-417f-4318-82dc-b919622dee8a","year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.747326Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5e1ccac214953c1b5a3f73e4baa716706a81601701048d3287e9fa1083fa1922","observation_id":"5aab4702-adc9-4f5e-bf5e-354d118a246e","resolution":{"observed_at":"2026-08-10T17:01:15.518207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07179","last_updated":"2025-06-18T11:00:36Z","snapshot_observed_at":"2026-08-13T11:18:53.667848Z","submitted_at":"2023-06-12T15:21:02Z","title":"Benchmarking Neural Network Training Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07179","snapshot_observed_at":"2026-08-10T17:01:13.753187Z","title":"Benchmarking neural network training algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.753187Z"},"links":{"cited_paper":"/paper/2306.07179","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:0ed64f9f6f059e7653fb4037e46bd40dcc987ece0db69088e93f519fdc6aa60e","observation_id":"6793fb49-c29d-4cc6-90f9-7c5c1ef35a12","resolution":{"observed_at":"2026-08-10T17:01:13.753187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.761342Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.761342Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a8c32316aaa7403920f8237faf993a68fb5ebbcb3d0eb8c0da671f291702bc29","observation_id":"1335fdf7-e536-4857-8d57-c7b887619d1c","resolution":{"observed_at":"2026-08-10T17:01:13.761342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.493135Z","title":"Incorporating Nesterov momentum into Adam","venue":null,"work_id":"3638fbaa-075a-41b9-8bc4-211b038cde72","year":2016},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.767424Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:4ee0f62ba2dcc1d61c5992a3a6b249afbd04b37fb5a3a59a38dd0f01461fef24","observation_id":"b6e51e20-a7f4-4ed7-b996-b2a4cdb51aac","resolution":{"observed_at":"2026-08-10T17:01:15.497180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.479855Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":"3e2f9c07-6f90-4f78-845a-4d1b85ce6a9a","year":2011},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.773121Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:baa5bf34bd5e56e954309309518106e885b68afca8bc2825c3bc739cee8f1daa","observation_id":"f490bf48-e0ba-4ca7-ae77-bc190f81d1cb","resolution":{"observed_at":"2026-08-10T17:01:15.484726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.465171Z","title":"Transformer-based learned optimization","venue":null,"work_id":"6e16b32c-f56a-4b9f-a11b-85f85e666cf6","year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.779910Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:581ee19cb83c9574e0053e315adc0cd96f25571ff3c1355335b954541a1fd7c0","observation_id":"3b8962c2-4e6e-47ec-b7d2-f857cb0d030e","resolution":{"observed_at":"2026-08-10T17:01:15.469619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07082","last_updated":"2025-04-15T15:07:30Z","snapshot_observed_at":"2026-08-12T23:25:36.245619Z","submitted_at":"2024-07-09T17:55:23Z","title":"Can Learned Optimization Make Reinforcement Learning Less Difficult?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07082","snapshot_observed_at":"2026-08-10T17:01:13.785256Z","title":"Can learned optimization make reinforcement learning less difficult? arXiv preprint arXiv:2407.07082, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.785256Z"},"links":{"cited_paper":"/paper/2407.07082","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:dadc2125c2e9ec7d563942b348c8375be5ca2a08d5fc9f95e0835a7833c7d1ac","observation_id":"2b79ed6f-1eb3-4c4a-8054-13d8babdbe4b","resolution":{"observed_at":"2026-08-10T17:01:13.785256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.791459Z","title":"Deep learning, volume 1","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.791459Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:15c4814c7a66579910e956099423c6b08eca545a7f2795f481769e8fb1f0b5d9","observation_id":"e6bfd13d-f08e-4c78-9937-19505153fd57","resolution":{"observed_at":"2026-08-10T17:01:13.791459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-10T17:01:13.805702Z","title":"Accurate, large minibatch sgd: training imagenet in 1 hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.805702Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:e350aa8598e60829ff66283f6ad6824c4f29606f0a4363c1c1d11ee9efe91d99","observation_id":"959763ca-f485-4e5d-b16e-8a8c5f81976f","resolution":{"observed_at":"2026-08-10T17:01:13.805702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.823784Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.823784Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:952c5299cc6c4f179b32784d183878ed6c1735a6eadfe5fe630b9f4cd2f41152","observation_id":"229774db-34bd-4697-9940-ba227ac2171b","resolution":{"observed_at":"2026-08-10T17:01:13.823784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.428695Z","title":"A closer look at learned optimization: Stability, robustness, and inductive biases","venue":null,"work_id":"dc5bf700-e82c-49d6-b420-e88fc3026195","year":2022},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.832867Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8544a1e1229ec58009c4b9e8cf69a5f67492ed782652fc92b0551afc1b329607","observation_id":"7defd488-e747-4e77-a593-76500c723bd4","resolution":{"observed_at":"2026-08-10T17:01:15.434541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.839138Z","title":"Highly accurate protein structure prediction with alphafold","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.839138Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:2739978ca3755068d182cc9b01121437f282a0d93358f30ebc461b41f8c05832","observation_id":"773e8fb9-2e75-4d81-8e20-a0a10cb1a10a","resolution":{"observed_at":"2026-08-10T17:01:13.839138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T17:01:13.845123Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.845123Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:03f5e3c8ca0fb51f5102e3b75ac277254c8816a734b7785ad70f5bf4dce16078","observation_id":"9d0f6ec7-32ad-4805-96b7-c1893c3508db","resolution":{"observed_at":"2026-08-10T17:01:13.845123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T17:01:13.850677Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.850677Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:826eaa0700433f2dfbccbf06564bc01a2a7297943758cef9b7158164bc207d53","observation_id":"79136af0-a53f-4d90-b5f8-a0ba096bafd5","resolution":{"observed_at":"2026-08-10T17:01:13.850677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.857728Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.857728Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:33d715bf464346ada59ba5a2fcdfa2608465103de8fbbd6a7b08df2d120de025","observation_id":"7944deb0-8ad7-4726-8415-73c537c7e924","resolution":{"observed_at":"2026-08-10T17:01:13.857728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04434","last_updated":"2025-02-27T19:52:21Z","snapshot_observed_at":"2026-08-12T22:49:48.163550Z","submitted_at":"2024-09-06T17:55:49Z","title":"Accelerating Training with Neuron Interaction and Nowcasting Networks","version":3},"cited_work":{"arxiv_id":"2409.04434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04434","snapshot_observed_at":"2026-08-10T17:01:14.558813Z","title":"Accelerating Training with Neuron Interaction and Nowcasting Networks","venue":"cs.LG","work_id":"baf70130-cbea-4b7e-9c1e-fc2ab740be55","year":2024},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.865833Z"},"links":{"cited_paper":"/paper/2409.04434","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:7f4c732f6e4a165ef4b0f66205ae89ff8e6d5dee9d80d100e212ac3c75eacfc6","observation_id":"4450cfee-ace3-47ca-ac2d-8d1e8cf93fc8","resolution":{"observed_at":"2026-08-10T17:01:14.566735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.381350Z","title":"Burghouts, Efstratios Gavves, Cees G","venue":null,"work_id":"6f549456-cbaf-4f2c-930b-844e6b75ebfe","year":2024},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.872145Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8f21321c45bab4b3b0964d9f86ac450fc2ef7a8abb19e0e1aadef5c39bf29d88","observation_id":"4ed65c0e-0522-4c78-98b6-fc79decda5c2","resolution":{"observed_at":"2026-08-10T17:01:15.385945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09310","last_updated":"2024-10-05T01:26:40Z","snapshot_observed_at":"2026-08-13T21:03:10.935789Z","submitted_at":"2024-08-17T23:55:19Z","title":"Narrowing the Focus: Learned Optimizers for Pretrained Models","version":3},"cited_work":{"arxiv_id":"2408.09310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09310","snapshot_observed_at":"2026-08-10T17:01:14.524549Z","title":"Narrowing the Focus: Learned Optimizers for Pretrained Models","venue":"cs.LG","work_id":"74bddcd1-3028-4cf4-ab02-76b5a59c2333","year":2024},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.877266Z"},"links":{"cited_paper":"/paper/2408.09310","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:2f875185b13e303bacb3d29ae8045c0488608d8bf74a8d437907cc9f3612c7c8","observation_id":"1b49c5be-01e1-413b-801a-f7dc47f6be7a","resolution":{"observed_at":"2026-08-10T17:01:14.532517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.885157Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.885157Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:821d85c305827c6c1dccc8e28a9a36c4572f9983c5d2700c8115fdf9655da617","observation_id":"aa2f75e9-0fe8-43c2-a6ed-8a85f7bd2cf9","resolution":{"observed_at":"2026-08-10T17:01:13.885157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.890965Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.890965Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:74375a4744188ab843a8acf97d5c38abb7c02fb96ab9d3cd7293def1b12c2ebb","observation_id":"fd3d964b-008c-4e2e-9ab8-12b17da71914","resolution":{"observed_at":"2026-08-10T17:01:13.890965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:13.897772Z","title":"Reinforcement learning with augmented data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.897772Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:270cbe1640cb1a8a4cd3bc26d3315b8075e34e4d6db9541970ed1b534d90b4cc","observation_id":"7e40472e-28a1-4b9b-a77a-dd0646ba6819","resolution":{"observed_at":"2026-08-10T17:01:13.897772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.319664Z","title":"The mnist database of handwritten digits","venue":null,"work_id":"035726e1-a28a-4862-af19-06bdcaecc88f","year":1998},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.903291Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8e3f2b698544ba4691c6e1dc3dd89cfc30871ba4bc6269999f158347cf108be0","observation_id":"672a8e0d-1a53-47d5-8e50-bd32a026e357","resolution":{"observed_at":"2026-08-10T17:01:15.323891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03265","last_updated":"2021-10-26T02:48:30Z","snapshot_observed_at":"2026-08-11T14:56:04.364712Z","submitted_at":"2019-08-08T20:51:17Z","title":"On the Variance of the Adaptive Learning Rate and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03265","snapshot_observed_at":"2026-08-10T17:01:13.908163Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.908163Z"},"links":{"cited_paper":"/paper/1908.03265","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:085ac07fb1e1897bddfec07a9a24833d4ca754f45335697ff77941a856e9e449","observation_id":"101104e3-08fe-4b5d-b2a8-05102d73849c","resolution":{"observed_at":"2026-08-10T17:01:13.908163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T17:01:13.921849Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.921849Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a5900258f118e363442a474d1913a261ad6827bc37a697047a7a507deaa66d03","observation_id":"945150ca-596c-4b32-9374-98175c52bce5","resolution":{"observed_at":"2026-08-10T17:01:13.921849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-10T17:01:13.930603Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.930603Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:b5f53459636202856d7af4353827b178fbe911b5ca901ccb99e31bbc1db7b7f2","observation_id":"7439789b-f276-4cc6-81d4-5c7363e66da0","resolution":{"observed_at":"2026-08-10T17:01:13.930603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.299992Z","title":"Distinctive image features from scale-invariant keypoints","venue":null,"work_id":"4f80f86d-3442-4a6a-851c-44158eddfc4b","year":2004},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.937237Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:985460f61c37b5cf0cc02027347f88bd502a924fb0c94ad25c5c550fbe66bf6a","observation_id":"dd2e984e-533f-4cf8-9881-8a8003532991","resolution":{"observed_at":"2026-08-10T17:01:15.309972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.257426Z","title":"Learn2hop: Learned optimization on rough landscapes","venue":null,"work_id":"61b3691d-e97e-4977-a998-361044f59baf","year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.944340Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:995df4adf538357509599a6b430c85dc478f927d0d039a8c0f556dd205969fdf","observation_id":"aee43fbb-b0fb-43b4-ad61-bc29d9192fcb","resolution":{"observed_at":"2026-08-10T17:01:15.263631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-10T17:01:13.949692Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.949692Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8910c2abb964f1f5ef31738226bf5c19a746014a0af20319223b9a905faa1f76","observation_id":"57eb5285-d778-4d4e-9c13-d0b29adc926a","resolution":{"observed_at":"2026-08-10T17:01:13.949692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.235632Z","title":"Learning unsupervised learning rules","venue":null,"work_id":"977f89dd-95a6-471f-99ab-337273ae8059","year":2019},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.956333Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:23301ffd8220c637a2b8d3c077a25079423481d393473763e4a6b68bc2eb297f","observation_id":"38a9b689-49c3-4be0-a596-d63560f9560f","resolution":{"observed_at":"2026-08-10T17:01:15.241174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.215259Z","title":"Understanding and correcting pathologies in the training of learned optimizers","venue":null,"work_id":"fc8edbf4-6cab-446d-956d-4d1e6f3ce2b9","year":2019},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.962575Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a8f7e43fab2437f41527c9a3aa05390fdea914e49f8a0c354ea45dbfb5f629dc","observation_id":"81e1be7f-feee-43b3-93cc-19780d46c05b","resolution":{"observed_at":"2026-08-10T17:01:15.220216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11243","last_updated":"2020-09-23T16:35:09Z","snapshot_observed_at":"2026-08-10T07:18:49.373625Z","submitted_at":"2020-09-23T16:35:09Z","title":"Tasks, stability, architecture, and compute: Training more effective learned optimizers, and using them to train themselves","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11243","snapshot_observed_at":"2026-08-10T17:01:13.969069Z","title":"Tasks, stability, architecture, and compute: Training more effective learned optimizers, and using them to train themselves","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.969069Z"},"links":{"cited_paper":"/paper/2009.11243","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:50987159a9784c80eaaeb4ba523113dd58eddaab94f7eeac15f95b9adb4eca79","observation_id":"a7ead697-18fc-413d-bf75-9672ca8a29de","resolution":{"observed_at":"2026-08-10T17:01:13.969069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11887","last_updated":"2020-04-01T00:35:05Z","snapshot_observed_at":"2026-08-11T14:59:00.485181Z","submitted_at":"2020-02-27T02:49:10Z","title":"Using a thousand optimization tasks to learn hyperparameter search strategies","version":3},"cited_work":{"arxiv_id":"2002.11887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11887","snapshot_observed_at":"2026-08-10T17:01:14.378405Z","title":"Using a thousand optimization tasks to learn hyperparameter search strategies","venue":"cs.LG","work_id":"a36aff06-0cce-4b1f-b64a-6e412e62853a","year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.975323Z"},"links":{"cited_paper":"/paper/2002.11887","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:c4d83df9ee65bf1abe63aa11df014e3918b7038e322089d79034af84e075af1a","observation_id":"fc2d163e-c3ec-43e7-bbb7-738eb536b38e","resolution":{"observed_at":"2026-08-10T17:01:14.385479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.198572Z","title":"Practical tradeoffs between memory, compute, and performance in learned optimizers","venue":null,"work_id":"37857b20-16ad-4d48-a5e1-234b94706707","year":2022},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.981688Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a2acc6d7a7319c1f6d5c7fa433d077ce1cea5fa2fd8c2a25b9f26b28f338c702","observation_id":"1fb863a2-2f65-4bb4-bae9-e27da7b06786","resolution":{"observed_at":"2026-08-10T17:01:15.203544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09760","last_updated":"2022-11-17T18:39:07Z","snapshot_observed_at":"2026-08-13T13:40:11.559725Z","submitted_at":"2022-11-17T18:39:07Z","title":"VeLO: Training Versatile Learned Optimizers by Scaling Up","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09760","snapshot_observed_at":"2026-08-10T17:01:13.988368Z","title":"Velo: Training versatile learned optimizers by scaling up","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.988368Z"},"links":{"cited_paper":"/paper/2211.09760","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:1f0dd0e889e1711aecc468badc8da4b5b65c42f80bd3adea137d81d6e351dda0","observation_id":"fafbc5bd-1ebb-47d6-9d52-8b6f94d971ea","resolution":{"observed_at":"2026-08-10T17:01:13.988368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00588","last_updated":"2023-03-01T09:21:14Z","snapshot_observed_at":"2026-08-13T14:34:28.232276Z","submitted_at":"2022-09-01T17:03:07Z","title":"Transformers are Sample-Efficient World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00588","snapshot_observed_at":"2026-08-10T17:01:13.996030Z","title":"Transformers are sample-efficient world models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:13.996030Z"},"links":{"cited_paper":"/paper/2209.00588","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:8db5236d734f9e2c353084434683643fcd8da9a4f8039253dd1df0d097c4a316","observation_id":"0a0e73ef-fc28-4ba2-816e-1886d9881029","resolution":{"observed_at":"2026-08-10T17:01:13.996030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.182432Z","title":"Learning to optimize with recurrent hierarchical transformers","venue":null,"work_id":"ff6d09ec-b8fb-45f9-8951-4bd4976d55ad","year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.002221Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:55306d9c7d3219fa75675c5c92ad2943b0c24b9eeb8c33d1d669faa16c7f3158","observation_id":"9caae5fb-b7a5-4558-ab91-7be64f5b5a37","resolution":{"observed_at":"2026-08-10T17:01:15.187875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.007592Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.007592Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:48e4ff9a484041f404225f0b9db971330e8b7058d7f5303c5ad09714cf0781f3","observation_id":"e693d5bb-de8d-4c17-9d56-8c6c8281c03c","resolution":{"observed_at":"2026-08-10T17:01:14.007592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12892","last_updated":"2022-09-26T17:59:58Z","snapshot_observed_at":"2026-08-13T14:19:00.693552Z","submitted_at":"2022-09-26T17:59:58Z","title":"Learning to Learn with Generative Models of Neural Network Checkpoints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.12892","snapshot_observed_at":"2026-08-10T17:01:14.012935Z","title":"Learning to learn with generative models of neural network checkpoints","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.012935Z"},"links":{"cited_paper":"/paper/2209.12892","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:a62b55a042634907562c971e2a684661e2c9e46f12d5b676759566830c28758c","observation_id":"22a659d9-516a-477e-a201-43de691d770a","resolution":{"observed_at":"2026-08-10T17:01:14.012935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.018672Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.018672Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:c284caf41af1a7f855288a5daa9bafa037c3c10f1109c22814a7e70ba0ee512b","observation_id":"b5f30c9f-c944-4f8d-a93c-ce222493e31e","resolution":{"observed_at":"2026-08-10T17:01:14.018672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.023890Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.023890Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:7b7f59a52ddf4a129a1fd7fda884d2ee8c982cfe047fe15de1b34a2f31ec93f0","observation_id":"c6dadd49-8912-4dd4-8f8d-375606315d0a","resolution":{"observed_at":"2026-08-10T17:01:14.023890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-10T17:01:14.029036Z","title":"On the convergence of adam and beyond","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.029036Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:53ac05330152a2996d5b38776140b5c8d9c07a54107f2468188140a70b453d86","observation_id":"8a2c2078-948a-4210-8aba-5de3c1451063","resolution":{"observed_at":"2026-08-10T17:01:14.029036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:15.136245Z","title":"Is scaling learned optimizers worth it? evaluating the value of velo’s 4000 tpu months","venue":null,"work_id":"484f2396-d7e8-442b-901c-bf7b3a098f70","year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.035743Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:62268a5d236439a960aa3bd4d17875a6e9959583e25da3969080f4b5757a3488","observation_id":"528afa87-5321-474d-adb4-232c64472b12","resolution":{"observed_at":"2026-08-10T17:01:15.141176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.918787Z","title":"Descending through a crowded valley-benchmarking deep learning optimizers","venue":null,"work_id":"41f50c14-dbe9-40a7-98bd-49106be34607","year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.042857Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:e18e085aaa9faa2548e00d1b6095fb90257600040b0804d86295e34c04ace193","observation_id":"518331ab-36bd-4160-baf3-6e3dfe3c05a7","resolution":{"observed_at":"2026-08-10T17:01:15.125478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05499","last_updated":"2019-03-13T14:05:31Z","snapshot_observed_at":"2026-08-11T14:58:40.741438Z","submitted_at":"2019-03-13T14:05:31Z","title":"DeepOBS: A Deep Learning Optimizer Benchmark Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05499","snapshot_observed_at":"2026-08-10T17:01:14.048233Z","title":"Deepobs: A deep learning optimizer benchmark suite","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.048233Z"},"links":{"cited_paper":"/paper/1903.05499","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:c615da6a67e06e1125dee490a4a054ecfcd2978ca09a90e9d5cd7083f0c7d182","observation_id":"25ec5bb1-44aa-441e-b8e9-67bad9255fb2","resolution":{"observed_at":"2026-08-10T17:01:14.048233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.054639Z","title":"Bigger, better, faster: Human-level atari with human-level efficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.054639Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:2b09431aff2b7f57f1036762bb55dc43785bd2655ae3795d3b92cce93f6442d1","observation_id":"2a1f04b3-8115-4b4d-b601-ecbedbd7bb16","resolution":{"observed_at":"2026-08-10T17:01:14.054639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04235","last_updated":"2018-04-11T21:42:32Z","snapshot_observed_at":"2026-07-06T06:32:58.709094Z","submitted_at":"2018-04-11T21:42:32Z","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04235","snapshot_observed_at":"2026-08-10T17:01:14.059657Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.059657Z"},"links":{"cited_paper":"/paper/1804.04235","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:809c427fe7e0e4eb40476c70d433dfbe03648138418f01631b39fe41b920e4ae","observation_id":"6d95f365-aaec-4855-9621-2eaf84218367","resolution":{"observed_at":"2026-08-10T17:01:14.059657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.882861Z","title":"Optimizer benchmarking needs to account for hyperparameter tuning","venue":null,"work_id":"2907862a-40d0-49cf-bc7f-64df4605a2c9","year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.066662Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:3141d5bd8aa3710f57b07ba58e49839a6a47957eed05e593242d59a34db5ad32","observation_id":"72640a9c-59e5-45a4-b3a6-8a2c8bcba778","resolution":{"observed_at":"2026-08-10T17:01:14.889744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.071224Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.071224Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:93b4b97737db824f57009d610c4b7cd830254c45270eb6786f18b61cfb5497ff","observation_id":"93d920cc-f1f6-4104-8c52-0fdea2c638df","resolution":{"observed_at":"2026-08-10T17:01:14.071224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.858975Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"dcce3853-42a6-4911-a013-0f717758c7c5","year":2013},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.076159Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:70e18587b5e8ee67fd60e92c97668c178c2ed863a9a33b6e3bc8e326d9656d49","observation_id":"64d24621-a0a8-4512-ade1-1d6614ffe4b8","resolution":{"observed_at":"2026-08-10T17:01:14.863206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.081475Z","title":"Tieleman and G","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.081475Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:afd647acb6cdc8e8b57aae7e64c672cb0673e83ef4d099b15c9d98352b04ed37","observation_id":"b1ab3656-22f7-40dc-9422-e110fb928d18","resolution":{"observed_at":"2026-08-10T17:01:14.081475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T17:01:14.087641Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.087641Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:7825a41beaea3b67057b01dc5b9e42d60be8c7ffddc60755dcbc2438a0031ed9","observation_id":"c47f8654-9495-4b9f-994e-a9ea3647477d","resolution":{"observed_at":"2026-08-10T17:01:14.087641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.832575Z","title":"Unbiased gradient estimation in unrolled computation graphs with persistent evolution strategies","venue":null,"work_id":"b9638d76-bd92-4de9-92d9-35298d2638eb","year":2021},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.093708Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5457ced6a14e82e7b56396c170c5ad244c7dfdf6dd06ff9d792487db5d5d3181","observation_id":"e12ea885-f51c-4bff-aa99-4009374cf52b","resolution":{"observed_at":"2026-08-10T17:01:14.837629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.816166Z","title":"Learned optimizers that scale and generalize","venue":null,"work_id":"8b043c2a-853d-4c52-bbd8-dff723a2091b","year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.099383Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:4a0ba5f86825746b2c1e92a19989b456d19740532f4e3c4b67e25b18383c9159","observation_id":"1e9919f3-6574-49b1-9638-dc1835c74019","resolution":{"observed_at":"2026-08-10T17:01:14.821525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.07747","last_updated":"2017-09-15T21:29:49Z","snapshot_observed_at":"2026-08-13T15:13:33.081929Z","submitted_at":"2017-08-25T14:01:29Z","title":"Fashion-MNIST: a Novel Image Dataset for Benchmarking Machine Learning Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.07747","snapshot_observed_at":"2026-08-10T17:01:14.105828Z","title":"Fashion-mnist: a novel image dataset for benchmarking machine learning algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.105828Z"},"links":{"cited_paper":"/paper/1708.07747","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5a1d664e3391e82bd617e9bdb92623dcbd95833a29b03df412332050c2eafae3","observation_id":"5b2b060e-bf04-495d-9cf1-aa52239067c4","resolution":{"observed_at":"2026-08-10T17:01:14.105828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-10T17:01:14.111151Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.111151Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5b89ec6f336d361dd3301e6ccaaa7da134b735ea81f8f593a13ab335e2303c63","observation_id":"8b04b048-e48f-4ce8-aa3e-b94af8b0eab1","resolution":{"observed_at":"2026-08-10T17:01:14.111151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-10T17:01:14.117099Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.117099Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:5e241c70001995fe1ea17c5ccf21677f14b5ea949248981c3b786708d7cab940","observation_id":"d7b3ad80-30e7-4a10-ab4c-40270896fe41","resolution":{"observed_at":"2026-08-10T17:01:14.117099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.800304Z","title":"Adaptive methods for nonconvex optimization","venue":null,"work_id":"dd43c2c1-bb80-4d3b-b38c-61e52ec8c02d","year":2018},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.121648Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:1e5d3a62d8576f53f636118c1232754cdbfe4a4f766882bc366e1b15b535a0e8","observation_id":"7e65236d-5fe6-4fd5-9870-7367f67e3801","resolution":{"observed_at":"2026-08-10T17:01:14.805624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.779177Z","title":"Adabelief optimizer: Adapting stepsizes by the belief in observed gradients","venue":null,"work_id":"54fd9954-b1d8-4bad-b92b-4fe2d96b9b8a","year":2020},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.127671Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:99e224cf26aa45c55c907055a7087375c4c87709c63c2f7b378987f0645c87e1","observation_id":"f8ba4b54-7d4c-4bfa-8772-6a21d548b212","resolution":{"observed_at":"2026-08-10T17:01:14.786685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:01:14.132591Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T17:01:14.132591Z"},"links":{"citing_paper":"/paper/2501.12670"},"observation_digest":"sha256:71ed09d2a29c8d696d79489cb9ce57aa221498056bd9115250c9a16848e83193","observation_id":"31444cfb-ab2f-4eb6-a033-0433a745eda7","resolution":{"observed_at":"2026-08-10T17:01:14.132591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.12670","last_updated":"2025-06-19T15:01:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T17:49:02.176276Z","submitted_at":"2025-01-22T06:10:27Z","title":"Celo: Training Versatile Learned Optimizers on a Compute Diet"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":26},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 1 inbound Pith citation observation for arXiv:2501.12670."}