{"as_of":"2026-08-07T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6445da642d35f80bdec27f523c1b8f58e7a3f408927743a67c7dbde6a1181815","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:28:50.427030Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.00419/citation-record","integrity":"/paper/2510.00419/integrity","json":"/paper/2510.00419/citation-record.json","paper":"/paper/2510.00419"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.04474","last_updated":"2016-11-30T16:45:45Z","snapshot_observed_at":"2026-07-06T04:59:57.758055Z","submitted_at":"2016-06-14T17:49:32Z","title":"Learning to learn by gradient descent by gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04474","snapshot_observed_at":"2026-08-04T13:28:44.650465Z","title":"Hoffman, David Pfau, Tom Schaul, Brendan Shillingford, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:44.650465Z"},"links":{"cited_paper":"/paper/1606.04474","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:4d6a4458537d8afd75ede14e4ce088480346dd1e08b32f6cbc7a2af6cd1b775c","observation_id":"69f75c68-f2aa-4619-a628-e1cc334fdaa5","resolution":{"observed_at":"2026-08-04T13:28:44.650465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T13:28:44.805301Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:44.805301Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:1d414fb078f2ff5f3d6f59f4ab2eebd612a233053390caa9b148c663fbd9333b","observation_id":"df11587f-48bf-4651-83c3-bc935e7de82b","resolution":{"observed_at":"2026-08-04T13:28:44.805301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:44.984292Z","title":"Learning to learn","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:44.984292Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:b858b28dd4544e0ed1122dd9e9355aa33bc100581ceafd9c648db487204bc8b9","observation_id":"79d0f0a0-83d5-47bf-9555-ce8a1ef0d466","resolution":{"observed_at":"2026-08-04T13:28:44.984292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:45.111653Z","title":"A zeroth-order block coordinate descent algorithm for huge-scale black-box optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.111653Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:62c3ea190654a5e6b0e79a2f1b9ceb7113e0dc363a673904b525254b5ddf39a1","observation_id":"667f65c2-00ad-4710-87bf-57b933b79d27","resolution":{"observed_at":"2026-08-04T13:28:45.111653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:45.239923Z","title":"Zoo: Zeroth order optimization based black-box attacks to deep neural networks without training substitute models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.239923Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:bd6058ec54896e4b2bf13d9e2705b3e5ba93f22719ff3b233d4eaef0afc11685","observation_id":"5e957725-3e3f-4388-83dd-230926e92447","resolution":{"observed_at":"2026-08-04T13:28:45.239923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12828","last_updated":"2021-07-02T01:46:33Z","snapshot_observed_at":"2026-08-07T05:01:45.178007Z","submitted_at":"2021-03-23T20:46:20Z","title":"Learning to Optimize: A Primer and A Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.12828","snapshot_observed_at":"2026-08-04T13:28:45.450319Z","title":"Learning to optimize: A primer and a benchmark, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.450319Z"},"links":{"cited_paper":"/paper/2103.12828","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:2ab4238e688b5312378ac92b05d997404ef7d86cbe034753c9c9abd18908827a","observation_id":"9dbf09f4-aac0-4dbd-b64d-fea6953263d6","resolution":{"observed_at":"2026-08-04T13:28:45.450319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07698","last_updated":"2024-10-10T08:10:53Z","snapshot_observed_at":"2026-08-06T18:34:48.824634Z","submitted_at":"2024-10-10T08:10:53Z","title":"Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07698","snapshot_observed_at":"2026-08-04T13:28:45.687627Z","title":"Enhancing zeroth-order fine-tuning for language models with low-rank structures, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.687627Z"},"links":{"cited_paper":"/paper/2410.07698","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:0f075cceccd16417e47a86f40cae925d5c647a3d7991160e7bd9e6ccebf7ae7f","observation_id":"cde177c8-cc59-4591-b6f0-d41ce197c7cd","resolution":{"observed_at":"2026-08-04T13:28:45.687627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-04T13:28:45.804874Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.804874Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:6b006c61b22c2e8ea49a99a6c533454583faf7300676ff67ef390bc4841633a4","observation_id":"7b931de0-0188-4d2c-97dd-dffc74f33b2b","resolution":{"observed_at":"2026-08-04T13:28:45.804874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:45.932716Z","title":"Cotter and P.R","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:45.932716Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:4cfa5d8c3122524f6490091c7bcbe341b3ed25e62cd2b10d5f7eb26bb822189c","observation_id":"91ebe683-d34c-47f2-a66c-23b6df382ff5","resolution":{"observed_at":"2026-08-04T13:28:45.932716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:46.100385Z","title":"The commitmentbank: Investigating projection in naturally occurring discourse","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.100385Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:dbed4471323f69bf51908bbb732adf7f5ac6ebdab5830497bc0be4850887f963","observation_id":"938017f9-c504-41e1-8057-bf46b68d5848","resolution":{"observed_at":"2026-08-04T13:28:46.100385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-04T13:28:46.213522Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.213522Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:4141be4e13719f1c34d5f0ea386b4ced81d3979e7c51461845c08c6c5ba49064","observation_id":"079eb5c4-7999-488c-a9e3-11726fe09f23","resolution":{"observed_at":"2026-08-04T13:28:46.213522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:46.364774Z","title":"Generalizing gaussian smoothing for random search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.364774Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:b414eaa479b724dee7f6690730335948935444ca675f611f3f27bd668d9d6197","observation_id":"cb4bd285-2e4f-4e10-b242-8700e9a47263","resolution":{"observed_at":"2026-08-04T13:28:46.364774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08080","last_updated":"2024-04-11T18:35:49Z","snapshot_observed_at":"2026-07-06T17:59:04.250437Z","submitted_at":"2024-04-11T18:35:49Z","title":"Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08080","snapshot_observed_at":"2026-08-04T13:28:46.514611Z","title":"Variance-reduced zeroth-order methods for fine-tuning language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.514611Z"},"links":{"cited_paper":"/paper/2404.08080","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:86e338500fd17cc71c04a85c8c72a3f401866f4252f7821e0884c56df406c541","observation_id":"60596eb6-59f0-4530-866b-03a1d9d0c689","resolution":{"observed_at":"2026-08-04T13:28:46.514611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T13:28:46.608258Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.608258Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:41d2e081a00ab03824a6d027c929eac7ec74a1066c8d78d105de657449882c26","observation_id":"45014a56-5d7f-4084-b068-2459db7c65be","resolution":{"observed_at":"2026-08-04T13:28:46.608258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02913","last_updated":"2024-06-05T04:07:35Z","snapshot_observed_at":"2026-07-06T18:25:40.229186Z","submitted_at":"2024-06-05T04:07:35Z","title":"Zeroth-Order Fine-Tuning of LLMs with Extreme Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02913","snapshot_observed_at":"2026-08-04T13:28:46.722919Z","title":"Zeroth-order fine-tuning of llms with extreme sparsity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.722919Z"},"links":{"cited_paper":"/paper/2406.02913","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:955d89530ec3b416813cdfee15c75bd19effa75e554021e498f8de6846c7f1fc","observation_id":"4cc1d2d4-768b-478e-8a59-28115aa394b8","resolution":{"observed_at":"2026-08-04T13:28:46.722919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:46.847616Z","title":"Zavlanos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.847616Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:0a67a3bc042337d8d392f5b6077bcdd9de001f4771ee2e71dd2bbf1523d52654","observation_id":"76c6c50a-b6c3-464f-9866-807eb3e28522","resolution":{"observed_at":"2026-08-04T13:28:46.847616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:46.970746Z","title":"Lo RA : Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:46.970746Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:a91970c1a188de4f0e2919441cfb6077768526f208ffd99460474fc775a46f7c","observation_id":"f15492d1-15d7-4943-940f-1faf56e915ef","resolution":{"observed_at":"2026-08-04T13:28:46.970746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.074140Z","title":"Zo-adamu optimizer: Adapting perturbation by the momentum and uncertainty in zeroth-order optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.074140Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:a950c9d760538a6d3518814af2ff2f21e701a3bba6e5ed51a0b3b23af7705b6c","observation_id":"52cd8c8c-9a12-4ecb-bff0-6148ce86b1b2","resolution":{"observed_at":"2026-08-04T13:28:47.074140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.131849Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.131849Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:432b2d788cd6f1f92ae0c40e160c98a63e54aa4e5b873a0cee2d505cdf0a6ed9","observation_id":"94e0c8a3-a5fd-4e7f-b6d5-7f410b052566","resolution":{"observed_at":"2026-08-04T13:28:47.131849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.269550Z","title":"The winograd schema challenge","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.269550Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:63fe8fac064b1fa2bc4babbaad3792a0fd7067516f17e513f00b61e25a65d436","observation_id":"1fea41aa-6348-4f0d-b9fd-489e2831fdeb","resolution":{"observed_at":"2026-08-04T13:28:47.269550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01885","last_updated":"2016-06-06T19:50:47Z","snapshot_observed_at":"2026-08-02T12:24:31.765445Z","submitted_at":"2016-06-06T19:50:47Z","title":"Learning to Optimize","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01885","snapshot_observed_at":"2026-08-04T13:28:47.347076Z","title":"Learning to optimize","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.347076Z"},"links":{"cited_paper":"/paper/1606.01885","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:683e58d54cae18913c32461465ffd32c0ebd161263d5524b0281e6cbe67b9b23","observation_id":"abb74cc3-c762-4153-baa8-d1023aca617a","resolution":{"observed_at":"2026-08-04T13:28:47.347076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00441","last_updated":"2017-11-30T18:59:01Z","snapshot_observed_at":"2026-07-06T05:31:57.481191Z","submitted_at":"2017-03-01T18:52:23Z","title":"Learning to Optimize Neural Nets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00441","snapshot_observed_at":"2026-08-04T13:28:47.435267Z","title":"Learning to optimize neural nets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.435267Z"},"links":{"cited_paper":"/paper/1703.00441","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:4cea3cb77a2f481e0037f882b40cbf3772ab76c2025bb0e17863f2167c4dbf50","observation_id":"74f78755-b27a-4131-95aa-e9507649e486","resolution":{"observed_at":"2026-08-04T13:28:47.435267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.546754Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.546754Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:18d6ac6a1338850ea3eadc86920d45110d8ee8921f19c8f1086331f0ab0cb2a2","observation_id":"25cbfa9a-635e-4e9c-9648-4f47ced0d285","resolution":{"observed_at":"2026-08-04T13:28:47.546754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.712902Z","title":"signsgd via zeroth-order oracle","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.712902Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:e63aae36eb6730c92047cbc1066e1a679dd90d51ef4f1caddf948137acd8803a","observation_id":"fa862923-0720-44d0-a561-086310ebfe27","resolution":{"observed_at":"2026-08-04T13:28:47.712902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:47.829597Z","title":"Sparse mezo: Less parameters for better performance in zeroth-order llm fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.829597Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:ea954a5050521f4e57245141a007db7554f166184bf9ddcf349090c05ba1eb56","observation_id":"4af8a750-ff78-4c41-8637-ecae3242eb27","resolution":{"observed_at":"2026-08-04T13:28:47.829597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03633","last_updated":"2017-06-10T16:25:37Z","snapshot_observed_at":"2026-08-05T06:46:17.542297Z","submitted_at":"2017-03-10T11:30:03Z","title":"Learning Gradient Descent: Better Generalization and Longer Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03633","snapshot_observed_at":"2026-08-04T13:28:47.902903Z","title":"Learning gradient descent: Better generalization and longer horizons, 2017 a","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:47.902903Z"},"links":{"cited_paper":"/paper/1703.03633","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:2e51267adcac1e8802aa9ff31e7dde0fb59de80a66f2187e5449c4c778e7ba3c","observation_id":"c8445472-1811-4c4e-8eb2-ac18c1128107","resolution":{"observed_at":"2026-08-04T13:28:47.902903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.020105Z","title":"Learning gradient descent: Better generalization and longer horizons","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.020105Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:99d7e85d3149bbaa393bb880c89fff9c72bf13866183382572668db8c8719b27","observation_id":"2e03bcc1-dce0-4edd-a10c-4557d0d78b7f","resolution":{"observed_at":"2026-08-04T13:28:48.020105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.138572Z","title":"Revisiting zeroth-order optimization: Minimum-variance two-point estimators and directionally aligned perturbations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.138572Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:bfa347fb43ce5fb9bdb71301d6e08e05168163bef103f5b0e7aeade479b1e104","observation_id":"55f4754f-77a4-48a7-8d76-9f5b2fff6e32","resolution":{"observed_at":"2026-08-04T13:28:48.138572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.316032Z","title":"Lee, Danqi Chen, and Sanjeev Arora","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.316032Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:02e78c6cb9bb718380d5ae81035d00f844cdee2aa897dbed00ed2e5a68fb73c6","observation_id":"2a19fae9-bb0a-4745-9799-37d702e0afd1","resolution":{"observed_at":"2026-08-04T13:28:48.316032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.406415Z","title":"Understanding and correcting pathologies in the training of learned optimizers","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.406415Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:d186e3bec1c8a91947078b739a017925246936ff3fcb8af2e3643d2c5d42d423","observation_id":"0f7fa5a5-df9e-4724-90d2-c482ab5ffab9","resolution":{"observed_at":"2026-08-04T13:28:48.406415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.569474Z","title":"Practical tradeoffs between memory, compute, and performance in learned optimizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.569474Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:3fdbb70b4667085922ce4485aa0cf88c92f9e1cbbe38dcc60cf9641995c07f51","observation_id":"a3e4aa63-7bed-4f40-872c-ddbd1eab0d6b","resolution":{"observed_at":"2026-08-04T13:28:48.569474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-04T13:28:48.773965Z","title":"Squad: 100,000+ questions for machine comprehension of text, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.773965Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:dc8fb0072e1f1f8e6f82a17dd162b92c2355a22daee8487efda9386bc359aa61","observation_id":"fd894578-f4a8-4d76-bebc-9954d63d4dcf","resolution":{"observed_at":"2026-08-04T13:28:48.773965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:48.896694Z","title":"Choice of plausible alternatives: An evaluation of commonsense causal reasoning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:48.896694Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:1c83fc0dbc1e940098782e7ab7974c0df570b99707d4eee212046efb6a16c693","observation_id":"d2de0fa9-da62-4925-b63a-19b286f1f493","resolution":{"observed_at":"2026-08-04T13:28:48.896694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09464","last_updated":"2020-02-07T06:45:00Z","snapshot_observed_at":"2026-07-06T08:31:06.444545Z","submitted_at":"2019-10-21T15:48:46Z","title":"Learning to Learn by Zeroth-Order Oracle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09464","snapshot_observed_at":"2026-08-04T13:28:49.010408Z","title":"Learning to learn by zeroth-order oracle, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.010408Z"},"links":{"cited_paper":"/paper/1910.09464","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:dd79065f88d0d345ae7475a85daaa880c5a553a3d99f056982f8474e318d35db","observation_id":"b0276f45-f3ee-4983-8631-24c683f96ca9","resolution":{"observed_at":"2026-08-04T13:28:49.010408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.155601Z","title":"Hugginggraph: Understanding the supply chain of llm ecosystem","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.155601Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:8a5c8707f92f5c14f24bfd7d02323494ab6c7180431efc432fbd9fcff27466ab","observation_id":"b78136ee-11d9-4645-af28-84670f47385e","resolution":{"observed_at":"2026-08-04T13:28:49.155601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.220804Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.220804Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:41c708ea44a37851ca312a039ceebb77b024d8ae80a3d54c059444b7c51054a3","observation_id":"1d78d7b5-f373-460a-8be2-4bc1c03fdbd4","resolution":{"observed_at":"2026-08-04T13:28:49.220804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19057","last_updated":"2025-01-31T11:34:03Z","snapshot_observed_at":"2026-08-03T08:06:31.039808Z","submitted_at":"2025-01-31T11:34:03Z","title":"TeZO: Empowering the Low-Rankness on the Temporal Dimension in the Zeroth-Order Optimization for Fine-tuning LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19057","snapshot_observed_at":"2026-08-04T13:28:49.295868Z","title":"Tezo: Empowering the low-rankness on the temporal dimension in the zeroth-order optimization for fine-tuning llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.295868Z"},"links":{"cited_paper":"/paper/2501.19057","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:e9399ec50be68cc599d5a99d243df3321b56da3127f66bf1d36cd0631ba5937f","observation_id":"15714c68-19ad-4a56-b90b-b95a89e545e4","resolution":{"observed_at":"2026-08-04T13:28:49.295868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.374632Z","title":"Distributed zero-order algorithms for nonconvex multiagent optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.374632Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:12096a5fe327496d1fbb89a59b932ff7318d8628cc54ea33daf83ba8b6b8b09f","observation_id":"c2d3b834-1053-479f-bd12-5761958b3527","resolution":{"observed_at":"2026-08-04T13:28:49.374632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04813","last_updated":"2017-09-07T23:38:09Z","snapshot_observed_at":"2026-07-06T05:33:37.440838Z","submitted_at":"2017-03-14T23:05:54Z","title":"Learned Optimizers that Scale and Generalize","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04813","snapshot_observed_at":"2026-08-04T13:28:49.515206Z","title":"Hoffman, Sergio Gomez Colmenarejo, Misha Denil, Nando de Freitas, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.515206Z"},"links":{"cited_paper":"/paper/1703.04813","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:153fbc3683f324f70766fbd3293032e87b948599fc24f3f263a7d1e41f0eb06a","observation_id":"3f739b37-a7b0-4ee5-ba8b-8f99e5c37188","resolution":{"observed_at":"2026-08-04T13:28:49.515206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.590896Z","title":"Hoffman, Sergio G\\' o mez Colmenarejo, Misha Denil, Nando de Freitas, and Jascha Sohl-Dickstein","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.590896Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:a9e1b6600c7e3552a71103e69e237c1b2fcc2a4ac7fe1d4c08a62dc3c12ac89f","observation_id":"0cd9dd7d-81eb-4d78-bb81-e9f55f9a8f2e","resolution":{"observed_at":"2026-08-04T13:28:49.590896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.11377","last_updated":"2019-03-20T09:19:44Z","snapshot_observed_at":"2026-07-06T07:24:04.483048Z","submitted_at":"2018-12-29T15:18:58Z","title":"Hessian-Aware Zeroth-Order Optimization for Black-Box Adversarial Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.11377","snapshot_observed_at":"2026-08-04T13:28:49.739311Z","title":"Hessian-aware zeroth-order optimization for black-box adversarial attack","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.739311Z"},"links":{"cited_paper":"/paper/1812.11377","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:4d7147b89a4aec9ae6a249374800dcb70536c819337423021c38e8556d60efb2","observation_id":"c6d0a702-ec60-45e9-b6b5-f1c53d514261","resolution":{"observed_at":"2026-08-04T13:28:49.739311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.823785Z","title":"Hessian-aware zeroth-order optimization for black-box adversarial attack, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.823785Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:87097b0b3d6b236cac4058d3e26b07cf1b4c2ac61d91ee82cd437e2a470d75f8","observation_id":"c7d7219e-5b46-4683-afd9-2bf1a62d6399","resolution":{"observed_at":"2026-08-04T13:28:49.823785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-04T13:28:49.908553Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.908553Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:a9567f6021f01647a7774bdc40e6188989159f57cd40571461fd98c01244ad77","observation_id":"7a500683-c009-407c-adaf-29fd4c74fa38","resolution":{"observed_at":"2026-08-04T13:28:49.908553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:49.970629Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:49.970629Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:373383c79c66a594e2ac7512ea6345796c0b87f76e46972a8cf8dca3599e0dd2","observation_id":"be4f6352-9b69-4d0b-b362-748190f90e28","resolution":{"observed_at":"2026-08-04T13:28:49.970629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-04T13:28:50.022529Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.022529Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:f1b47d2d7eb5dc38eaeffe01a8187e1fc7407230b8e776369e5d0a2a5232655e","observation_id":"0ecc4c2d-4554-46dd-8064-62483ceea2fa","resolution":{"observed_at":"2026-08-04T13:28:50.022529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15173","last_updated":"2025-02-18T13:45:50Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:11:55Z","title":"Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15173","snapshot_observed_at":"2026-08-04T13:28:50.094513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.094513Z"},"links":{"cited_paper":"/paper/2402.15173","citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:121cc1e9f53e5ec12405471329a841d8cbcbe1efe63ee3af8816d5ba5c84a9cc","observation_id":"94119468-7bb3-413f-ab27-45a66507df1c","resolution":{"observed_at":"2026-08-04T13:28:50.094513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:50.158252Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.158252Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:c8b081a63473373c537d77eb5ddea41c215c784faae77a78a09b11e8a41a9692","observation_id":"7274dcf5-8cb4-444a-bcfa-5bfe71c2d08a","resolution":{"observed_at":"2026-08-04T13:28:50.158252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:50.270807Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.270807Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:9745affa166b17c413674a1348dd548eac18ad4d0d01c9bf93dbcbacac2b8587","observation_id":"0b13cd96-d66f-4c3e-af9e-a032c4121854","resolution":{"observed_at":"2026-08-04T13:28:50.270807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:50.368868Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.368868Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:1bdb3a07ef1ac79c13f25f26fea581da5cabbe73aedfd038c12e62ca24a71fab","observation_id":"a5788f91-4c4c-4582-8471-0675a735d547","resolution":{"observed_at":"2026-08-04T13:28:50.368868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:28:50.427030Z","title":"train once, reuse widely","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T13:28:50.427030Z"},"links":{"citing_paper":"/paper/2510.00419"},"observation_digest":"sha256:bc9d98576c59e2e83eaf819d256e83e48b41592d35fe52975b9786048c1a2530","observation_id":"46b2a5a0-7cad-4ad5-b195-44aee9453d7c","resolution":{"observed_at":"2026-08-04T13:28:50.427030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.00419","last_updated":"2026-05-29T06:48:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T03:34:50.370973Z","submitted_at":"2025-10-01T02:01:07Z","title":"Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2510.00419."}