{"as_of":"2026-08-04T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53ef86609d5acba1a0eb854d54f39a29f7df75e879f1977e0bf4e12f6aaccdeb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:12:50.922764Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T17:36:25.374536Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2505.13196","last_updated":"2026-06-09T19:32:07Z","snapshot_observed_at":"2026-08-02T14:15:12.167650Z","submitted_at":"2025-05-19T14:51:40Z","title":"A Physics-Inspired Optimizer: Velocity Regularized Adam","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T14:34:37.468180Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2505.13196"},"observation_digest":"sha256:afc6f2a3186610a276bb44963d49bd2448fad3b7af04cadc73742d9cbbb98f47","observation_id":"f92b09ec-4ed6-42b5-a8d8-cd983770081c","resolution":{"observed_at":"2026-05-22T14:34:54.274212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-04T21:12:50.922764Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training.arXiv preprint arXiv:2305.14342, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08195","last_updated":"2025-09-09T23:59:20Z","snapshot_observed_at":"2026-08-04T21:12:46.200789Z","submitted_at":"2025-09-09T23:59:20Z","title":"Sketched Gaussian Mechanism for Private Federated Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T21:12:50.922764Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2509.08195"},"observation_digest":"sha256:725efa065e2a1e7289971788dc1b05b7a93a032dfa8a5f56b7cab95fd15fd350","observation_id":"bd57ed43-8e23-4aee-b56d-253bba041ffb","resolution":{"observed_at":"2026-08-04T21:12:50.922764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:57e7e6324c9c5bf2d64585cb6a9cc45500fb93360c643d23d60c87ebf296f785","observation_id":"6d51b4e2-2428-4ea0-835e-65e80319d235","resolution":{"observed_at":"2026-05-18T15:56:34.183303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2509.18993","last_updated":"2026-05-13T13:30:21Z","snapshot_observed_at":"2026-08-02T18:52:22.902766Z","submitted_at":"2025-09-23T13:43:02Z","title":"CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T14:51:30.312509Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2509.18993"},"observation_digest":"sha256:cf11dffc76253ab80f1ce5bfa01810789e24dd2e0a196adc60b7e8accbd6f81f","observation_id":"fa4a4d9d-b91c-4d2b-a413-ad83348928b1","resolution":{"observed_at":"2026-05-18T14:52:41.131143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2510.00761","last_updated":"2026-04-18T07:30:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T10:50:14Z","title":"Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T10:44:53.516653Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2510.00761"},"observation_digest":"sha256:c4583bc345465f0b907af86d9cb69c556e017e8d6dbd94e28b23c6ce7f11e28c","observation_id":"524fef99-d863-46aa-929b-efe21266c15b","resolution":{"observed_at":"2026-05-18T10:46:16.991047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2511.19078","last_updated":"2026-05-17T01:48:57Z","snapshot_observed_at":"2026-08-01T09:52:39.621101Z","submitted_at":"2025-11-24T13:18:21Z","title":"GraphMind: Theorem Selection and Conclusion Generation Framework with Dynamic GNN for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T18:31:46.510611Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2511.19078"},"observation_digest":"sha256:02e529f4d9c4ea5088ab4d3f4d11d2e6fe993352f072caac0820c73665afe9ea","observation_id":"4162e015-673a-42ae-bd0b-59b21bd62987","resolution":{"observed_at":"2026-05-21T18:34:17.957013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2601.06540","last_updated":"2026-04-13T10:43:27Z","snapshot_observed_at":"2026-07-06T22:41:19.981014Z","submitted_at":"2026-01-10T11:43:15Z","title":"Self-Organizing Dual-Buffer Adaptive Clustering Experience Replay (SODACER) for Safe Reinforcement Learning in Optimal Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T15:38:00.110683Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2601.06540"},"observation_digest":"sha256:0a2ff01a3b46555be800c49b768eee51bd610320eab04c64f1df7d33ccee8d5a","observation_id":"c1581cf0-e851-440d-acb1-cb73c7511f13","resolution":{"observed_at":"2026-05-16T15:38:03.167730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2602.00545","last_updated":"2026-05-24T15:44:34Z","snapshot_observed_at":"2026-08-03T06:08:33.717559Z","submitted_at":"2026-01-31T06:17:00Z","title":"Depth, Not Data: An Analysis of Hessian Spectral Bifurcation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T13:53:29.750448Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2602.00545"},"observation_digest":"sha256:2ac760aa46f2bc44f80eadc82b24f6211ba01b87edb3e5d190263cdc3877fd45","observation_id":"20291dcc-a6e8-4039-9249-45414dc50937","resolution":{"observed_at":"2026-05-21T13:54:11.462030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-03T06:08:34.918720Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training.arXiv preprint arXiv:2305.14342, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00545","last_updated":"2026-05-24T15:44:34Z","snapshot_observed_at":"2026-08-03T06:08:33.717559Z","submitted_at":"2026-01-31T06:17:00Z","title":"Depth, Not Data: An Analysis of Hessian Spectral Bifurcation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:08:34.918720Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2602.00545"},"observation_digest":"sha256:1e22dbd00553cb3e5672fefbd7723cf53a6529ac13c3a5de2fde2c856b64dcd4","observation_id":"7cb9d17c-2b5d-4eec-bab4-aafb3d5eabbc","resolution":{"observed_at":"2026-08-03T06:08:34.918720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:1a291610103dfc7740510b4f041b43b8cda39c2e58369592c30a887202ae7029","observation_id":"f65aeb92-3dfa-4e91-9a24-53946232c73b","resolution":{"observed_at":"2026-05-25T06:55:26.310837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2604.06253","last_updated":"2026-04-06T19:26:13Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-06T19:26:13Z","title":"FLeX: Fourier-based Low-rank EXpansion for multilingual transfer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:50:04.707303Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2604.06253"},"observation_digest":"sha256:a7491a15c1e0c17d06ae950be3f08448a83fdf88c4dca8d78e8bb66aad97fa4f","observation_id":"abd7b83e-755f-4e06-9d4e-7809f7361549","resolution":{"observed_at":"2026-05-10T22:25:53.403860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2604.06836","last_updated":"2026-04-09T02:16:08Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:57:09Z","title":"STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:49:40.758234Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2604.06836"},"observation_digest":"sha256:16014996613e5a7d3c86d6cd271d4041a4a6b3e09ecb99e9672218db9723347a","observation_id":"1e31ab96-ce91-475e-8898-20a5a0dda58d","resolution":{"observed_at":"2026-05-10T23:50:57.041214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2604.17396","last_updated":"2026-04-19T11:59:58Z","snapshot_observed_at":"2026-08-01T18:23:32.699442Z","submitted_at":"2026-04-19T11:59:58Z","title":"Representation-Guided Parameter-Efficient LLM Unlearning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-10T06:01:46.885030Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2604.17396"},"observation_digest":"sha256:9d964f33c2a73ca527060090903287ac9f110bc30b510eec609b4e02571da805","observation_id":"9c0dcc7e-ec11-4da9-9feb-eea5c9b0be8a","resolution":{"observed_at":"2026-05-10T06:06:19.357258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.00650","last_updated":"2026-05-01T13:31:35Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:31:35Z","title":"AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T19:50:50.653184Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.00650"},"observation_digest":"sha256:f1f7b7cee9ea121d0be885699ecb19951741ae1d0a0372cb9e8eeec6cba27f01","observation_id":"ddde0999-e6c4-457f-a4b9-87ec3efecd8e","resolution":{"observed_at":"2026-05-11T15:31:07.780240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.02317","last_updated":"2026-05-06T13:42:00Z","snapshot_observed_at":"2026-07-06T23:15:27.816549Z","submitted_at":"2026-05-04T08:14:51Z","title":"Anon: Extrapolating Adaptivity Beyond SGD and Adam","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T16:25:36.073417Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.02317"},"observation_digest":"sha256:4f6e99427c6b70b45098c87f9d6054951aedad54041f0d1f12be879a79ee4b02","observation_id":"d0f2b442-edfd-42e7-a38a-27a19a23f2c2","resolution":{"observed_at":"2026-05-11T16:31:09.762686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.06081","last_updated":"2026-05-07T12:03:04Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:03:04Z","title":"Fast Gauss-Newton for Multiclass Cross-Entropy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T14:01:26.202636Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.06081"},"observation_digest":"sha256:16ff9de5a1c24ce422ce1bdaa30e403cb7a0dad50bdde4b65fce7425f70fc733","observation_id":"0d7a88ee-e398-474d-910f-ddad5766b1cb","resolution":{"observed_at":"2026-05-11T18:46:09.639399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.06868","last_updated":"2026-05-07T19:10:48Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T19:10:48Z","title":"When Descent Is Too Stable: Event-Triggered Hamiltonian Learning to Optimize","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T01:52:21.146199Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.06868"},"observation_digest":"sha256:6eb54de1010151947ef0ae6b34576c2e68505638b1d6648292f134b97da66089","observation_id":"b4d6b4c9-d03d-450e-aa4d-4cd04cb06175","resolution":{"observed_at":"2026-05-11T04:15:58.135974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.07815","last_updated":"2026-05-08T14:47:56Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:47:56Z","title":"OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T02:47:08.766380Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.07815"},"observation_digest":"sha256:d85663ea432f4b545960b7822b178b330946958d20f627e44a68db2d71d1cf86","observation_id":"38f7f36c-4495-4e6c-9046-1dc5bab39699","resolution":{"observed_at":"2026-05-11T03:05:55.545930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.15622","last_updated":"2026-05-18T07:21:10Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T05:11:43Z","title":"Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T21:19:55.074853Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.15622"},"observation_digest":"sha256:37f90ba7db5757f1fbba972c457e0ccb592f2966f59d49c4cd83be9c57153201","observation_id":"768681cb-4d85-4433-b1de-9f55c8b3656a","resolution":{"observed_at":"2026-05-20T21:23:44.499777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.21724","last_updated":"2026-05-20T20:31:10Z","snapshot_observed_at":"2026-08-01T19:02:59.349289Z","submitted_at":"2026-05-20T20:31:10Z","title":"TBP-mHC: full expressivity for manifold-constrained hyper connections through transportation polytopes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:07.226252Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.21724"},"observation_digest":"sha256:c143ae686e103212df87a553d4cbde96adbab420d6629adde692394a8d509b26","observation_id":"a70a80e3-06e8-4f18-8e64-1e9c65c9463f","resolution":{"observed_at":"2026-05-22T10:01:23.417380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-02T21:41:54.474589Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:de12ed2b22d42c7b88ca1387332365778d34a2591936400799275e301c7d8284","observation_id":"e278e906-69ee-4b96-b4e4-31171763cf2e","resolution":{"observed_at":"2026-05-22T08:11:17.272744Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.03904","last_updated":"2026-06-02T17:00:15Z","snapshot_observed_at":"2026-08-01T14:15:34.699729Z","submitted_at":"2026-06-02T17:00:15Z","title":"MAdam: Metric-Aware Multi-Objective Adam","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T11:21:53.393381Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.03904"},"observation_digest":"sha256:1f0d50d20fd2c1cfebd10afd4eeaf35b054f4f2005b5c518ff1cf0eb2831cdc7","observation_id":"dd4ffc87-30e8-45ae-ae74-045f5c499fc3","resolution":{"observed_at":"2026-07-02T01:56:28.457859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:f44ebf39ddb155a722d7cb51bf35c91c489dac6a3e5d0bf27fdbd05e9dd177df","observation_id":"0f5bdaee-8582-4180-a923-3c8dd4fa77e6","resolution":{"observed_at":"2026-07-02T07:06:44.868441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.06412","last_updated":"2026-06-04T17:15:50Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:15:50Z","title":"Nonreversible Gauge Fields in Fokker--Planck Dynamics: Supersymmetric Hamiltonians and Learned Finite Forces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T22:42:16.293180Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.06412"},"observation_digest":"sha256:1574e2a143a09715c81fe0032f7915a1ee1b736437fd280ae0a46d9e9c1d136b","observation_id":"23065f76-49d6-41ff-ae8e-b74256f84141","resolution":{"observed_at":"2026-07-02T16:27:09.266798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.14187","last_updated":"2026-06-16T11:02:08Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T07:10:17Z","title":"Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T05:03:06.472027Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.14187"},"observation_digest":"sha256:cc221cebd911126728e1ee00ee8756984e16c76d2d718fddbdc5ac61cb2d24b1","observation_id":"dd75d8df-e762-4841-adeb-7804f04027d1","resolution":{"observed_at":"2026-07-03T16:38:41.033120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-02T20:09:39.374252Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T00:09:54.353782Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:8dd9b274479be90fbb2f8ed7c4aacd4afd718b3132956d74caca95fb19c0af45","observation_id":"639c8233-e634-4a3b-9ac5-2cc2e2935678","resolution":{"observed_at":"2026-07-04T16:49:58.420186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-02T20:09:39.374252Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T06:36:46.924135Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:eae51e02c25a8b7d514a83c55b6f13d03d75e3b0205e3f412ab757c8e2501006","observation_id":"65aa25fd-9971-43bd-aad9-911f003c6835","resolution":{"observed_at":"2026-07-01T09:25:41.284177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2606.30455","last_updated":"2026-06-29T15:22:32Z","snapshot_observed_at":"2026-07-07T00:04:20.023800Z","submitted_at":"2026-06-29T15:22:32Z","title":"Curvature-Weighted Gradient Diversity: A Noise Measure for Geometry-Adaptive SGD Schedules","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T07:31:11.050545Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2606.30455"},"observation_digest":"sha256:eaea6e7a839b19131a93a88b285871a85f11d57d3226dd51c81faa6380092721","observation_id":"a5c9ca12-1df1-4865-8c30-f836d80cec43","resolution":{"observed_at":"2026-06-30T07:34:21.498373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":"2305.14342","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-09T17:36:25.374536Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024a","venue":"cs.LG","work_id":"91ee7625-8541-4461-90b4-5f7e2e9ddad1","year":2023},"citing_paper":{"arxiv_id":"2607.07206","last_updated":"2026-07-11T18:06:27Z","snapshot_observed_at":"2026-07-31T02:44:27.308999Z","submitted_at":"2026-07-08T09:40:44Z","title":"Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-09T17:31:09.270342Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2607.07206"},"observation_digest":"sha256:7dfbba468578e21a093ff876b88c6905410f5d93706f80578d03f6888a9be1ff","observation_id":"ad27b670-2eea-4251-82d4-ef71158d43d9","resolution":{"observed_at":"2026-07-09T17:36:25.376052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-07-14T15:50:41.329016Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.07206","last_updated":"2026-07-11T18:06:27Z","snapshot_observed_at":"2026-07-31T02:44:27.308999Z","submitted_at":"2026-07-08T09:40:44Z","title":"Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions","version":2},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-07-14T15:50:41.329016Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2607.07206"},"observation_digest":"sha256:193eaf8420f31291d5d1a81086c544c115f9505ace95f661f916470ac192b46d","observation_id":"72064397-e298-4e98-bb53-26beab5072c7","resolution":{"observed_at":"2026-07-14T15:50:41.329016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-02T12:30:37.114754Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training.arXiv preprint arXiv:2305.14342,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20486","last_updated":"2026-06-02T15:21:53Z","snapshot_observed_at":"2026-08-04T12:41:14.831060Z","submitted_at":"2026-06-02T15:21:53Z","title":"OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:37.114754Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2607.20486"},"observation_digest":"sha256:1ee73a73cdcbf6017e2ec6552461b87e296379adda98bee57a047d68a3c2a91d","observation_id":"a0823259-c6e0-43b6-be8a-72bef1918ab1","resolution":{"observed_at":"2026-08-02T12:30:37.114754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.14342/citation-record","integrity":"/paper/2305.14342/integrity","json":"/paper/2305.14342/citation-record.json","paper":"/paper/2305.14342"},"outbound":[],"paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2305.14342."}