{"as_of":"2026-08-08T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2b949e0c7cf4757db55b3f83f47e9c063db095958b249ce827051ba4a500db5","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:30.649181Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:38:48.446865Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-04T09:38:48.446865Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-07T22:51:49.378334Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:48.446865Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:4cb753f15742f85ef0546451f4670d9f30ceb461a65f01d20fd1807245c39432","observation_id":"34bb4621-ccf2-4792-bf5c-1e3ccfebbc71","resolution":{"observed_at":"2026-08-04T09:38:48.446865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:219db54bca81ab77d51bfa335c01d53dd2f64635a947f2eab5f5e4a6a54e9f7e","observation_id":"0d414ffe-531d-4c19-a57a-892ac77a246f","resolution":{"observed_at":"2026-05-15T04:49:44.656518Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.17787","last_updated":"2026-05-18T03:09:50Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T03:09:50Z","title":"Revisiting the Adam-SGD Gap in LLM Pre-Training: The Role of Large Effective Learning Rates","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T13:34:09.129379Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.17787"},"observation_digest":"sha256:500f4d7ac6de046857721da8ccd9479192c6db903860d8aacd76baa080b45d96","observation_id":"01bd3cbc-d651-4a8c-bf5a-ad2e192dce3d","resolution":{"observed_at":"2026-05-20T13:38:19.427606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-02T21:41:54.474589Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":235,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:dbcd91ff4b8345336f5872402857e11fd478f12bd189dc4ac3b21b8cb8cf4fcf","observation_id":"53449721-9569-4766-a9a1-050f989768bf","resolution":{"observed_at":"2026-05-22T08:11:17.363127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2605.29273","last_updated":"2026-05-28T02:48:19Z","snapshot_observed_at":"2026-08-04T17:48:43.946338Z","submitted_at":"2026-05-28T02:48:19Z","title":"A Theoretical and Experimental Study of a Novel Adaptive Learning Algorithm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T09:18:31.526770Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2605.29273"},"observation_digest":"sha256:a1655aa8d0287f0cb6352c021da6a2aac0155ad8c846e2e2062f9ce5206b926d","observation_id":"3aa9feae-5033-46d6-8a2e-f130184609b1","resolution":{"observed_at":"2026-06-29T09:23:16.439125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"cited_work":{"arxiv_id":"2506.12543","doi":"10.48550/arxiv.2506.12543","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12543","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your batch size the problem? revisiting the adam-sgd gap in language modeling","venue":"ArXiv.org","work_id":"cab94819-0edb-417c-9a11-971473b0d098","year":2025},"citing_paper":{"arxiv_id":"2606.23591","last_updated":"2026-06-22T17:00:04Z","snapshot_observed_at":"2026-08-02T00:14:44.848420Z","submitted_at":"2026-06-22T17:00:04Z","title":"Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T08:45:34.884703Z"},"links":{"cited_paper":"/paper/2506.12543","citing_paper":"/paper/2606.23591"},"observation_digest":"sha256:f3b549f856ae60197cd21d913d914173215065933f4035e00081ab922c2fd07a","observation_id":"e9e7170e-6db5-4851-b0e2-92c553ad4910","resolution":{"observed_at":"2026-06-26T08:49:14.928649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12543/citation-record","integrity":"/paper/2506.12543/integrity","json":"/paper/2506.12543/citation-record.json","paper":"/paper/2506.12543"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.11803","last_updated":"2020-02-26T21:42:49Z","snapshot_observed_at":"2026-07-06T09:00:26.490403Z","submitted_at":"2020-02-26T21:42:49Z","title":"Disentangling Adaptive Gradient Methods from Learning Rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.11803","snapshot_observed_at":"2026-08-07T00:50:29.766980Z","title":"Agarwal, R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.766980Z"},"links":{"cited_paper":"/paper/2002.11803","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:32d98243705f6874f2293f23b07775eed2d0a951677f4d3fd06a2d090b0374df","observation_id":"a21bd626-5831-4ece-acb5-d4840f36f7b9","resolution":{"observed_at":"2026-08-07T00:50:29.766980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.044935Z","title":"As before, the gap decreases the longer we train, and SGD can eventually outperform Adam","venue":null,"work_id":"c965b783-ea18-49cb-9133-8cf973578ce3","year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.645921Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:a2f50406a9cfad37821da11e3c7f7929c71dc2d378a1888eaab0596854a08b03","observation_id":"49d4b4c9-e468-4c4f-b591-c01e47235889","resolution":{"observed_at":"2026-08-07T00:50:31.048280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00181","last_updated":"2026-05-22T19:40:10Z","snapshot_observed_at":"2026-08-07T12:08:26.635752Z","submitted_at":"2025-05-30T19:35:15Z","title":"On the Interaction of Batch Noise, Adaptivity, and Compression, under $(L_0,L_1)$-Smoothness: An SDE Approach","version":2},"cited_work":{"arxiv_id":"2506.00181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00181","snapshot_observed_at":"2026-08-07T00:50:30.992429Z","title":"On the Interaction of Batch Noise, Adaptivity, and Compression, under $(L_0,L_1)$-Smoothness: An SDE Approach","venue":"cs.LG","work_id":"b5889595-c08d-4594-b59b-bddc35dfcb95","year":2025},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.238100Z"},"links":{"cited_paper":"/paper/2506.00181","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ba9974e8e9b0054ade7eec114e39a4a747c983973d3926368bb0e178aa6130cf","observation_id":"42de01fd-13d3-4930-a9bc-9a2017e833c3","resolution":{"observed_at":"2026-08-07T00:50:30.995734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-07T00:50:30.555421Z","title":"org/abs/2405.18392","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.555421Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:fdedfbcd8b790fb6fc79b551a7f8254434cdcb69f80f4fa87ae718083f62e5d8","observation_id":"bbf646a2-602d-4105-bf75-187a47e1043a","resolution":{"observed_at":"2026-08-07T00:50:30.555421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02254","last_updated":"2022-11-04T04:05:57Z","snapshot_observed_at":"2026-07-06T14:14:23.751937Z","submitted_at":"2022-11-04T04:05:57Z","title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","version":1},"cited_work":{"arxiv_id":"2211.02254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.02254","snapshot_observed_at":"2026-08-07T00:50:30.945471Z","title":"How Does Adaptive Optimization Impact Local Neural Network Geometry?","venue":"cs.LG","work_id":"ab285d51-24ea-451d-8804-20b4865de21b","year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.563102Z"},"links":{"cited_paper":"/paper/2211.02254","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:6c0d3b2aca68267d3ca471039bbb564ff677372b045e5b557aea414412fad7e3","observation_id":"faba8271-5cc9-4dd9-a404-e1ec57e7b9b5","resolution":{"observed_at":"2026-08-07T00:50:30.948721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:50:30.570637Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.570637Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:f725edbe3d8e1445e0b007c82cdc1d4b9095d1cf11e03800365df38fc3eede52","observation_id":"3ed2fc01-02dd-4f7e-831e-dbf28261e37e","resolution":{"observed_at":"2026-08-07T00:50:30.570637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-07T00:50:30.584903Z","title":"arXiv:2402.19449 [cs, math, stat]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.584903Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:56e68f6bfdc35aa118e3a8188293640f7b61f30f7ea77084b3256491b2f435c2","observation_id":"93b8ace5-b1e8-41e7-976f-b4ee1f3a29da","resolution":{"observed_at":"2026-08-07T00:50:30.584903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-07T00:50:30.594639Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.594639Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:d3361bb74ce961cee38946f11cb92313bd30c05a639146872673ac5cde1c7c2f","observation_id":"e4f2a746-919f-4dfd-9dad-d458551d844e","resolution":{"observed_at":"2026-08-07T00:50:30.594639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10287","last_updated":"2024-11-01T02:01:18Z","snapshot_observed_at":"2026-07-06T13:12:09.513050Z","submitted_at":"2022-05-20T16:39:03Z","title":"On the SDEs and Scaling Rules for Adaptive Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10287","snapshot_observed_at":"2026-08-07T00:50:30.606742Z","title":"arXiv:2205.10287 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.606742Z"},"links":{"cited_paper":"/paper/2205.10287","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:14a6473220e4bd737910fd3fca2286ea7fc0cd0cbbc0ac708386c9d48cac2be9","observation_id":"cf808663-47b5-4c1a-9afc-7e27f355ba34","resolution":{"observed_at":"2026-08-07T00:50:30.606742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.612924Z","title":"Orvieto and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.612924Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:6d7cf50e10da62c010d42f7599e5987e6c2c49fb5c4f8ad7b000f2af9d61aa35","observation_id":"3c264e59-9a2c-40dd-b301-bfb40bb9ea61","resolution":{"observed_at":"2026-08-07T00:50:30.612924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00204","last_updated":"2023-05-31T21:49:44Z","snapshot_observed_at":"2026-08-04T17:02:26.909649Z","submitted_at":"2023-05-31T21:49:44Z","title":"Toward Understanding Why Adam Converges Faster Than SGD for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00204","snapshot_observed_at":"2026-08-07T00:50:30.615997Z","title":"arXiv:2306.00204 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.615997Z"},"links":{"cited_paper":"/paper/2306.00204","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:2af8b3ef740614c60d1f35ade2f4b1182e7b16116a4972086f07dc8671277333","observation_id":"c90daf0d-ba2c-4c9c-8d1c-cfba25a472cb","resolution":{"observed_at":"2026-08-07T00:50:30.615997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:30.624491Z","title":"arXiv:2502.00213 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.624491Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:5276d8050afe9ac2757af9edd8013a2406e44fbad1f9b8b75b52f3436949ac39","observation_id":"69e7fee2-9ad5-4733-b8d8-8f7515dc23f4","resolution":{"observed_at":"2026-08-07T00:50:30.624491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08198","last_updated":"2025-06-11T16:28:30Z","snapshot_observed_at":"2026-07-06T19:31:23.072307Z","submitted_at":"2024-10-10T17:58:53Z","title":"Adam Exploits $\\ell_\\infty$-geometry of Loss Landscape via Coordinate-wise Adaptivity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08198","snapshot_observed_at":"2026-08-07T00:50:30.627480Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.627480Z"},"links":{"cited_paper":"/paper/2410.08198","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:78eb417272f7a2726d5831765adab957e6d2907e61d93f89586194c4904db65f","observation_id":"ff2174f1-3d25-4dac-8c73-a60ed35c049d","resolution":{"observed_at":"2026-08-07T00:50:30.627480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-07T00:50:30.630441Z","title":"arXiv:2410.21676 [cs]","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.630441Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:19abe11b52c6e63d068bc9ea32d32a19bf35150ba19348b57ce2c1743cacd625","observation_id":"37a5bffc-f69f-4701-ab14-eb9cf9c9450d","resolution":{"observed_at":"2026-08-07T00:50:30.630441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-07T00:50:30.633781Z","title":"arXiv:2402.16788 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.633781Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ce65dca09bd88c125d296e3a4c0bd462e973aac94f4e2c98412138bbff8303bb","observation_id":"f7dcaf01-f68f-4aad-a8d0-86ec4ad73dc9","resolution":{"observed_at":"2026-08-07T00:50:30.633781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T00:50:30.636520Z","title":"arXiv:2407.07972 [cs]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.636520Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:858be04de0095def03d6a962e215d90f7d5e769fa80e69a6f07118a92ecba996","observation_id":"d6d36155-b1fa-4519-8f90-785c1d93fa03","resolution":{"observed_at":"2026-08-07T00:50:30.636520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.062369Z","title":null,"venue":null,"work_id":"f4b61737-52bc-445e-950e-ecbadadc36f6","year":2023},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.639985Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ccb789f0d528d22102062eadf6568be0f50d529166d7768e89cb6bf9cf1dd2f6","observation_id":"a976dd82-e9e3-4506-b999-0f76593a6436","resolution":{"observed_at":"2026-08-07T00:50:31.065026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.036397Z","title":"[2024], and uses the codebase of Orvieto and Gower [2025]","venue":null,"work_id":"8f9079bc-414c-4e76-804e-1d9e35632ac0","year":2024},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.649181Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:536fd46395370988621f9807c49166b174bc20c4f85931acb1cc1cb8a1de5bc1","observation_id":"08b0145f-91e0-48b2-ae3e-3a5593e047d9","resolution":{"observed_at":"2026-08-07T00:50:31.039339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:31.053720Z","title":null,"venue":null,"work_id":"5f9ac329-51a2-4150-8464-d661b1937a8a","year":2023},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.642968Z"},"links":{"citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:dd4e94db4207c66089114655abbcd9c50c1463d115f275722b1c0d877c45b358","observation_id":"f34f1c0d-9218-4ca8-aec6-2a8131c3d5ec","resolution":{"observed_at":"2026-08-07T00:50:31.056492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05895","last_updated":"2019-12-30T03:53:04Z","snapshot_observed_at":"2026-08-07T19:31:58.707080Z","submitted_at":"2019-10-14T02:23:43Z","title":"Transformers without Tears: Improving the Normalization of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05895","snapshot_observed_at":"2026-08-07T00:50:30.609473Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.609473Z"},"links":{"cited_paper":"/paper/1910.05895","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:7a9ae29102558c7bfa8a80e2962e9eb359ff492063bc39145ed6e035285267be","observation_id":"f176b608-2526-4295-95c2-1538cb7575ee","resolution":{"observed_at":"2026-08-07T00:50:30.609473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09359","last_updated":"2023-10-10T05:31:01Z","snapshot_observed_at":"2026-07-06T14:19:39.156008Z","submitted_at":"2022-11-17T06:18:45Z","title":"How to Fine-Tune Vision Models with SGD","version":2},"cited_work":{"arxiv_id":"2211.09359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09359","snapshot_observed_at":"2026-08-07T00:50:30.920804Z","title":"How to Fine-Tune Vision Models with SGD","venue":"cs.CV","work_id":"7bafd919-f3d0-447f-8169-1fc5dde2da05","year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.576108Z"},"links":{"cited_paper":"/paper/2211.09359","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:e6ef4af870c783a8b2b33e7a0543994f939990518f9c2bb81e1626e0aeff1623","observation_id":"6799d912-962d-42ed-bda7-de130b44a4a0","resolution":{"observed_at":"2026-08-07T00:50:30.926338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:50:30.548431Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.548431Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:5074e02c514b16ffb2275ad33b5583118900113396fa16e40fa6560e73da4619","observation_id":"c597f601-3722-465a-851c-2e2ab7b14dcb","resolution":{"observed_at":"2026-08-07T00:50:30.548431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04434","last_updated":"2018-08-07T18:55:19Z","snapshot_observed_at":"2026-08-06T02:47:02.967969Z","submitted_at":"2018-02-13T02:14:35Z","title":"signSGD: Compressed Optimisation for Non-Convex Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04434","snapshot_observed_at":"2026-08-07T00:50:29.980013Z","title":"arXiv:1802.04434 [cs, math]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.980013Z"},"links":{"cited_paper":"/paper/1802.04434","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:ff8ddffb1894ea38abb2a39bfe41353b27fa3e8b70cf276229f8b88b9e0ee6ff","observation_id":"c4d8fd51-e618-4b44-9367-f940273b414c","resolution":{"observed_at":"2026-08-07T00:50:29.980013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-07T15:56:34.964782Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-07T00:50:30.618825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.618825Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:7b22640769035c6fa95c21de1f78c1ff25d55ddcafae780e585fdf74e1ed9089","observation_id":"ef191c64-b70d-4e05-a88f-27d993caa9c9","resolution":{"observed_at":"2026-08-07T00:50:30.618825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T00:50:30.464304Z","title":"Goyal, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.464304Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:015dd7357590453bbfb968a16124da63aeaeb8464ae2d295b538d84757802d3c","observation_id":"4f04113b-7173-4087-a8fc-853e94d5a18b","resolution":{"observed_at":"2026-08-07T00:50:30.464304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T00:50:30.603923Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.603923Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:0337dacab9014ed725fb718dc1851d2e951bb93ae30f237a4542bce7abb2d04a","observation_id":"72b5ec18-fdd9-4bf8-b615-731d1aa0231f","resolution":{"observed_at":"2026-08-07T00:50:30.603923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:50:30.348876Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.348876Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:46837a6d6d11214cb87f0f0bc394c185485e808f1b6dc0a24e5fc2fcc126dc16","observation_id":"a959df74-d31d-472b-b5f2-150c36d047b8","resolution":{"observed_at":"2026-08-07T00:50:30.348876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-07T00:50:30.096081Z","title":"Black, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.096081Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:b961a52e0d87d58d93e8c3146bbdd1528165bb237fa58c663d40545ec364be70","observation_id":"6cec26bc-75cf-40f6-8c17-d216703fe868","resolution":{"observed_at":"2026-08-07T00:50:30.096081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-02T11:56:02.354026Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-07T00:50:29.838100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:29.838100Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:063fec530be8006f8daff7c13d38caeea707ef765dcee1a12e055d320255f56c","observation_id":"3c56be0f-8610-4504-8510-4e9111b6f761","resolution":{"observed_at":"2026-08-07T00:50:29.838100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T00:50:30.621589Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.621589Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:996aa38ba3bca2f65aec03359d124c2a4cf49e22c791ac79bca79e3f82afaa74","observation_id":"0da4f519-d61b-47a1-8033-3430a73bbbff","resolution":{"observed_at":"2026-08-07T00:50:30.621589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:11:38.243251Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 6 inbound Pith citation observations for arXiv:2506.12543."}