{"as_of":"2026-08-07T17:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75b5fe0d4b8a8653d88a2f00a8b6adc66699571d6be9726b1f4a249ed5909748","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:29.263146Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:27:30.162768Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T07:27:52.883335Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2409.20325"},"observation_digest":"sha256:056435a66b802d56d01f0a7721a820d058d5c1486dcda47d14448e3b53c8e56f","observation_id":"d37440de-1ffc-48ba-8fb9-af58f132c7e8","resolution":{"observed_at":"2026-05-16T07:27:52.955453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T11:57:29.263146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-07T11:49:53.737012Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.263146Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:210e386bf8eb5285117528637bab5eaf03d49deb5d577deb7848b993a062992c","observation_id":"b19eaa3e-d997-4475-af1e-df2e6a124e0c","resolution":{"observed_at":"2026-08-07T11:57:29.263146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T00:50:30.636520Z","title":"arXiv:2407.07972 [cs]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-07T00:44:14.791997Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.636520Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:6533819269301d5e81d75ef28404e46d61d2d566afc80d0c917fdc46e1e76a4b","observation_id":"d6d36155-b1fa-4519-8f90-785c1d93fa03","resolution":{"observed_at":"2026-08-07T00:50:30.636520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-06T21:09:33.200101Z","title":"steady state","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01129","last_updated":"2025-07-01T18:44:35Z","snapshot_observed_at":"2026-08-06T20:56:58.233760Z","submitted_at":"2025-07-01T18:44:35Z","title":"On Design Principles for Private Adaptive Optimizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:09:33.200101Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2507.01129"},"observation_digest":"sha256:7304d928074d1b33ee81d6959eba392753c49ebe60cb700f167afb46a1efc920","observation_id":"d12a81c7-2229-430d-9787-4b99a6c15a39","resolution":{"observed_at":"2026-08-06T21:09:33.200101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-04T09:38:51.648559Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-04T09:38:43.966098Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:51.648559Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:1300b86cbffa41089bfab76cd5f56fe76f0d4f3e24207978e7bde6f202c1f704","observation_id":"7ea7beba-0650-4b10-aaf8-17de7a19d88a","resolution":{"observed_at":"2026-08-04T09:38:51.648559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-03T00:02:46.444321Z","title":"Deconstruct- ing what makes a good optimizer for language models.arXiv preprint arXiv:2407.07972,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.444321Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:b1bbc55fec22d8bba298d9eede03d74ff31025fea9aa4239b7b44c5f06de918e","observation_id":"e2572600-d266-46aa-9b73-c18d7d38e2fe","resolution":{"observed_at":"2026-08-03T00:02:46.444321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:d17c02159fc7e6e65247ca0d208f6acf47a959815f8ab5aa6fe9b142b6514f11","observation_id":"d38d8f07-0ca0-46f3-863d-c89996a5d9e8","resolution":{"observed_at":"2026-07-02T07:06:44.884155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-02T08:47:15.917924Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:bb9a36f7b3792558b067e7a4820a9d24d6b5c305a3b709872808250c64a24b05","observation_id":"d6158db1-28c9-472b-918e-6470b164ddee","resolution":{"observed_at":"2026-07-02T11:56:56.098113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:4a14b29210611231212d85ec9d58c9b2358d21be467d553420eba2603f1f22ca","observation_id":"ac0f7cd7-60a2-45d1-a928-e2242878a79c","resolution":{"observed_at":"2026-07-03T00:27:30.164103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Deconstructing what makes a good optimizer for language models, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:cc198677c8e5a8f29096db2b8e7e3b2a9e322724f0c0dc2d580305d6b2ef64d5","observation_id":"c531ab18-8baf-4ef5-a237-ab573d950f87","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-05T05:27:16.990675Z","title":"Deconstructing what makes a good optimizer for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03941","last_updated":"2026-08-04T17:10:47Z","snapshot_observed_at":"2026-08-07T17:37:26.138163Z","submitted_at":"2026-08-04T17:10:47Z","title":"Muon Meets Mamba: Spectral Optimization for State Space Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:27:16.990675Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2608.03941"},"observation_digest":"sha256:4959f9d78700cecc7ea3c9888f93cae42dd4026eed62d06641138fab126a6864","observation_id":"4e96dacf-3e2f-44a5-9d04-d6acdee852fa","resolution":{"observed_at":"2026-08-05T05:27:16.990675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.07972/citation-record","integrity":"/paper/2407.07972/integrity","json":"/paper/2407.07972/citation-record.json","paper":"/paper/2407.07972"},"outbound":[],"paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2407.07972."}