{"as_of":"2026-08-08T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab522fe7107ef264b16ac8caa749597b53164b871e6a3a102c50aa2a2b3a46cd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:30.277440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:30:07.608050Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-07T12:45:30.277440Z","title":"How to set adamw's weight decay as you scale model and dataset size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:30.277440Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:1d3451fb8bc3bc27f3bdc93cfa9f2a4d969e9d9842d1fd9afa53cd249c72fb83","observation_id":"2a802f31-d8a0-4a08-a5ba-7884a5a91ec3","resolution":{"observed_at":"2026-08-07T12:45:30.277440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-06T20:48:54.538611Z","title":"and Aitchison, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-06T20:35:13.610100Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:54.538611Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:3ff0aa94d30074ca7052c6333c4ed0409d14da9ca52ece351dbfdb40addd92e4","observation_id":"16c13459-0ce0-4da9-8d2f-dab0399daa4c","resolution":{"observed_at":"2026-08-06T20:48:54.538611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-03T00:15:37.343946Z","title":"How to set AdamW’s weight decay as you scale model and dataset size.arXiv preprint arXiv:2405.13698,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11137","last_updated":"2026-05-28T23:29:40Z","snapshot_observed_at":"2026-08-03T19:24:57.288331Z","submitted_at":"2026-02-11T18:49:26Z","title":"Weight Decay Improves Language Model Plasticity","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T00:15:37.343946Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2602.11137"},"observation_digest":"sha256:5d4dfdb06901f71ab13c5bd760b6a5dc421b4815796f952f5d041ba7c3076734","observation_id":"b442b740-5ea5-493a-b93e-605a2a8ff4ac","resolution":{"observed_at":"2026-08-03T00:15:37.343946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":"2405.13698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-07-04T20:30:07.608050Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":"dc262c2f-9b40-4c60-a9a8-2414ebda63d2","year":2025},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:8dc2e3739e4077eff78945449900a28706cf94ccb7bbe7eae7f05f1f4b3e1a94","observation_id":"62b52619-7bc6-46fd-90cd-b5cbe7b9bb18","resolution":{"observed_at":"2026-05-14T21:53:02.441467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":"2405.13698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-07-04T20:30:07.608050Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":"dc262c2f-9b40-4c60-a9a8-2414ebda63d2","year":2025},"citing_paper":{"arxiv_id":"2605.15290","last_updated":"2026-05-14T18:03:16Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:03:16Z","title":"GQA-{\\mu}P: The maximal parameterization update for grouped query attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:40.231293Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2605.15290"},"observation_digest":"sha256:ca013185479c70fdd5a725b3fc479e4353082b9cda23777f78241a0eb8b90ff0","observation_id":"b57ebadf-4f86-465b-9aff-eab0e2766a85","resolution":{"observed_at":"2026-05-19T16:37:39.822671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":"2405.13698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-07-04T20:30:07.608050Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":"dc262c2f-9b40-4c60-a9a8-2414ebda63d2","year":2025},"citing_paper":{"arxiv_id":"2605.18898","last_updated":"2026-05-17T11:00:59Z","snapshot_observed_at":"2026-08-04T02:15:06.545925Z","submitted_at":"2026-05-17T11:00:59Z","title":"A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-20T14:20:15.499338Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2605.18898"},"observation_digest":"sha256:4d37100c73bed120e13c9421027c4c7f7c2e92556aff1349a678b6050b286b4e","observation_id":"347648e8-8a1f-4e37-9355-d8eec62b6283","resolution":{"observed_at":"2026-05-20T14:23:21.546428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":"2405.13698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-07-04T20:30:07.608050Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":"dc262c2f-9b40-4c60-a9a8-2414ebda63d2","year":2025},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:d34f327a71a82aca5e5742e567b471042d92d6b51d1f1b94145a0bfb33d172d4","observation_id":"f297a98d-c26e-4bc0-a89f-45ca90684f91","resolution":{"observed_at":"2026-07-03T00:27:30.106422Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":"2405.13698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-07-04T20:30:07.608050Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":"dc262c2f-9b40-4c60-a9a8-2414ebda63d2","year":2025},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:2449dd6583ae4b1a36de359dc93500e9a10d2b469023c374c83bace679b0cd75","observation_id":"0a73887b-e141-43ab-ad54-9fd14da19f9b","resolution":{"observed_at":"2026-07-04T20:30:07.609833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13698","snapshot_observed_at":"2026-08-02T10:14:12.180596Z","title":"How to set AdamW 's weight decay as you scale model and dataset size","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:12.180596Z"},"links":{"cited_paper":"/paper/2405.13698","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:b8810ad36ffea947690260e077d004ec3ea147eca960c950513c65650b533925","observation_id":"30de1928-ab05-4104-8e23-21758f905ff7","resolution":{"observed_at":"2026-08-02T10:14:12.180596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.13698/citation-record","integrity":"/paper/2405.13698/integrity","json":"/paper/2405.13698/citation-record.json","paper":"/paper/2405.13698"},"outbound":[],"paper":{"arxiv_id":"2405.13698","last_updated":"2025-06-01T16:35:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:17:59.081203Z","submitted_at":"2024-05-22T14:43:02Z","title":"How to set AdamW's weight decay as you scale model and dataset size"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2405.13698."}