{"as_of":"2026-08-21T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1cfcb7d7d24c73dcd3bddcfb48e2e974012cd7bb1cd4640a3dce5fbfec74bdf0","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:59:10.428787Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:34:43.639777Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:34:02.917248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"cited_work":{"arxiv_id":"2507.20057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20057","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What can grokking teach us about learning under nonstationarity?arXiv preprint arXiv:2507.20057","venue":null,"work_id":"bda95f87-5fa4-406e-ab61-3dce181800b0","year":null},"citing_paper":{"arxiv_id":"2605.20441","last_updated":"2026-05-19T19:48:40Z","snapshot_observed_at":"2026-08-16T18:26:04.913918Z","submitted_at":"2026-05-19T19:48:40Z","title":"Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T07:30:07.287938Z"},"links":{"cited_paper":"/paper/2507.20057","citing_paper":"/paper/2605.20441"},"observation_digest":"sha256:b2b298b3e24d77a1b974b92dd336781e005c934840c7ac52603fe14ad14bbfa6","observation_id":"15211429-16f3-4e8c-8bec-d330d49ab307","resolution":{"observed_at":"2026-05-21T07:34:02.918767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20057","snapshot_observed_at":"2026-08-01T10:34:43.639777Z","title":"What can grokking teach us about learning under nonstationarity?arXiv preprint arXiv:2507.20057, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27281","last_updated":"2026-07-29T13:46:52Z","snapshot_observed_at":"2026-08-19T04:48:08.408459Z","submitted_at":"2026-07-29T13:46:52Z","title":"The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T10:34:43.639777Z"},"links":{"cited_paper":"/paper/2507.20057","citing_paper":"/paper/2607.27281"},"observation_digest":"sha256:1cfbe672ab6fd8af0844daa473f5bcc1ed81dde47db03ed719506b5cdde10fc5","observation_id":"4c48ecc3-b73b-48ea-b9a8-4099b40208ce","resolution":{"observed_at":"2026-08-01T10:34:43.639777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20057/citation-record","integrity":"/paper/2507.20057/integrity","json":"/paper/2507.20057/citation-record.json","paper":"/paper/2507.20057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.862503Z","title":"LayerNorm layers, when incorporated, are applied to the attention inputs and outputs, and the MLP outputs","venue":null,"work_id":"daccd05c-0cfa-4782-a3c0-c263e5d5be3b","year":2015},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.419198Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:89be2c9a4973c4e19181d340660eb4a20a91cb1e235fb21fdf5050880b75f3bc","observation_id":"a33e064c-2a2f-46d9-89b2-1aafb51075dd","resolution":{"observed_at":"2026-08-15T17:59:10.867629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"questions/4433691","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.572184Z","title":null,"venue":null,"work_id":"21b7c6fc-61b3-4608-b70c-9ffac946bf55","year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.428787Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:282c8514ddf6e5eff7c41c79ed222b2af60b2c5d9df509572a760a71e7eb7194","observation_id":"266f8e5a-1112-465f-8fed-f6f71db8c494","resolution":{"observed_at":"2026-08-15T17:59:10.581087Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.992644Z","title":"Unveiling grokking: Analyzing feature learning dynamics during training","venue":null,"work_id":"b40271e8-ea87-4562-a98f-972f07904f9e","year":2024},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.291734Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:524fbb8847f735df35b938d4efbc0f01cfe8abcdd75f1f347c508ce76ae78b10","observation_id":"0ddf42b4-9fac-4894-b765-744d56dec34b","resolution":{"observed_at":"2026-08-15T17:59:10.997182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06173","last_updated":"2023-03-10T19:16:53Z","snapshot_observed_at":"2026-08-16T15:49:07.982971Z","submitted_at":"2023-03-10T19:16:53Z","title":"Unifying Grokking and Double Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06173","snapshot_observed_at":"2026-08-15T17:59:10.311153Z","title":"Unifying grokking and double descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.311153Z"},"links":{"cited_paper":"/paper/2303.06173","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:29e2b0186314b22404fdab501e9e6735232800de87633dd993f1261bba7eab75","observation_id":"ea857991-2d3c-4e33-a3b1-3b7bf41b1cc6","resolution":{"observed_at":"2026-08-15T17:59:10.311153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06325","last_updated":"2022-05-05T17:16:00Z","snapshot_observed_at":"2026-08-20T12:19:10.642993Z","submitted_at":"2021-08-13T17:33:47Z","title":"Continual Backprop: Stochastic Gradient Descent with Persistent Randomness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06325","snapshot_observed_at":"2026-08-15T17:59:10.317139Z","title":"Continual backprop: Stochastic gradient descent with persistent randomness","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.317139Z"},"links":{"cited_paper":"/paper/2108.06325","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:a3f0b4e505e37b783f1334e396e6d5093b03f122958d66a79493d4f35bd64128","observation_id":"a560902e-5e70-47a7-ac13-2172d4976cb3","resolution":{"observed_at":"2026-08-15T17:59:10.317139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.964508Z","title":"Learning continually by spectral regularization","venue":null,"work_id":"a4def8c0-a1e4-4735-a0ef-c7c35c1d9b23","year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.338917Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:bf457aa880ac8fa349b74df08f980e475aee20d983ed681b877abe43f852bbca","observation_id":"d8f42cc5-76a6-41ed-ba1f-4fec4504961e","resolution":{"observed_at":"2026-08-15T17:59:10.968839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.950924Z","title":"An exponential learning rate schedule for deep learning","venue":null,"work_id":"0ba9bd30-9f71-48af-a90b-3b8aef5ca75b","year":2020},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.349304Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:d2c870dc2559bb05ee61fc727eda9c99539f964e42d51b24ba88c2b7cacec7a1","observation_id":"8c0cf492-03d2-4990-b1a7-3629ed7108d7","resolution":{"observed_at":"2026-08-15T17:59:10.956588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18762","last_updated":"2024-02-29T00:02:33Z","snapshot_observed_at":"2026-08-20T12:19:12.215906Z","submitted_at":"2024-02-29T00:02:33Z","title":"Disentangling the Causes of Plasticity Loss in Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18762","snapshot_observed_at":"2026-08-15T17:59:10.354242Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.354242Z"},"links":{"cited_paper":"/paper/2402.18762","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:de0af3c7829db2e49143bd86d4a253bee3b25bd2c8a804ffb23175412f2ae4f2","observation_id":"16dde9bc-2408-4715-b719-5b47ac63b3c6","resolution":{"observed_at":"2026-08-15T17:59:10.354242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05217","last_updated":"2023-10-19T21:25:32Z","snapshot_observed_at":"2026-08-02T10:20:00.635719Z","submitted_at":"2023-01-12T18:56:49Z","title":"Progress measures for grokking via mechanistic interpretability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05217","snapshot_observed_at":"2026-08-15T17:59:10.359160Z","title":"Progress measures for grokking via mechanistic interpretability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.359160Z"},"links":{"cited_paper":"/paper/2301.05217","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:a43d5173765b2c6b4a227b897378ef3f12a4f108f587c7c33053c28348ac1ba5","observation_id":"b146f3d7-a4dc-443f-91cd-fbf5a2c14fd1","resolution":{"observed_at":"2026-08-15T17:59:10.359160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.919803Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":"b7122368-82c6-4c16-8b62-6a2b12fb97ad","year":2017},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.374235Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:11dc3bda70aa19848db535f3126c7348d809c032938a715e1b58e61d39a13737","observation_id":"d8c28d6f-f892-471e-aba1-994cd6ea9756","resolution":{"observed_at":"2026-08-15T17:59:10.924145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07301","last_updated":"2020-04-18T21:06:06Z","snapshot_observed_at":"2026-08-19T01:28:53.957925Z","submitted_at":"2020-01-21T01:02:21Z","title":"On the infinite width limit of neural networks with a standard parameterization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07301","snapshot_observed_at":"2026-08-15T17:59:10.379132Z","title":"On the infinite width limit of neural networks with a standard parameterization","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.379132Z"},"links":{"cited_paper":"/paper/2001.07301","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:08b15793c4404cfb491ded51b97e17d85084940bbede92d2d0bbacb69bfa7a0b","observation_id":"6296aa7e-7ab0-4bf5-948a-3493b1eb89bd","resolution":{"observed_at":"2026-08-15T17:59:10.379132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.906220Z","title":"Susskind","venue":null,"work_id":"5e47aed7-dd40-46dd-b109-43cbf2abd2cf","year":2022},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.383781Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:3b2a4388e2b4d535efef034274be170b55b8e9d22a7eca231b9976176701f1fa","observation_id":"d1ef3a8a-7be3-4aef-8eb8-f0d4e38c79ec","resolution":{"observed_at":"2026-08-15T17:59:10.910375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-18T08:00:35.342323Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-15T17:59:10.388260Z","title":"Hado Van Hasselt, Yotam Doron, Florian Strub, Matteo Hessel, Nicolas Sonnerat, and Joseph Modayil","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.388260Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:f17c66e8a99cc268a5cb830418c9d01ed3a9523b4902bd15b1bde446b7db26d1","observation_id":"3fffa72d-907f-408b-b12a-e2e11041e324","resolution":{"observed_at":"2026-08-15T17:59:10.388260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02390","last_updated":"2023-09-05T17:00:24Z","snapshot_observed_at":"2026-08-16T15:03:06.920972Z","submitted_at":"2023-09-05T17:00:24Z","title":"Explaining grokking through circuit efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02390","snapshot_observed_at":"2026-08-15T17:59:10.393060Z","title":"Explaining grokking through circuit efficiency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.393060Z"},"links":{"cited_paper":"/paper/2309.02390","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:9c7ecf061c194be2c73d5060db5134054c6d5c188c538ddec9d5088ca0a4bb36","observation_id":"02155c98-8f02-46db-a674-054dc9e7c979","resolution":{"observed_at":"2026-08-15T17:59:10.393060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-08-16T14:57:46.398467Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-15T17:59:10.398905Z","title":"Small-scale proxies for large-scale transformer training instabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.398905Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:9e6611b955b4e94de025a76d2387a4c200fa6c27eaca1acd544648b38c34319c","observation_id":"08ce421a-91b0-482a-bcce-9c909a8c2ec1","resolution":{"observed_at":"2026-08-15T17:59:10.398905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.892803Z","title":"Wide feedforward or recurrent neural networks of any architecture are gaussian processes","venue":null,"work_id":"9eaf340f-334d-4c46-a098-9da6aa36fd45","year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.404208Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:d601c7dad120d67639a2e0169b7c949f127704cf7c748650e3bbab6baba57c0b","observation_id":"906f71b4-4a82-43e3-a8d2-dd814fdffe8e","resolution":{"observed_at":"2026-08-15T17:59:10.897574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.877176Z","title":null,"venue":null,"work_id":"631c9feb-0cd8-4b16-9be3-330d1ae2a0ef","year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.414018Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:5ae7322b35dd3a4899c0c414320d64e40b814b0b1899b5058f56d3684ab90554","observation_id":"1047ff90-9f4a-4071-b21a-0992968c40b8","resolution":{"observed_at":"2026-08-15T17:59:10.881650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.847140Z","title":null,"venue":null,"work_id":"b67ac85b-1284-4cd0-b450-2625ac75bc02","year":2024},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.424203Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:ca272fd5b906feea92c8817e16651255eb65ad8fbd96fe590fb7cb2dae6dc820","observation_id":"b8b0d6d6-9114-441b-94a5-d3018f54b6be","resolution":{"observed_at":"2026-08-15T17:59:10.852763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00042","last_updated":"2023-10-14T11:58:06Z","snapshot_observed_at":"2026-08-16T18:20:45.624911Z","submitted_at":"2021-05-31T18:21:06Z","title":"A study on the plasticity of neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.00042","snapshot_observed_at":"2026-08-15T17:59:10.297015Z","title":"A study on the plasticity of neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.297015Z"},"links":{"cited_paper":"/paper/2106.00042","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:9ad06157dd2fc0a220fc8af1729b8f53560283e511f421779c2ad9d2e717168e","observation_id":"13248f8d-f4d2-443d-9996-0fa5537002ea","resolution":{"observed_at":"2026-08-15T17:59:10.297015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.978456Z","title":"Early stopping in deep networks: Double descent and how to eliminate it","venue":null,"work_id":"c4a68982-8f6b-4942-99c8-4bbaed3256a9","year":2025},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.323206Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:0c962380b2d0a235926caaca175445ad4700fc0c226ad2a7a2bc61bada6e851a","observation_id":"22351bf8-d39f-499c-9a2d-8a3492c02aef","resolution":{"observed_at":"2026-08-15T17:59:10.982639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-18T12:23:06.967499Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-15T17:59:10.364239Z","title":"Alethea Power, Yuri Burda, Harri Edwards, Igor Babuschkin, and Vedant Misra","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.364239Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:3a993527cfaa52fd5caf550d8464596c4c511b108546fd7f46ca1a8b432b2721","observation_id":"f10a81b3-d873-4188-85fc-b4b62b004891","resolution":{"observed_at":"2026-08-15T17:59:10.364239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04860","last_updated":"2022-10-10T17:21:20Z","snapshot_observed_at":"2026-08-21T02:30:26.626313Z","submitted_at":"2022-10-10T17:21:20Z","title":"Second-order regression models exhibit progressive sharpening to the edge of stability","version":1},"cited_work":{"arxiv_id":"2210.04860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.04860","snapshot_observed_at":"2026-08-15T17:59:10.815505Z","title":"Second-order regression models exhibit progressive sharpening to the edge of stability","venue":"cs.LG","work_id":"800dc288-7cda-40a2-9337-3d0327ef8a00","year":2022},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.280478Z"},"links":{"cited_paper":"/paper/2210.04860","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:c6eaa59545eae38d520cf16d1758b4da3352bba71d0cdc8c3ca15439e062200b","observation_id":"c4ed09f4-f5bc-4d29-b807-e3b34f9ec5b0","resolution":{"observed_at":"2026-08-15T17:59:10.821562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11958","last_updated":"2024-10-24T23:03:41Z","snapshot_observed_at":"2026-08-16T15:06:27.811814Z","submitted_at":"2023-08-23T06:57:05Z","title":"Maintaining Plasticity in Continual Learning via Regenerative Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11958","snapshot_observed_at":"2026-08-15T17:59:10.328060Z","title":"Maintaining plasticity via regenerative regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.328060Z"},"links":{"cited_paper":"/paper/2308.11958","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:6914869086bdbeb4652f880e104bfe71fb15e12b6ab961735ecb3185c4e54519","observation_id":"838c3a9d-5e08-49ea-95ad-313b3546d625","resolution":{"observed_at":"2026-08-15T17:59:10.328060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-15T17:59:10.409472Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.409472Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:5570acc20559a57d7cf5594373542b4d7d16a2c69b08faeb209a1594eebc0c7e","observation_id":"a37ad0a8-7f91-4b32-8004-f57355b9e24e","resolution":{"observed_at":"2026-08-15T17:59:10.409472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11162","last_updated":"2022-07-18T20:57:25Z","snapshot_observed_at":"2026-08-21T11:51:46.315878Z","submitted_at":"2020-09-23T14:17:53Z","title":"Implicit Gradient Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11162","snapshot_observed_at":"2026-08-15T17:59:10.285588Z","title":"Implicit gradient regularization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.285588Z"},"links":{"cited_paper":"/paper/2009.11162","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:9744a28551edeb2bac568d9711a792faafca6490883a272a8b5d2aacd9b1f8b3","observation_id":"bb2fe723-d15c-4539-8965-aa09ce56a16a","resolution":{"observed_at":"2026-08-15T17:59:10.285588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-16T18:42:37.696014Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-15T17:59:10.303191Z","title":"Gradient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.303191Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:fb0f4038e6834ca148c0dc22e135b8dd6d20a617f3a34bd25434cfa7757a0fbd","observation_id":"7b8d9fe0-d696-4300-b765-3bd6a747fbb2","resolution":{"observed_at":"2026-08-15T17:59:10.303191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:59:10.933273Z","title":"On the interplay between stepsize tuning and progressive sharpening","venue":null,"work_id":"4c989600-6179-4dc9-a24a-396d7d8a3fda","year":2023},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.369129Z"},"links":{"citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:c845dd7a3071d6d47376f51adcb1971e4eb74cee19634c01e97060c59477430c","observation_id":"18ada590-9283-4b06-a50a-f6bf1017c784","resolution":{"observed_at":"2026-08-15T17:59:10.937999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08856","last_updated":"2019-02-25T11:08:56Z","snapshot_observed_at":"2026-08-17T03:04:27.775014Z","submitted_at":"2017-11-24T01:58:54Z","title":"Critical Learning Periods in Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08856","snapshot_observed_at":"2026-08-15T17:59:10.274377Z","title":"Critical learning periods in deep neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.274377Z"},"links":{"cited_paper":"/paper/1711.08856","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:a0d377aea940743ac8ae623b6154947848153f4cc77f7bdc3cf4ab6fb6f494af","observation_id":"5ed21da5-a930-4c5a-a6a4-f090cd75db1c","resolution":{"observed_at":"2026-08-15T17:59:10.274377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00246","last_updated":"2024-10-05T00:41:30Z","snapshot_observed_at":"2026-08-20T12:20:31.664954Z","submitted_at":"2023-11-30T23:24:45Z","title":"Directions of Curvature as an Explanation for Loss of Plasticity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00246","snapshot_observed_at":"2026-08-15T17:59:10.333300Z","title":"Alex Lewandowski, Haruto Tanaka, Dale Schuurmans, and Marlos C Machado","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.333300Z"},"links":{"cited_paper":"/paper/2312.00246","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:4d88b803b7efc0fc679004d9cfe690eee44df8f699069d9208ea9fea63110ed3","observation_id":"5533ea32-393c-4d80-8b1f-a1ab9b0a3c80","resolution":{"observed_at":"2026-08-15T17:59:10.333300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02218","last_updated":"2020-03-04T17:52:48Z","snapshot_observed_at":"2026-08-20T08:26:27.661356Z","submitted_at":"2020-03-04T17:52:48Z","title":"The large learning rate phase of deep learning: the catapult mechanism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02218","snapshot_observed_at":"2026-08-15T17:59:10.343791Z","title":"The large learning rate phase of deep learning: the catapult mechanism","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:59:10.343791Z"},"links":{"cited_paper":"/paper/2003.02218","citing_paper":"/paper/2507.20057"},"observation_digest":"sha256:0fedfefcd17ea99bff2700f9cfda08adae115cf9dc24b3a042259526e0e36727","observation_id":"bb9e2d4a-14b5-43f3-a56b-4156a41cbec7","resolution":{"observed_at":"2026-08-15T17:59:10.343791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20057","last_updated":"2025-07-26T20:51:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T08:01:27.112098Z","submitted_at":"2025-07-26T20:51:24Z","title":"What Can Grokking Teach Us About Learning Under Nonstationarity?"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2507.20057."}