{"as_of":"2026-08-20T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:547322bc8795da6df8226704c9f279f08ae1558641e9b8b23454d6f9199193d1","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:50:30.424836Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T20:00:51.742281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:39.714874Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"cited_work":{"arxiv_id":"2504.17243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17243","snapshot_observed_at":"2026-07-01T09:45:39.714874Z","title":"arXiv preprint arXiv:2504.17243 , year=","venue":null,"work_id":"7195a509-fdee-4fd3-91a2-f8fcf2fc9193","year":null},"citing_paper":{"arxiv_id":"2606.32000","last_updated":"2026-06-30T17:34:13Z","snapshot_observed_at":"2026-08-01T16:19:28.283223Z","submitted_at":"2026-06-30T17:34:13Z","title":"Radial Suppression Accelerates Algorithmic Generalization: A Geometric Analysis of Delayed Generalization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T06:19:17.851285Z"},"links":{"cited_paper":"/paper/2504.17243","citing_paper":"/paper/2606.32000"},"observation_digest":"sha256:199b1616089ea32275479a9fdf896530126690b8b4fac7652af7872146ff1ef2","observation_id":"5550eed6-9c28-46d4-bc14-04ed34d5e09f","resolution":{"observed_at":"2026-07-01T09:45:39.716270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17243","snapshot_observed_at":"2026-07-11T20:00:51.742281Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04333","last_updated":"2026-07-14T13:00:28Z","snapshot_observed_at":"2026-08-19T10:20:43.151745Z","submitted_at":"2026-07-05T14:32:26Z","title":"Structure-Specific Representational Priors Causally Control the Grokking Delay","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T20:00:51.742281Z"},"links":{"cited_paper":"/paper/2504.17243","citing_paper":"/paper/2607.04333"},"observation_digest":"sha256:a215bf1345eeeae60194890dbe7402b5a241818473aee228892b30e1492e050a","observation_id":"0194a570-693d-4131-8907-4b5885e01a2e","resolution":{"observed_at":"2026-07-11T20:00:51.742281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17243/citation-record","integrity":"/paper/2504.17243/integrity","json":"/paper/2504.17243/citation-record.json","paper":"/paper/2504.17243"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-08-14T20:09:04.632955Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-16T10:50:30.320145Z","title":"Deep learning using rectified linear units (relu), 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.320145Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:d78eb1cab9fcc77656890e9933b1298036c42c92285df4728f7d2127992c3ab1","observation_id":"1ef8422a-c3ad-476c-8d7b-9340e0b62a94","resolution":{"observed_at":"2026-08-16T10:50:30.320145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06173","last_updated":"2023-03-10T19:16:53Z","snapshot_observed_at":"2026-08-16T15:49:07.982971Z","submitted_at":"2023-03-10T19:16:53Z","title":"Unifying Grokking and Double Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06173","snapshot_observed_at":"2026-08-16T10:50:30.325408Z","title":"Unifying grokking and double descent, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.325408Z"},"links":{"cited_paper":"/paper/2303.06173","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:7faf693f40cc61861a082b6376d2a8e7db826743cbe6d3027bb42c016d134a58","observation_id":"2894da2d-6228-4966-96fd-37d489dcf9c7","resolution":{"observed_at":"2026-08-16T10:50:30.325408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09810","last_updated":"2025-08-21T12:59:05Z","snapshot_observed_at":"2026-08-16T23:34:33.989143Z","submitted_at":"2024-12-13T02:57:59Z","title":"The Complexity Dynamics of Grokking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09810","snapshot_observed_at":"2026-08-16T10:50:30.330031Z","title":"The complexity dynamics of grokking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.330031Z"},"links":{"cited_paper":"/paper/2412.09810","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:4668f818c070a023bd715375543d185db1dd98a0d89408bd1c4211be0e07bbe8","observation_id":"06225137-1a24-4b5e-8e9b-66396ee83cb4","resolution":{"observed_at":"2026-08-16T10:50:30.330031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19454","last_updated":"2024-05-29T19:05:11Z","snapshot_observed_at":"2026-08-20T09:39:43.927487Z","submitted_at":"2024-05-29T19:05:11Z","title":"Deep Grokking: Would Deep Neural Networks Generalize Better?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19454","snapshot_observed_at":"2026-08-16T10:50:30.334912Z","title":"Deep grokking: Would deep neural networks generalize better?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.334912Z"},"links":{"cited_paper":"/paper/2405.19454","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:2dfe0d79d4cccdc4c5c6d2be4af4c37324223e6867242640495562c7be6cb995","observation_id":"8e5c19ef-2f63-4f62-9fe3-0a609da03048","resolution":{"observed_at":"2026-08-16T10:50:30.334912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12755","last_updated":"2024-06-20T07:39:05Z","snapshot_observed_at":"2026-08-16T13:50:58.568428Z","submitted_at":"2024-05-21T13:06:41Z","title":"Progress Measures for Grokking on Real-world Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12755","snapshot_observed_at":"2026-08-16T10:50:30.339295Z","title":"Progress measures for grokking on real-world tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.339295Z"},"links":{"cited_paper":"/paper/2405.12755","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:1bf72112f40781b7ff9ebf21d56576b7a600814f9d9b5bb94c1b8da2a0c82308","observation_id":"3aababd0-630c-4d72-b746-3192979feaea","resolution":{"observed_at":"2026-08-16T10:50:30.339295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01240","last_updated":"2016-02-07T17:06:58Z","snapshot_observed_at":"2026-08-14T22:33:52.090275Z","submitted_at":"2015-09-03T19:53:40Z","title":"Train faster, generalize better: Stability of stochastic gradient descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01240","snapshot_observed_at":"2026-08-16T10:50:30.344488Z","title":"Train faster, generalize better: Stability of stochastic gradient descent, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.344488Z"},"links":{"cited_paper":"/paper/1509.01240","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:bf5974dcf1f46ca1b646f0f6441c93bceeef3325d3aaa5ff9c63fe26d9e25cd9","observation_id":"fa3da2f4-7051-4f3e-87da-9aa1a844ae0c","resolution":{"observed_at":"2026-08-16T10:50:30.344488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15555","last_updated":"2024-06-06T18:33:15Z","snapshot_observed_at":"2026-08-16T14:15:48.967034Z","submitted_at":"2024-02-23T18:59:31Z","title":"Deep Networks Always Grok and Here is Why","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15555","snapshot_observed_at":"2026-08-16T10:50:30.349783Z","title":"Deep networks always grok and here is why, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.349783Z"},"links":{"cited_paper":"/paper/2402.15555","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:0d46de2f809afa917f7e865fc0263c9a4384c6a1fb0f53b23f1450fc740b2765","observation_id":"c82fdf55-bd8b-4930-9ab6-0fac3db285e4","resolution":{"observed_at":"2026-08-16T10:50:30.349783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00169","last_updated":"2023-10-29T13:04:11Z","snapshot_observed_at":"2026-08-16T15:27:45.477974Z","submitted_at":"2023-05-31T20:28:13Z","title":"Inconsistency, Instability, and Generalization Gap of Deep Neural Network Training","version":2},"cited_work":{"arxiv_id":"2306.00169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00169","snapshot_observed_at":"2026-08-16T10:50:30.593869Z","title":"Inconsistency, Instability, and Generalization Gap of Deep Neural Network Training","venue":"cs.LG","work_id":"917b0daa-0f0d-49db-b0f8-64563dd54baa","year":2023},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.354299Z"},"links":{"cited_paper":"/paper/2306.00169","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:227e04baa5b30aafc9d1761ce643788c12606f536faa5ea3f119fd1837cf2297","observation_id":"e2c56c2b-68dd-4af2-87e3-99b5ebbeb47c","resolution":{"observed_at":"2026-08-16T10:50:30.599659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.358731Z","title":"A simple weight decay can improve generalization","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.358731Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:7c4f928be7548cea6c9e13f14ca628d22c5d969c70aa0a3558de5579fdeb4c0e","observation_id":"c4336675-f231-41b0-828a-f46151f1a563","resolution":{"observed_at":"2026-08-16T10:50:30.358731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06110","last_updated":"2024-04-11T16:15:34Z","snapshot_observed_at":"2026-08-16T14:53:41.050658Z","submitted_at":"2023-10-09T19:33:21Z","title":"Grokking as the Transition from Lazy to Rich Training Dynamics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06110","snapshot_observed_at":"2026-08-16T10:50:30.362787Z","title":"Gershman, and Cengiz Pehlevan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.362787Z"},"links":{"cited_paper":"/paper/2310.06110","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:136dea421c32c2ecc0fee603134229bc390c1c338c42389c2212dbd52965534d","observation_id":"0f685c04-ee4a-42b6-a3cc-f94b14cec4cc","resolution":{"observed_at":"2026-08-16T10:50:30.362787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20233","last_updated":"2024-06-05T15:12:00Z","snapshot_observed_at":"2026-08-16T13:47:40.572603Z","submitted_at":"2024-05-30T16:35:30Z","title":"Grokfast: Accelerated Grokking by Amplifying Slow Gradients","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20233","snapshot_observed_at":"2026-08-16T10:50:30.367287Z","title":"Grokfast: Accelerated grokking by amplifying slow gradients, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.367287Z"},"links":{"cited_paper":"/paper/2405.20233","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:c6d84265b69197b85f246492123c6f0927ac3e742bfdc9fc9fb9c1178c6dc258","observation_id":"49a37564-deed-4b6b-8aa2-e4482cc98c63","resolution":{"observed_at":"2026-08-16T10:50:30.367287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00621","last_updated":"2020-02-29T03:36:22Z","snapshot_observed_at":"2026-08-14T17:22:04.224739Z","submitted_at":"2019-02-02T02:15:25Z","title":"On Generalization Error Bounds of Noisy Gradient Methods for Non-Convex Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00621","snapshot_observed_at":"2026-08-16T10:50:30.371979Z","title":"On generalization error bounds of noisy gradient methods for non-convex learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.371979Z"},"links":{"cited_paper":"/paper/1902.00621","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:a3a9cc8b7adddcd8c38da9c6ec1ed718b166f050f72af84c685e53f91f1ef156","observation_id":"3ba54ceb-5796-4476-bdac-096df0429550","resolution":{"observed_at":"2026-08-16T10:50:30.371979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10343","last_updated":"2022-10-14T17:39:04Z","snapshot_observed_at":"2026-08-19T00:14:29.038799Z","submitted_at":"2022-05-20T17:56:17Z","title":"Towards Understanding Grokking: An Effective Theory of Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10343","snapshot_observed_at":"2026-08-16T10:50:30.376358Z","title":"Michaud, Max Tegmark, and Mike Williams","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.376358Z"},"links":{"cited_paper":"/paper/2205.10343","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:aebc384f21cc38b997e366b0b4eedc4f16863ee5dfd401687196d69a8f4da160","observation_id":"6ecc05cc-2d49-4281-8a22-ac9c93a3be7a","resolution":{"observed_at":"2026-08-16T10:50:30.376358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01117","last_updated":"2023-03-23T13:42:27Z","snapshot_observed_at":"2026-08-19T22:36:28.346094Z","submitted_at":"2022-10-03T17:58:04Z","title":"Omnigrok: Grokking Beyond Algorithmic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01117","snapshot_observed_at":"2026-08-16T10:50:30.380861Z","title":"Michaud, and Max Tegmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.380861Z"},"links":{"cited_paper":"/paper/2210.01117","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:1996db8066436e420502be00271cd8422e3420b077df3e522f6792bbfb7b498e","observation_id":"3d850ad7-a127-4649-9f90-863539939a91","resolution":{"observed_at":"2026-08-16T10:50:30.380861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.738888Z","title":"Do machine learning models memorize or generalize?, 2023","venue":null,"work_id":"75ce5e4c-e625-4313-8eb6-eacba7f08e00","year":2023},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.385253Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:263f5ead4ac076ea235de87c251f8b1b133df21dc1b8671b0be0f790c8c59523","observation_id":"3b210549-0a7f-4c85-809d-6c93c51f74eb","resolution":{"observed_at":"2026-08-16T10:50:30.743796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-08-18T12:23:06.967499Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-16T10:50:30.389414Z","title":"Grokking: Generalization beyond overfitting on small algorithmic datasets","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.389414Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:bb8c57548567e9a457461dc0e1e687836792affc88a751a1ffd3b332e936839b","observation_id":"9456e08e-8bf4-4118-84c1-b6ca1f69e603","resolution":{"observed_at":"2026-08-16T10:50:30.389414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04697","last_updated":"2025-05-19T11:02:53Z","snapshot_observed_at":"2026-08-16T04:10:42.975530Z","submitted_at":"2025-01-08T18:58:48Z","title":"Grokking at the Edge of Numerical Stability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04697","snapshot_observed_at":"2026-08-16T10:50:30.393647Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.393647Z"},"links":{"cited_paper":"/paper/2501.04697","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:d52a6056574bd2727a7f328c3aeab7e29f968edee7043c8bf38f4665813e5ac1","observation_id":"95473366-ac30-4867-aca3-7b15c10b4c41","resolution":{"observed_at":"2026-08-16T10:50:30.393647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04817","last_updated":"2022-06-13T04:18:16Z","snapshot_observed_at":"2026-08-16T16:54:02.662840Z","submitted_at":"2022-06-10T00:04:21Z","title":"The Slingshot Mechanism: An Empirical Study of Adaptive Optimizers and the Grokking Phenomenon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04817","snapshot_observed_at":"2026-08-16T10:50:30.397978Z","title":"The slingshot mechanism: An empirical study of adaptive optimizers and the grokking phenomenon, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.397978Z"},"links":{"cited_paper":"/paper/2206.04817","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:dcf1e8cac0f1dfb1f91f804d352e36b4b75f170eb90280b3885c26484dabbf42","observation_id":"12990ba5-a444-4d69-a0f1-4c8376a8fab1","resolution":{"observed_at":"2026-08-16T10:50:30.397978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-19T04:42:40.974785Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T10:50:30.402216Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.402216Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:624d9629017c76e0bf53d5b95e6be4df0fceb4a33c4f985a0e6199903f22dcff","observation_id":"002877d8-4953-4b1d-a9bd-f4ab0dc32264","resolution":{"observed_at":"2026-08-16T10:50:30.402216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11152","last_updated":"2024-08-16T10:36:24Z","snapshot_observed_at":"2026-08-16T19:04:05.319667Z","submitted_at":"2020-11-23T00:39:49Z","title":"On the Overlooked Pitfalls of Weight Decay and How to Mitigate Them: A Gradient-Norm Perspective","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11152","snapshot_observed_at":"2026-08-16T10:50:30.406554Z","title":"On the overlooked pitfalls of weight decay and how to mitigate them: A gradient-norm perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.406554Z"},"links":{"cited_paper":"/paper/2011.11152","citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:376e9836b2e916e80ae463438b039c9f8e6cef337b2ca8ec37466e677bd5bfaa","observation_id":"6ec34062-5c3e-4833-9ccf-a5b4b663d8bc","resolution":{"observed_at":"2026-08-16T10:50:30.406554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.411104Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.411104Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:e21c538c9fbf499f3fffecd17f215d7630ff5f67dbd11290667e6593e02813c5","observation_id":"f7349a12-f4d1-4f4e-b089-69cc15ba1412","resolution":{"observed_at":"2026-08-16T10:50:30.411104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.416261Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.416261Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:cf2c587556a1191c028abe9691f579a5bb7cc6d74d8ea1eafb70d61c8933872c","observation_id":"d625316c-5a09-4820-aa67-c19e4b87901f","resolution":{"observed_at":"2026-08-16T10:50:30.416261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.420705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.420705Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:4dace12bfb663653c24aee65ed51cf834b4d1f4089cd994d6e9b33b54bb8e414","observation_id":"978e9e9f-7b6b-4e60-b905-d7d0f7374fe4","resolution":{"observed_at":"2026-08-16T10:50:30.420705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:50:30.700609Z","title":null,"venue":null,"work_id":"21fab220-43c8-4db5-9edc-4fc5bf433745","year":2025},"citing_paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:50:30.424836Z"},"links":{"citing_paper":"/paper/2504.17243"},"observation_digest":"sha256:3fdae5e128b4bb3fee5c8a77d9bab58ac4f088f3b75a6009dd8f7ae80d87b3d7","observation_id":"6eed8917-5811-4eac-8794-9f235b833cb6","resolution":{"observed_at":"2026-08-16T10:50:30.704725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17243","last_updated":"2025-04-25T03:44:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T09:35:53.453957Z","submitted_at":"2025-04-24T04:41:35Z","title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2504.17243."}