{"as_of":"2026-08-19T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3069ee069a006084a5b4b4a4fa1f8f38e52c45bab2bfca42a4dc0c9d4c986fbf","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:16:45.002429Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.06772/citation-record","integrity":"/paper/2606.06772/integrity","json":"/paper/2606.06772/citation-record.json","paper":"/paper/2606.06772"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.183237Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.183237Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:6286807da545879ded5cde9efbe35ad1cfe8532683bd11820e3e6a06b15d4d1f","observation_id":"46861ce3-8316-4f9d-b552-4f45e5b6af44","resolution":{"observed_at":"2026-08-02T12:16:40.183237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.256831Z","title":"Fine-grained analysis of optimization and generalization for overparameterized two-layer neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.256831Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:d6b1109c2009c89402d3b8170d12b8b48bc7143a64833ce47fc6819f4e92f92a","observation_id":"eb492a96-147e-4c71-8017-9b8ca25ead31","resolution":{"observed_at":"2026-08-02T12:16:40.256831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.337823Z","title":"Spectrally-normalized margin bounds for neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.337823Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:24c7d03ea3b87279a05b7e9561f91ab714ad8e2e4b430592db0ba158a4a3e03e","observation_id":"5db38bcb-c9cb-4a37-b855-fae07f2aadbd","resolution":{"observed_at":"2026-08-02T12:16:40.337823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.401888Z","title":"Convergence rates for shallow neural networks learned by gradient descent.Bernoulli, 30(1):475–502, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.401888Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:180047282c6d0543ed207bc4d4304121a30021d54c6d2a2e3950e971fc8bdd7d","observation_id":"b544511b-b5a9-4d9d-8b9f-9f7f2512e694","resolution":{"observed_at":"2026-08-02T12:16:40.401888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07670","last_updated":"2024-07-10T13:58:57Z","snapshot_observed_at":"2026-08-17T22:43:27.035420Z","submitted_at":"2024-07-10T13:58:57Z","title":"Stochastic Gradient Descent for Two-layer Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07670","snapshot_observed_at":"2026-08-02T12:16:40.496271Z","title":"Stochastic gradient descent for two-layer neural networks.arXiv preprint arXiv:2407.07670, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.496271Z"},"links":{"cited_paper":"/paper/2407.07670","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:f7eb85c3b6e8f43e4f77ecdfe62c0122187b93db062235259b53b23b1c933420","observation_id":"e5a41aae-215a-4c0f-b9ed-ba1bd8ba6ba3","resolution":{"observed_at":"2026-08-02T12:16:40.496271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.594800Z","title":"Generalization bounds of stochastic gradient descent for wide and deep neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.594800Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:c15116ac29a1a7ef11da9fbfb9e997271446180a6886beadf0d300240845aad6","observation_id":"7c7a10a3-70f3-4dfd-8b82-ac61af6ea00f","resolution":{"observed_at":"2026-08-02T12:16:40.594800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.659846Z","title":"Generalization error bounds of gradient descent for learning over-parameterized deep relu networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.659846Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:a5083da6e3db1f9f250354b68887a66ced8d970fdfb26f746081dc760d5fd9ad","observation_id":"2c5b97eb-c0b0-48cf-836a-e600d65fcca9","resolution":{"observed_at":"2026-08-02T12:16:40.659846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.725923Z","title":"Optimal rates for the regularized least-squares algorithm.Foundations of Computational Mathematics, 7(3):331–368, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.725923Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:6471857094e067b1fb6cecab1e39866d802009ac4d9551a888434dd25ffd7032","observation_id":"acfe2783-1236-4cbe-95cf-52467d603cae","resolution":{"observed_at":"2026-08-02T12:16:40.725923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.803506Z","title":"Learning with sgd and random features","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.803506Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:bec6aa5878e163173108b2d60f9d75fcf11b455957036b1b027ec81a10fb5d59","observation_id":"b6acc6e6-6cfc-4f73-aa2c-3134e357bb6b","resolution":{"observed_at":"2026-08-02T12:16:40.803506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.876677Z","title":"How much over-parameterization is sufficient to learn deep relu networks? InInternational Conference on Learning Representation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.876677Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:b750f5f54e87d82d3edd0b175c0728193b71223cbd209ba514c1e5d8554d5b9d","observation_id":"0e5c01a0-d39a-497f-a4bc-38d5b292c991","resolution":{"observed_at":"2026-08-02T12:16:40.876677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:40.967173Z","title":"Cambridge University Press, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:40.967173Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:19b85b69b481e9c34839e609d3cff9363e4c1b4bc24042e359d8cb0759cc2c62","observation_id":"c4b2b81a-428b-4976-a505-9f21852e4536","resolution":{"observed_at":"2026-08-02T12:16:40.967173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.032602Z","title":"Nonparametric stochastic approximation with large step-sizes.Annals of Statistics, 44(4):1363–1399, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.032602Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:3667d25fdb0d95b3e5066432e507f48a8d90aa19515659404aa5a734a9c785f5","observation_id":"2fdffdd1-82fc-4e57-bbb9-e5f9d0de72ad","resolution":{"observed_at":"2026-08-02T12:16:41.032602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14609","last_updated":"2023-11-24T17:04:21Z","snapshot_observed_at":"2026-08-16T14:40:36.175564Z","submitted_at":"2023-11-24T17:04:21Z","title":"Analysis of the expected $L_2$ error of an over-parametrized deep neural network estimate learned by gradient descent without regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14609","snapshot_observed_at":"2026-08-02T12:16:41.098670Z","title":"Analysis of the expected l 2 error of an over-parametrized deep neural network estimate learned by gradient descent without regularization.arXiv preprint arXiv:2311.14609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.098670Z"},"links":{"cited_paper":"/paper/2311.14609","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:008572cfcb054c849be47d3f0aecf04ca1b123de3310e607cc2242885ab68ab1","observation_id":"9beb56a9-124e-4ed4-bbec-9b7f6f844e6a","resolution":{"observed_at":"2026-08-02T12:16:41.098670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.186258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.186258Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:b97021a0137e65f8022310db532c548a7555919dc6953c2e93b0654eee0985ed","observation_id":"585e5793-66aa-403e-a410-09ccc14e6a93","resolution":{"observed_at":"2026-08-02T12:16:41.186258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.302270Z","title":"Gradient descent finds global minima of deep neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.302270Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:b7779701a13a739232631828738218ba38690f183ab90321b9722ae6326371c0","observation_id":"1e11952b-ee55-4542-ae81-d19a6e11d58a","resolution":{"observed_at":"2026-08-02T12:16:41.302270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.411355Z","title":"Random feature amplification: Feature learning and generalization in neural networks.Journal of Machine Learning Research, 24(303):1–49, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.411355Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:59a0ab2dcb61d5393f10e35ba4a269c63802ca1f1ffa126f850684d7a8916078","observation_id":"8cfc328c-d2f9-4897-8122-37587b969b79","resolution":{"observed_at":"2026-08-02T12:16:41.411355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.419101Z","title":"Size-independent sample complexity of neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.419101Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:be6b358257a0ac226350fcdde9cd592f1af4d03b9e9a7e58beecff63bd0c976a","observation_id":"e876f47d-4a20-4ed0-b319-dee33b4c403f","resolution":{"observed_at":"2026-08-02T12:16:41.419101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.439143Z","title":"Springer Science & Business Media, 2006","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.439143Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:a398d8539a2d4108ebfce74dc7b8bc1a473b80cedf4ef71908f5d9e1d8fe9c0c","observation_id":"a3853bf1-14b6-4dfd-af6a-91cb40ed6286","resolution":{"observed_at":"2026-08-02T12:16:41.439143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.547182Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.547182Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:4aa649a0adc17a3397bcaf5e0a2bcbedf4a7e42d6c9cc2fdb5f5281488a90c08","observation_id":"ce3e4bc1-283d-459d-84a5-dfdc97394662","resolution":{"observed_at":"2026-08-02T12:16:41.547182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.635021Z","title":"Neural tangent kernel: Convergence and generalization in neural networks.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.635021Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:6d9a2d9dbd42e998f09cc786fc9e23b5408870a934c5fd949a502bd89bac6719","observation_id":"b1d88c65-2198-4b4f-abff-9ce0c099470b","resolution":{"observed_at":"2026-08-02T12:16:41.635021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.710849Z","title":"Polylogarithmic width suffices for gradient descent to achieve arbitrarily small test error with shallow relu networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.710849Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:cf765b602a660cf8b19931d777118d18826bf322848fd7e6ccd88c8e550b131e","observation_id":"c5c6689f-cdf6-4872-9921-8b3f1f8153cc","resolution":{"observed_at":"2026-08-02T12:16:41.710849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03405","last_updated":"2025-04-04T12:28:54Z","snapshot_observed_at":"2026-08-16T12:43:57.755586Z","submitted_at":"2025-04-04T12:28:54Z","title":"On the rate of convergence of an over-parametrized deep neural network regression estimate learned by gradient descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03405","snapshot_observed_at":"2026-08-02T12:16:41.764520Z","title":"On the rate of convergence of an over-parametrized deep neural network regression estimate learned by gradient descent.arXiv preprint arXiv:2504.03405, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.764520Z"},"links":{"cited_paper":"/paper/2504.03405","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:2fda62a50709c28d5679c3d018895bbda510f9dc90844972627ad79637c380f9","observation_id":"fef885de-6f29-475f-bb0d-e73c3655137d","resolution":{"observed_at":"2026-08-02T12:16:41.764520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13848","last_updated":"2023-04-06T15:01:30Z","snapshot_observed_at":"2026-08-18T22:43:33.094724Z","submitted_at":"2022-12-28T14:56:27Z","title":"Learning Lipschitz Functions by GD-trained Shallow Overparameterized ReLU Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13848","snapshot_observed_at":"2026-08-02T12:16:41.849878Z","title":"Learning lipschitz functions by gd-trained shallow overparameterized relu neural networks.arXiv preprint arXiv:2212.13848, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.849878Z"},"links":{"cited_paper":"/paper/2212.13848","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:426c33e6705ce096e07ed2ff314ab9ebbc58b44970eb7d631da669b0ec6a2457","observation_id":"e40ac79f-6146-4b2a-aa52-997e17d81182","resolution":{"observed_at":"2026-08-02T12:16:41.849878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:41.925928Z","title":"Stability and generalization analysis of gradient methods for shallow neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:41.925928Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:f7ed303d6581493bce53804c50a0e304a6ed5f2b87c1072988daa693de150605","observation_id":"1d027d6a-8464-48ae-965d-72c0df04c605","resolution":{"observed_at":"2026-08-02T12:16:41.925928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.003793Z","title":"Optimization and generalization of gradient descent for shallow ReLU networks with minimal width.Journal of Machine Learning Research, 27(34):1–35, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.003793Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:69ff69c159a6d5ea4c055439de113fe010a776ba6451412865969011c7fe75fc","observation_id":"c8172789-747d-45cd-bd83-353959d5257d","resolution":{"observed_at":"2026-08-02T12:16:42.003793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.070062Z","title":"Optimal rates for generalization of gradient descent for deep relu classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.070062Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:a4f94782e9bc2954fedfe733e1d38de63a526bbdf1866df65849aa169b0c0068","observation_id":"b427a89c-a4a6-4371-85a9-961882bebc09","resolution":{"observed_at":"2026-08-02T12:16:42.070062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.169768Z","title":"Learning overparameterized neural networks via stochastic gradient descent on structured data","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.169768Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:a72ec775b8d750075b3da89b0b7ef5aa693e2234fadc9fa29935f711b13c33cf","observation_id":"b399d351-91e6-46b4-b855-ca1fe235b8a1","resolution":{"observed_at":"2026-08-02T12:16:42.169768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.269086Z","title":"Optimal rates for multi-pass stochastic gradient methods.Journal of Machine Learning Research, 18(1):3375–3421, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.269086Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:ae329702444f6963835beaca4c57a2782e10b8a026f8c6d534b992cfb0076038","observation_id":"5baf53f0-844f-44fc-b0b9-f9560bcfd95d","resolution":{"observed_at":"2026-08-02T12:16:42.269086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.343829Z","title":"On the linearity of large non-linear models: when and why the tangent kernel is constant.Advances in Neural Information Processing Systems, 33:15954–15964, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.343829Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:56343159fbb332c2bbc4ab7e70ddfeda336a147eb008631e8d61e971a6000fc7","observation_id":"299e5629-0821-4760-ab74-cd0dde57185b","resolution":{"observed_at":"2026-08-02T12:16:42.343829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.574038Z","title":"Norm-based capacity control in neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.574038Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:ae82f6810bf689f2ef7d0430066184b3d3ddcab13a28e3a38910863bf0b2e7d5","observation_id":"ca49886d-529d-45c9-9a06-bc4e860c7152","resolution":{"observed_at":"2026-08-02T12:16:42.574038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15434","last_updated":"2023-08-29T16:56:03Z","snapshot_observed_at":"2026-08-16T15:04:52.171420Z","submitted_at":"2023-08-29T16:56:03Z","title":"Random feature approximation for general spectral methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15434","snapshot_observed_at":"2026-08-02T12:16:42.648255Z","title":"Random feature approximation for general spectral methods.arXiv preprint arXiv:2308.15434, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.648255Z"},"links":{"cited_paper":"/paper/2308.15434","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:b376e9c6af33bd9343e791f588d5ee8ad68871b7e83d1c6db7ae63078dd4746d","observation_id":"046d72e2-9783-4af1-8bf2-caf656bd0e5a","resolution":{"observed_at":"2026-08-02T12:16:42.648255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:42.842162Z","title":"How many neurons do we need? a refined analysis for shallow networks trained with gradient descent.Journal of Statistical Planning and Inference, page 106169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.842162Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:48e51090589b69de8544248103344caffc4bf15fb4e06f2b65da0f17144500d4","observation_id":"319deed3-6fe3-428f-aff1-13b1a9720e30","resolution":{"observed_at":"2026-08-02T12:16:42.842162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09870","last_updated":"2020-03-18T13:59:10Z","snapshot_observed_at":"2026-08-14T16:27:35.130676Z","submitted_at":"2019-05-23T18:57:35Z","title":"Gradient Descent can Learn Less Over-parameterized Two-layer Neural Networks on Classification Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09870","snapshot_observed_at":"2026-08-02T12:16:42.973908Z","title":"Gradient descent can learn less over-parameterized two-layer neural networks on classification problems.arXiv preprint arXiv:1905.09870, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:42.973908Z"},"links":{"cited_paper":"/paper/1905.09870","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:67cc43c0786514550c2b29440b0562b2ddc907bb3eb6eb0ad9af2f2a2073914d","observation_id":"f14d8b6b-c8eb-44e2-8ba6-cfc0d304c6f9","resolution":{"observed_at":"2026-08-02T12:16:42.973908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.048281Z","title":"Optimal rates for averaged stochastic gradient descent under neural tangent kernel regime","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.048281Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:c7740f459fe92a1903f1e6f8da9cec77d6d29351e5485ad71570377e5ccefb81","observation_id":"f0ee101a-477d-4399-b8f3-d1ebe77c9563","resolution":{"observed_at":"2026-08-02T12:16:43.048281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.104358Z","title":"Near-minimax optimal estimation with shallow relu neural networks.IEEE Transactions on Information Theory, 69(2):1125–1140, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.104358Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:c1622931d6bf9705a829d6f85f0c23cd1dc3125611de4512c6fc37e4ab2e64f9","observation_id":"82cdcec2-7303-4000-9448-1b9afdb7365d","resolution":{"observed_at":"2026-08-02T12:16:43.104358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.219795Z","title":"Weighted sums of random kitchen sinks: Replacing minimization with random- ization in learning.Advances in Neural Information Processing Systems, 21, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.219795Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:8ea1835b57c691c2ada3c36974c8aec4f6cd9b9c72a98766a7d647f9aec2dfb7","observation_id":"d53033b3-6327-409c-a876-424e4ef2b89b","resolution":{"observed_at":"2026-08-02T12:16:43.219795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-02T12:16:43.332498Z","title":"Searching for activation functions.arXiv preprint arXiv:1710.05941, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.332498Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:3dc40c268fa74e57ad2304950185893a5ec89d4b44a12b0b5c3f80a9a06a6dc1","observation_id":"9af75af2-72d0-4376-a3aa-25c8e60e56b7","resolution":{"observed_at":"2026-08-02T12:16:43.332498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.424537Z","title":"Stability & generalisation of gradient descent for shallow neural networks without the neural tangent kernel","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.424537Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:a14170b65c9824d85804388a7630afd1db349d4d3fafbaab263b98cbfc69d4e8","observation_id":"61750015-719f-4098-aaa0-541dbacf7375","resolution":{"observed_at":"2026-08-02T12:16:43.424537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.576741Z","title":"Springer Science & Business Media, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.576741Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:5a9656544467f939983b7368f9def4c4e03a8c77f184cfa186e074453fe44166","observation_id":"a1c0171e-1882-441a-84f7-b7c8994e6b72","resolution":{"observed_at":"2026-08-02T12:16:43.576741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.680524Z","title":"Generalization and stability of interpolating neural networks with minimal width.Journal of Machine Learning Research, 25(156):1–41, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.680524Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:8066398e3d1eb3064210b552efd075f7f30bb905e1e2557fc892f0c4a05df24b","observation_id":"0f661f08-e358-4d5b-aa11-f656006170bd","resolution":{"observed_at":"2026-08-02T12:16:43.680524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.824107Z","title":"Sharper guarantees for learning neural network classifiers with gradient methods, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.824107Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:c18e656f5d43c9f41796b8fff88bb3377306c324527a8061e2519d17e6a8bc70","observation_id":"2a749880-26d4-4cfe-81ff-a68e8cdbc3b4","resolution":{"observed_at":"2026-08-02T12:16:43.824107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:43.945052Z","title":"Cambridge university press, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:43.945052Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:57da3fb525e0dcd96676a1baffb65b7af4a500985df5c260b7c557cd9c5c4d87","observation_id":"076a1d6f-2328-4b00-901d-d52b835415c1","resolution":{"observed_at":"2026-08-02T12:16:43.945052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:44.084254Z","title":"Cambridge university press, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.084254Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:f2d0a0616044c79e51e60676c2abd85b8b6f6f28d8e30c188dfc8ff8e628a1ce","observation_id":"19b07b83-10f3-407c-a37e-2b46e3462c4a","resolution":{"observed_at":"2026-08-02T12:16:44.084254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:44.187228Z","title":"Generalization guarantees of gradient descent for shallow neural networks.Neural Computation, 37(2):344–402, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.187228Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:d2946eca6830c84203481f833dadf29413bdb1150414cbbc88502c836f3376f0","observation_id":"7239a9fa-7c11-426d-81af-3bb2967b83ae","resolution":{"observed_at":"2026-08-02T12:16:44.187228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12648","last_updated":"2026-05-12T18:44:47Z","snapshot_observed_at":"2026-08-14T09:44:23.904301Z","submitted_at":"2026-05-12T18:44:47Z","title":"Population Risk Bounds for Kolmogorov-Arnold Networks Trained by DP-SGD with Correlated Noise","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12648","snapshot_observed_at":"2026-08-02T12:16:44.264407Z","title":"Population risk bounds for kolmogorov-arnold networks trained by dp-sgd with correlated noise.arXiv preprint arXiv:2605.12648, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.264407Z"},"links":{"cited_paper":"/paper/2605.12648","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:d0487a6e3f1320106db690a0e7d933fe1555657babacc4ebddd12810ed375737","observation_id":"9e3af01a-01a2-472a-a250-691a01565b73","resolution":{"observed_at":"2026-08-02T12:16:44.264407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22409","last_updated":"2026-05-12T23:48:38Z","snapshot_observed_at":"2026-08-13T07:26:50.173990Z","submitted_at":"2026-01-29T23:43:26Z","title":"Optimization, Generalization and Differential Privacy Bounds for Gradient Descent on Kolmogorov-Arnold Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22409","snapshot_observed_at":"2026-08-02T12:16:44.426478Z","title":"Optimization, generalization and differential privacy bounds for gradient descent on kolmogorov-arnold networks.arXiv preprint arXiv:2601.22409, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.426478Z"},"links":{"cited_paper":"/paper/2601.22409","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:3a068cf01e6184c4ca7631c4a8781b759192835e4a4e4e19352ee70c3d1074b8","observation_id":"c1567103-02cb-460b-a37d-a13222c32d1a","resolution":{"observed_at":"2026-08-02T12:16:44.426478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:44.584752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.584752Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:24b7bb390db50ebe047be792a3d7ef13b9d414629ac12cfae0006b0f8b92085c","observation_id":"706e4076-2479-4362-a672-143a68964aec","resolution":{"observed_at":"2026-08-02T12:16:44.584752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:44.693702Z","title":"Learning bounds for kernel regression using effective data dimensionality.Neural computation, 17(9):2077–2098, 2005","venue":null,"work_id":null,"year":2077},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.693702Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:c04fa7452e994ca6b42bff9937762cd49cc282f5260a950bd4ec1c945e635bf0","observation_id":"de22d84f-9daf-4271-bf36-b230ddf6756f","resolution":{"observed_at":"2026-08-02T12:16:44.693702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08888","last_updated":"2018-12-27T18:57:43Z","snapshot_observed_at":"2026-08-14T17:55:27.705967Z","submitted_at":"2018-11-21T18:58:46Z","title":"Stochastic Gradient Descent Optimizes Over-parameterized Deep ReLU Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08888","snapshot_observed_at":"2026-08-02T12:16:44.835136Z","title":"Generalization in Deep Neural Networks: Minimax Rates for Gradient Methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:44.835136Z"},"links":{"cited_paper":"/paper/1811.08888","citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:e74a2080f9b0c5af77ff3de502b984bfc9ac2ad15524c612ff787961dae6382a","observation_id":"c8d4b679-ad0a-4bfb-9242-6cf57697f373","resolution":{"observed_at":"2026-08-02T12:16:44.835136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:16:45.002429Z","title":"Their equation (47) is guaranteed by Lemma 18 with κ2 =∥K∥ ∞, Γ =n , δ=δ 2, ζi =K xi, Q= R X Kx ⊗K xdρx","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T12:16:45.002429Z"},"links":{"citing_paper":"/paper/2606.06772"},"observation_digest":"sha256:246d8f6748859a64c544180d91839cafc16169b296d776cc2633574e1672ce0d","observation_id":"e96c0f94-8b89-4aea-b143-92746457fe19","resolution":{"observed_at":"2026-08-02T12:16:45.002429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06772","last_updated":"2026-07-29T13:42:12Z","latest_version":2,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-12T19:49:05.420715Z","submitted_at":"2026-06-04T23:31:52Z","title":"Minimax-Optimal Generalization Bounds for Smooth Deep Neural Networks Trained by (Stochastic) Gradient Descent"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2606.06772."}