{"as_of":"2026-08-15T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b9644cf351abe42781d8b1af3c8aea73a727daf2496f09b0f90acfad0c44a0a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:02:29.815116Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.05660/citation-record","integrity":"/paper/1908.05660/integrity","json":"/paper/1908.05660/citation-record.json","paper":"/paper/1908.05660"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1811.04918","last_updated":"2020-06-01T17:11:51Z","snapshot_observed_at":"2026-08-14T18:00:26.812407Z","submitted_at":"2018-11-12T18:57:02Z","title":"Learning and Generalization in Overparameterized Neural Networks, Going Beyond Two Layers","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.04918","snapshot_observed_at":"2026-08-14T13:02:29.587575Z","title":"Learning and generalization in overparameterized neural networks, going beyond two layers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.587575Z"},"links":{"cited_paper":"/paper/1811.04918","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:33e410ab42275e3d94f92dc0d0da5c4a9a053bbd334a8ee09b71f56950279f93","observation_id":"d22457b3-f66b-417f-b8c2-2a4c51f9e0eb","resolution":{"observed_at":"2026-08-14T13:02:29.587575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.671773Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":"4fd08d3e-c5d2-44de-94e9-68ceec20caf1","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.592381Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:be19510598264cde293f40fe1d5f16757f2faa9d63200a5f7fb829c14b3353f4","observation_id":"0796061d-d5af-4a3a-b95c-8712d95d73b7","resolution":{"observed_at":"2026-08-14T13:02:30.675536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.660752Z","title":null,"venue":null,"work_id":"2f10598d-46f1-4d08-91ea-537bb4d2d26d","year":2014},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.596697Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:59c3dd31ae5acc0f60d0810ee36fe23d569f983f8354914f7c5b898a3ba69473","observation_id":"88ed8d7a-d248-4dce-9390-e52c430045f9","resolution":{"observed_at":"2026-08-14T13:02:30.664273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.648649Z","title":"A convergence analysis of gradient descent for deep linear neural networks","venue":null,"work_id":"ad16962f-d34f-42c6-99b6-b9c787b2a680","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.601823Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:296f63594975be234e0727695e7e4bc531f3d0962377a36ef968318033bc3a43","observation_id":"d01f8fbc-2a64-4645-a6ee-fbb016e62794","resolution":{"observed_at":"2026-08-14T13:02:30.653151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.635977Z","title":"On exact computation with an infinitely wide neural net","venue":null,"work_id":"c8cf21f1-cd56-4a44-95dd-c9214a0edcc6","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.606372Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:74826d6503ef3f71f541c8eace15c7e882fa905b664de784795a668b6dd27825","observation_id":"bbd2a9cd-2e55-4209-8396-3203f9ba7fc4","resolution":{"observed_at":"2026-08-14T13:02:30.639962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08584","last_updated":"2019-05-27T04:22:57Z","snapshot_observed_at":"2026-08-15T01:18:36.771990Z","submitted_at":"2019-01-24T18:58:16Z","title":"Fine-Grained Analysis of Optimization and Generalization for Overparameterized Two-Layer Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08584","snapshot_observed_at":"2026-08-14T13:02:29.610258Z","title":"Du, Wei Hu, Zhi yuan Li, and Ruosong Wang","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.610258Z"},"links":{"cited_paper":"/paper/1901.08584","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:8df26821133ad82420976d3c0780a4538cbee4c6049026a2b571328b51df0692","observation_id":"41d4f581-22a9-4e9a-b9f6-b81f1895f2fd","resolution":{"observed_at":"2026-08-14T13:02:29.610258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.614899Z","title":"Concentration inequalities","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.614899Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:90daa4c04587e42079810a42875bab0f5a318e37f0ebace86aa713f58d5f14db","observation_id":"a977d621-2fa3-4cd7-86dd-fde7045719aa","resolution":{"observed_at":"2026-08-14T13:02:29.614899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.622117Z","title":"Asymptotic coefficients of hermite function series","venue":null,"work_id":"ebf6ec7a-1fe4-4727-b907-80a7cbaf4ac8","year":1984},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.618526Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:e8a92d93bc8a7e7bf7f878d6823da29df2dd00744bbc90d292d4d8c11e10af90","observation_id":"473c82b4-ef97-4cda-bb08-5aadbffe8d1c","resolution":{"observed_at":"2026-08-14T13:02:30.626440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.609217Z","title":"SGD learns over-parameterized networks that provably generalize on linearly separable data","venue":null,"work_id":"5ccf7aec-4d1f-4f46-aa25-c76a48650346","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.622868Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:e99a076c8020ecd59e37f5a837271a9579012e1050b5ff4f4074f05592e8e993","observation_id":"95bb7ea3-0372-4bc8-872c-e42152073108","resolution":{"observed_at":"2026-08-14T13:02:30.614116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.627105Z","title":"Distributional and L^q norm inequalities for polynomials over convex bodies in R^n","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.627105Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:36327f35ef4cf96956b026f258b7a574756699d5a2ee5ed5f9b80cc41ca14008","observation_id":"8cda9d63-3689-40d3-9463-58843db6b613","resolution":{"observed_at":"2026-08-14T13:02:29.627105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.596684Z","title":"On the global convergence of gradient descent for over-parameterized models using optimal transport","venue":null,"work_id":"c919d079-3dca-4697-aa78-bf69a9912683","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.631066Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:a7716021d96c118e9f8f184f78679d1b27367c22a0ce13fc137816c51fbde4e9","observation_id":"6ae86047-14a5-40a2-8647-5a059f21f807","resolution":{"observed_at":"2026-08-14T13:02:30.601119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.578817Z","title":"Fast and accurate deep network learning by exponential linear units (elus)","venue":null,"work_id":"e4f8b231-2f5e-46f1-8da2-c249737cb7af","year":2016},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.634746Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:06a6a67425825aa45b0cb372f7772c18eb7484fe83fc9721e262dca4117ba5de","observation_id":"bf235733-c2c5-468d-831b-50db0b240d97","resolution":{"observed_at":"2026-08-14T13:02:30.584173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.562592Z","title":"Toward deeper understanding of neural networks: The power of initialization and a dual view on expressivity","venue":null,"work_id":"2282d772-1995-48d2-b7c9-810df27a6d2c","year":2016},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.638094Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:c0c75271ea5e513856ca4ea0face7b6b780d749c26e444e87d06af5371f76693","observation_id":"62fb232e-5c4b-4c0e-9936-e73091f79a7e","resolution":{"observed_at":"2026-08-14T13:02:30.567999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.546638Z","title":"Du and Jason D","venue":null,"work_id":"8040291c-45e9-4377-be08-f1e68345c6be","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.641969Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:af060c18fcb9e42e9c06ad9af7bf2f398148566319605b810e20e0d5d18379b3","observation_id":"c32f49e0-59e9-4f6b-b55d-5b1813df0b7d","resolution":{"observed_at":"2026-08-14T13:02:30.550892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.533945Z","title":"Du, Xiyu Zhai, Barnabas Poczos, and Aarti Singh","venue":null,"work_id":"fac7f09d-8ce3-4518-b9fe-ca3c34c0388a","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.645867Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:e2d3685a89125bb0f6a37fefd8d070b2c943f191afa5f511ae25eb2b2681bda0","observation_id":"728378ad-362e-40b3-bb80-45d1be067c6f","resolution":{"observed_at":"2026-08-14T13:02:30.537927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.520746Z","title":"Lee, Haochuan Li, Liwei Wang, and Xiyu Zhai","venue":null,"work_id":"3bd66857-32f9-43e0-9ec5-f14ef063aecf","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.649476Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:015a98a0b0c5a022554ba82274e38696f418acdfdc10c1262a449e5a44719f88","observation_id":"e8a1c651-dab7-4dde-8720-bb15a5b31098","resolution":{"observed_at":"2026-08-14T13:02:30.525088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.506794Z","title":"Is it time to swish? comparing deep learning activation functions across nlp tasks","venue":null,"work_id":"075353d4-4455-463e-bb25-f8d4f88b78c0","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.653571Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:b6bd2deaad72ec7e7a85e57de05cb4f2775024d40d84184632311d5592aef476","observation_id":"ee15d91c-5640-4181-aab7-69dbbaacacdf","resolution":{"observed_at":"2026-08-14T13:02:30.510910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03118","last_updated":"2017-11-02T02:48:38Z","snapshot_observed_at":"2026-08-14T21:17:04.486241Z","submitted_at":"2017-02-10T10:04:30Z","title":"Sigmoid-Weighted Linear Units for Neural Network Function Approximation in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03118","snapshot_observed_at":"2026-08-14T13:02:29.657503Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.657503Z"},"links":{"cited_paper":"/paper/1702.03118","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:ad8b0f3089d717e2e979a113c2fdf9d0b35b13f65368b44963e844c69f43ced8","observation_id":"e7162b87-7cf7-4096-a205-05798684dfba","resolution":{"observed_at":"2026-08-14T13:02:29.657503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.493220Z","title":"Understanding the difficulty of training deep feedforward neural networks","venue":null,"work_id":"bd93aa02-6bba-4b9f-9800-56389cae5539","year":2010},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.661789Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:5cbca865f44c6a9e78debf921ae260ef187b95c6eb007ecaf1db23f94a1985db","observation_id":"b8bb5666-685f-41fa-b4bd-c47d3d8ff356","resolution":{"observed_at":"2026-08-14T13:02:30.497518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.665347Z","title":"Deep Learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.665347Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:51e1651a3fdede89c94f6a3a5f1eb0f34bb52b118af5c27e21578d3198aa50f6","observation_id":"bc20cae9-8753-4204-9e71-0c855fc02680","resolution":{"observed_at":"2026-08-14T13:02:29.665347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.473789Z","title":"Which neural net architectures give rise to exploding and vanishing gradients? In S","venue":null,"work_id":"d3d0a460-a048-4644-a731-1324e4e8d9af","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.669198Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:b7d08c2b0ec291b31464d40733613bd00e6d7a653a122b8ac890979a80f893a3","observation_id":"66ed9f54-a98f-4ac1-abb9-23d5cec584c0","resolution":{"observed_at":"2026-08-14T13:02:30.477693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.457349Z","title":"How to start training: The effect of initialization and architecture","venue":null,"work_id":"b5016217-b1cc-423b-a6de-44184f252315","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.673319Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:b764c75732bf3f58115bd88cdc9630b38d7c297a1c2909bde13d269385561b12","observation_id":"58bd3d69-ab74-4cb2-8f20-7cf8a8988a3b","resolution":{"observed_at":"2026-08-14T13:02:30.462505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06853","last_updated":"2019-05-26T18:52:19Z","snapshot_observed_at":"2026-08-14T17:14:39.273767Z","submitted_at":"2019-02-19T00:50:19Z","title":"On the Impact of the Activation Function on Deep Neural Networks Training","version":2},"cited_work":{"arxiv_id":"1902.06853","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.06853","snapshot_observed_at":"2026-08-14T13:02:30.040554Z","title":"On the Impact of the Activation Function on Deep Neural Networks Training","venue":"stat.ML","work_id":"20fc72be-0f4e-4c6e-b6cb-b66d7cd84aa2","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.676820Z"},"links":{"cited_paper":"/paper/1902.06853","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:6d9d446c6ac9dfe8a1533c6bef8ee0244ce20b52a982e7d1820138dd8f978b11","observation_id":"78adc319-e1db-43bd-a83a-28dc61e6cf08","resolution":{"observed_at":"2026-08-14T13:02:30.045025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.681234Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.681234Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:460b00c097d57ee426247ace511b1e4f37293e43cbdc8ad543d8d7bd5f61c5eb","observation_id":"d274fad0-f25c-4e1b-8e7a-9ab01390d29a","resolution":{"observed_at":"2026-08-14T13:02:29.681234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/1990002","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.908485Z","title":"Contributions to the theory of H ermitian series","venue":null,"work_id":"26b65ba6-815c-4713-8423-747645227ecf","year":1940},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.685205Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:ff39eb5c5df38021926e508544aaa56135470884014d100f4f489ea992ab9f5b","observation_id":"1b197844-f1b4-41ad-8cf7-8cc7032b4c78","resolution":{"observed_at":"2026-08-14T13:02:29.913221Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.435519Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"a7f86816-fd13-452d-806b-06365c1fe59e","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.689628Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:32d1300de922425f4980b540cfe9dffe914431912d7e17dc53725332982519a7","observation_id":"faa498f1-1221-4fdc-b35d-736af877ffd2","resolution":{"observed_at":"2026-08-14T13:02:30.440746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.421140Z","title":"Solutions to some functional equations and their applications to characterization of probability distributions","venue":null,"work_id":"73190c29-0119-4ed5-82be-aeca21793b80","year":1968},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.693842Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:3fa1af7d778a3aa76b5ede81595b2e872240f78d3fc802c90e4577c75e158934","observation_id":"c1b5bad9-eb0e-4505-95c5-f0404cac7421","resolution":{"observed_at":"2026-08-14T13:02:30.426465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.405804Z","title":"On the expressive power of deep polynomial neural networks","venue":null,"work_id":"be61e37a-f6ee-4f94-b52d-b6ee0c31b18c","year":2019},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.697932Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:67ff973342c815d76d45df7dc2e678120e41445069bb6af7fbdbf35dbfa60549","observation_id":"fc10c694-2cfe-49f2-986a-c9807586c754","resolution":{"observed_at":"2026-08-14T13:02:30.410998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.392709Z","title":"Self-normalizing neural networks","venue":null,"work_id":"754986e7-bd0f-44d2-95f7-f5d9696562fa","year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.701260Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:635029575c00987ca7841d2e30e6389a211841a3aa8529e72009fc0dd0486230","observation_id":"ef3e5435-e305-4795-89a6-e00f2d09ef6f","resolution":{"observed_at":"2026-08-14T13:02:30.396988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.704274Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.704274Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:3a9ca2210a99b100d0706e0f86e58ec82ff9e962db961afc182826ab55e9de5c","observation_id":"f0032b5c-8fe3-4989-a7b4-ed6d4306d0ec","resolution":{"observed_at":"2026-08-14T13:02:29.704274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.371195Z","title":"Adaptive estimation of a quadratic functional by model selection","venue":null,"work_id":"b0c78d30-6cf0-4d47-afd2-a606eb604ff0","year":2000},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.707973Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:4af5222e307ab149b15d995ce2866610d56c13e4ecacbba0e5af63c4c44bae0a","observation_id":"58edd59d-c58a-4513-942a-5e39545a4906","resolution":{"observed_at":"2026-08-14T13:02:30.376053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.356480Z","title":null,"venue":null,"work_id":"b2bbb7b9-f5b3-4a55-a982-8deeb31190dd","year":1972},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.711672Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:15806ae8bdf43c228961f8f4abf7478e2bfa30217815b988370c35675f44e5d2","observation_id":"fea9840c-3e3a-4905-afcd-afc006ccb2ac","resolution":{"observed_at":"2026-08-14T13:02:30.361067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00165","last_updated":"2018-03-03T00:45:00Z","snapshot_observed_at":"2026-08-14T20:18:09.717440Z","submitted_at":"2017-11-01T02:13:25Z","title":"Deep Neural Networks as Gaussian Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00165","snapshot_observed_at":"2026-08-14T13:02:29.715502Z","title":"Deep neural networks as gaussian processes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.715502Z"},"links":{"cited_paper":"/paper/1711.00165","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:1a595931832423960c8314374db37679347365eea7b3447ea1f8b0859af232b2","observation_id":"ad4a556b-ed4f-487a-93d7-660fbd6f433c","resolution":{"observed_at":"2026-08-14T13:02:29.715502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.719277Z","title":"Lin, Allan Pinkus, and Shimon Schocken","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.719277Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:afdea0256d0c835eb62db8c477b89c9bdbf4035244fb6d34c6a61cd74e3123bd","observation_id":"c6f82c84-3aa6-4172-8069-409597f63f1f","resolution":{"observed_at":"2026-08-14T13:02:29.719277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.344512Z","title":"Learning overparameterized neural networks via stochastic gradient descent on structured data","venue":null,"work_id":"a683ffd7-5756-4691-86b2-2c18bf7cd3d8","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.723440Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:c6ecbaabecc349513c70ab7cd51e75a021f8fc02b647e665911679a418ec355f","observation_id":"702eaa01-e401-4819-b2ef-17a73968f821","resolution":{"observed_at":"2026-08-14T13:02:30.348543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.729066Z","title":"A random matrix approach to neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.729066Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:9090b10f563397c7444d0917e1f39114518e3e4394dba0af42b440d8dcc2526c","observation_id":"ea169329-dce7-4292-8b7e-0acd9018ec7f","resolution":{"observed_at":"2026-08-14T13:02:29.729066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.331094Z","title":"Mason and D.C","venue":null,"work_id":"4e07ded7-2e81-4fc8-8890-730afb5ab36a","year":2002},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.732757Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:44d39fb330c80656b533fd018c1a8fa6f8433c4f5dd3ee548e163aea06285796","observation_id":"c5b7705d-df9d-4c24-94a3-ed122f055a10","resolution":{"observed_at":"2026-08-14T13:02:30.336215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.736156Z","title":"A mean field view of the landscape of two-layer neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.736156Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:12b5b2bd46956d258597b49f104ff933f6290aa741a2d88b0e6515e98637ee96","observation_id":"b65ce0b7-cf44-45b1-a65e-33ee087de431","resolution":{"observed_at":"2026-08-14T13:02:29.736156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6614","last_updated":"2015-04-16T18:48:31Z","snapshot_observed_at":"2026-08-14T23:06:39.936635Z","submitted_at":"2014-12-20T06:52:25Z","title":"In Search of the Real Inductive Bias: On the Role of Implicit Regularization in Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6614","snapshot_observed_at":"2026-08-14T13:02:29.740335Z","title":"In search of the real inductive bias: On the role of implicit regularization in deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.740335Z"},"links":{"cited_paper":"/paper/1412.6614","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:bf0f8329c7e5d67246f90382c90c446d654ab1752a42fe3ca8f71f620b0e5102","observation_id":"9d82245d-47ec-4307-b77f-c0f7c09961f8","resolution":{"observed_at":"2026-08-14T13:02:29.740335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03378","last_updated":"2018-11-08T12:28:43Z","snapshot_observed_at":"2026-08-14T18:02:15.524668Z","submitted_at":"2018-11-08T12:28:43Z","title":"Activation Functions: Comparison of trends in Practice and Research for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03378","snapshot_observed_at":"2026-08-14T13:02:29.744348Z","title":"Activation functions: Comparison of trends in practice and research for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.744348Z"},"links":{"cited_paper":"/paper/1811.03378","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:33a809b4a8c14340dcf2c22c52dc111ae0669d8f0f7552e4918d1c21838fe0ce","observation_id":"14db2195-9b00-4e59-9094-354ddea74804","resolution":{"observed_at":"2026-08-14T13:02:29.744348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.318744Z","title":"Analysis of boolean functions","venue":null,"work_id":"4637b580-723f-491a-808d-6cc0edc79983","year":2014},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.749719Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:6a3201c38d949b33968e6fb780bc9e7a027bd0666cc41e00ea37cfaa8f33cc1c","observation_id":"092848dc-6bf1-4c10-af24-dabba027adb5","resolution":{"observed_at":"2026-08-14T13:02:30.322826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04674","last_updated":"2019-02-12T23:42:45Z","snapshot_observed_at":"2026-08-14T17:17:14.126944Z","submitted_at":"2019-02-12T23:42:45Z","title":"Towards moderate overparameterization: global convergence guarantees for training shallow neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04674","snapshot_observed_at":"2026-08-14T13:02:29.753639Z","title":"Towards moderate overparameterization: global convergence guarantees for training shallow neural networks","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.753639Z"},"links":{"cited_paper":"/paper/1902.04674","citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:edafb3b1431b278e1a808c66527051f8478f8bb772ea136fd7df4772a85d94b4","observation_id":"e26f7eb3-2f22-4f8e-8a25-243e52c7ee4b","resolution":{"observed_at":"2026-08-14T13:02:29.753639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.307639Z","title":"Nonlinear random matrix theory for deep learning","venue":null,"work_id":"1289387f-5d29-48e8-8aa3-e6f5cf7fdf4d","year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.757937Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:e4235f7286f552d29f0a8b583af7fd684e0ac0660fa938644993d9e4a919db4c","observation_id":"2448825e-dfc5-41e5-953f-6a2f54af1979","resolution":{"observed_at":"2026-08-14T13:02:30.311595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.294865Z","title":"The spectrum of the fisher information matrix of a single-hidden-layer neural network","venue":null,"work_id":"071c719d-6246-406c-8fe0-895de0c061a8","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.761350Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:a0f3b05d67d33077d558f6cabfbc250f81df1a79df9090ccaed38d06cfaf457d","observation_id":"043f1295-2966-4952-a5d0-453f68b089ce","resolution":{"observed_at":"2026-08-14T13:02:30.300185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.281172Z","title":"Resurrecting the sigmoid in deep learning through dynamical isometry: theory and practice","venue":null,"work_id":"999723f9-ce67-4fb1-8d68-9537c79b90f5","year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.764677Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:12034716eec02811dc8a47ee20beef622e008b7fca4eb2d5d5dfc6996bdd36ab","observation_id":"6e5a7a6c-6e89-46f2-91ff-ad4d46bb6d8d","resolution":{"observed_at":"2026-08-14T13:02:30.285600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.269000Z","title":"Schoenholz, and Surya Ganguli","venue":null,"work_id":"b10bb868-05a4-45d4-9200-262e48685f9e","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.767571Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:90a5a74deaee6d0abf971424bf3eafbacff0e1b71d38cce8492c2691978b67df","observation_id":"9419fa2b-9418-4b64-96b4-24e0d17f8e89","resolution":{"observed_at":"2026-08-14T13:02:30.272768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.770992Z","title":"Approximation theory of the MLP model in neural networks","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.770992Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:e577c2887d81062cbde0592ad4e84e3d7190b9dd2b600f5e278e2bac32fd3087","observation_id":"85fd894e-e22e-4605-bae1-8e37706345d3","resolution":{"observed_at":"2026-08-14T13:02:29.770992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.256530Z","title":null,"venue":null,"work_id":"8ba65e3b-8258-401d-b66c-3f133c682e64","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.775006Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:5e87ab240f52a2c6bb26cd65f9aa380c848e1a473fcf08887b2553888a304e8e","observation_id":"ab726565-5313-4c22-80fc-5bef765f4063","resolution":{"observed_at":"2026-08-14T13:02:30.260402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.242717Z","title":"Smallest singular value of a random rectangular matrix","venue":null,"work_id":"0a859ccb-fdb4-474f-8fba-413ed74bb00b","year":2009},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.778894Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:53a76da9391ac3a2bf616d7df7aab19bb64aadd467cb2b27e8305e207bdf4c7a","observation_id":"62839b48-f4ac-4c86-bdf8-e41807a845ed","resolution":{"observed_at":"2026-08-14T13:02:30.247270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1137/100806126","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.859739Z","title":"Learning kernel-based halfspaces with the 0-1 loss","venue":null,"work_id":"b4796a74-f44e-4761-8e61-b42017368b77","year":2011},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.782746Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:56452d498c2053437ec06969b2248f17e524596d4e37ea46305744b45ac24eb7","observation_id":"1f5371f0-0ba6-4aeb-ae0a-3ac7a7fe71d0","resolution":{"observed_at":"2026-08-14T13:02:29.866153Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.786749Z","title":"Neural network with unbounded activation functions is universal approximator","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.786749Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:976f33db7c91ec02e1b3d52c8ab3a252a087924462888231b0442bb3831377d0","observation_id":"ff541934-d291-4a0b-b203-90ed3e2bc450","resolution":{"observed_at":"2026-08-14T13:02:29.786749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.790832Z","title":"Spielman and Shang - Hua Teng","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.790832Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:62cdf7fdc110c6bd6189e0eebec8915007dfb901f00b75a3dccc732cbd7f0af6","observation_id":"2fb2c7c4-6d91-443a-8318-e9a3f82de050","resolution":{"observed_at":"2026-08-14T13:02:29.790832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.229657Z","title":"Orthogonal polynomials","venue":null,"work_id":"0533a18f-6c80-44eb-bf6d-e54a328893c8","year":1975},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.793919Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:517f727241121b3708e5496af24d569b68d257d6464034baafcbd27195816eef","observation_id":"a34dbaa2-04af-403e-bb4d-7e4563245464","resolution":{"observed_at":"2026-08-14T13:02:30.234136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.216922Z","title":"Lectures on H ermite and L aguerre expansions , volume 42 of Mathematical Notes","venue":null,"work_id":"6897ca5c-8a65-4d1a-93e4-89b49b3927cc","year":1993},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.796835Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:8491e3ed9233ea94dd91114a83c00f66063889fe2289691779f6c39cbfe6a9c6","observation_id":"4fd9fd0f-a19b-4adc-b86d-eb41fe55d2f5","resolution":{"observed_at":"2026-08-14T13:02:30.220882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.204735Z","title":"Invariance of weight distributions in rectified mlps","venue":null,"work_id":"9c20541e-134f-41dc-9863-6ef4e5de0839","year":2018},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.799938Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:63b3d26b6e55ccb9fed7ce5ec360c9ab570e1aad55db4ea9dbd98ae6d3de46bd","observation_id":"37d0ad4b-dd6c-4ff1-84f4-925e987faada","resolution":{"observed_at":"2026-08-14T13:02:30.208666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.192507Z","title":"Ger s gorin and his circles , volume 36","venue":null,"work_id":"3a2465d1-ddfd-4ce0-a275-e220586bf990","year":2010},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.803233Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:75e2a3950dd536e5782b157f0de6e11e3af6a766ad6a403b3e64b5ea1e65b94f","observation_id":"1ad9c1a3-2098-49b3-9278-8d33845db6d9","resolution":{"observed_at":"2026-08-14T13:02:30.197116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:29.806990Z","title":"Das asymptotische V erteilungsgesetz der E igenwerte linearer partieller D ifferentialgleichungen (mit einer A nwendung auf die T heorie der H ohlraumstrahlung)","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.806990Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:fcf8b057e3e275b4c308f2c72f00d117e8a68e718df1923139ad8f1094dd71c2","observation_id":"75988217-aebb-44a7-9e99-78be683f461c","resolution":{"observed_at":"2026-08-14T13:02:29.806990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.179331Z","title":"Diverse neural network learns true target functions","venue":null,"work_id":"2367e77c-cef5-4080-b89d-1532f2109bdc","year":2017},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.811341Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:c8360b0fa89a0279dfed3ec85a752262147f50bbba7174b9947de86aa0e1d672","observation_id":"461b217f-a1a3-4c04-87cc-c61dd1fc5b81","resolution":{"observed_at":"2026-08-14T13:02:30.183720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:02:30.166617Z","title":"Revise saturated activation functions","venue":null,"work_id":"8041ab47-c8ef-4a07-85f6-61e1c81451c0","year":2016},"citing_paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T13:02:29.815116Z"},"links":{"citing_paper":"/paper/1908.05660"},"observation_digest":"sha256:b648422b4f7d12bb5b541899c2af1ae07de66f2eda6ee9635d91f1cdc1227d71","observation_id":"9211ccd6-05ec-414f-9838-f3c65a5f081c","resolution":{"observed_at":"2026-08-14T13:02:30.170883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.05660","last_updated":"2020-04-10T13:22:00Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T04:59:30.677170Z","submitted_at":"2019-08-16T16:22:07Z","title":"Effect of Activation Functions on the Training of Overparametrized Neural Nets"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":34},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:1908.05660."}