{"as_of":"2026-08-11T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf27f9dcd087b5944f10ff8f7dafe34c14201b531fcc5815e0b81ceaa14bb8fc","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:10:55.394691Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15646/citation-record","integrity":"/paper/2501.15646/integrity","json":"/paper/2501.15646/citation-record.json","paper":"/paper/2501.15646"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1603.04467","last_updated":"2016-03-16T16:57:12Z","snapshot_observed_at":"2026-07-06T04:49:28.300758Z","submitted_at":"2016-03-14T20:50:20Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.04467","snapshot_observed_at":"2026-08-10T14:10:55.075137Z","title":"S., Davis, A., Dean, J., Devin, M., Ghemawat, S., Goodfell ow, I","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.075137Z"},"links":{"cited_paper":"/paper/1603.04467","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:acd9a29361c618fb2d3917b230e3ff7cf5ed88a36643f96386e3b79bfffc11cb","observation_id":"c4197251-d85e-4647-b255-13d763e15d4b","resolution":{"observed_at":"2026-08-10T14:10:55.075137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.079600Z","title":"Learning Theory from First Principles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.079600Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:5a09908b694d286a6aa316cb800739e702d861d32bcfc440cb5b367db10b014f","observation_id":"2cd1384d-7819-49a9-8206-f4fb72d35904","resolution":{"observed_at":"2026-08-10T14:10:55.079600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.232120Z","title":"J., and Zhang, Y","venue":null,"work_id":"bab810a2-defa-4bdc-b782-64948fdae40d","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.083893Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:36ce8a804bf954170189e781a971e4a6725be3febd1cbcdf4887f7a26130b122","observation_id":"07e570e5-81b0-4bba-81a4-327baf331d8f","resolution":{"observed_at":"2026-08-10T14:10:56.236616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01730","last_updated":"2023-02-06T16:34:38Z","snapshot_observed_at":"2026-08-10T23:31:37.193492Z","submitted_at":"2022-06-01T08:43:35Z","title":"On the complexity of nonsmooth automatic differentiation","version":2},"cited_work":{"arxiv_id":"2206.01730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01730","snapshot_observed_at":"2026-08-10T14:10:55.893289Z","title":"On the complexity of nonsmooth automatic differentiation","venue":"math.NA","work_id":"c7d33202-f829-481f-b613-0bcb0ffbc019","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.087847Z"},"links":{"cited_paper":"/paper/2206.01730","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:0cf5283c1927e098751b8327a8ea0aa77ae527b4a53ae22f22453c05ee05edc0","observation_id":"0bd24e4a-9259-4986-82f1-e79ec3902d01","resolution":{"observed_at":"2026-08-10T14:10:55.897472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.219952Z","title":"The /suppress lojasiewicz inequality for nonsmooth subanalytic functions with applications to subgradient dynamical systems","venue":null,"work_id":"d98d0d4e-d27f-4549-ae94-c3ca18ba2570","year":2006},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.092333Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:909641169c198063fc53c206565189636c797bf9c4cd49de412d6f52bf5a8dc3","observation_id":"386b18a8-919b-4bbd-98d3-137ca1f53ccf","resolution":{"observed_at":"2026-08-10T14:10:56.224193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.02080","last_updated":"2020-10-29T15:11:30Z","snapshot_observed_at":"2026-08-08T11:56:50.819125Z","submitted_at":"2020-06-03T07:33:29Z","title":"A mathematical model for automatic differentiation in machine learning","version":2},"cited_work":{"arxiv_id":"2006.02080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.02080","snapshot_observed_at":"2026-08-10T14:10:55.877110Z","title":"A mathematical model for automatic differentiation in machine learning","venue":"cs.LG","work_id":"fc7abc90-6f23-4f8f-8c80-9b72cbe6cc0b","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.096392Z"},"links":{"cited_paper":"/paper/2006.02080","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:b938b244b4013c47a0890cafb4c5d9f4374c1e8fdf823d90686de385e532ef06","observation_id":"38756945-2ca7-4bfe-a275-52d5d8f00612","resolution":{"observed_at":"2026-08-10T14:10:55.881349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.208105Z","title":"Conservative set valued ﬁelds, automatic diﬀerentiation, stochastic gradient methods and deep learning","venue":null,"work_id":"ced43518-ce7b-4dab-957c-83747411666c","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.101003Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:196fbaa8ee140822c1ed4ad6f0f42d330a97ebfd06982c8dc68d93b8b9352989","observation_id":"b8e90943-66f2-42a2-9cd8-2fee265ddf93","resolution":{"observed_at":"2026-08-10T14:10:56.212131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.195213Z","title":"Diﬀerentiating nonsmooth solutions to parametric monotone inclusion problems","venue":null,"work_id":"6ca1295c-be0c-4cf7-9d75-8c9015d6bf2b","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.104409Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a7bd350d7f2b79738cb685679e5dd6cbcf5ce6cec8c4478e53140fdbba193207","observation_id":"eec2a3c5-b9d9-47db-bffd-d581aebd50e8","resolution":{"observed_at":"2026-08-10T14:10:56.199136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00457","last_updated":"2022-05-31T07:58:37Z","snapshot_observed_at":"2026-08-10T10:40:26.446012Z","submitted_at":"2022-05-31T07:58:37Z","title":"Automatic differentiation of nonsmooth iterative algorithms","version":1},"cited_work":{"arxiv_id":"2206.00457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00457","snapshot_observed_at":"2026-08-10T14:10:55.861080Z","title":"Automatic differentiation of nonsmooth iterative algorithms","venue":"math.OC","work_id":"b3654713-9502-4b54-9d46-091194069c8c","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.108574Z"},"links":{"cited_paper":"/paper/2206.00457","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:4199d204f293740f3cccbb0850df4043fd9f9c4640df5e1f11120be0b7fe9540","observation_id":"7de81cdc-eaaf-45fa-adcf-190e8cac1a6e","resolution":{"observed_at":"2026-08-10T14:10:55.865319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.181590Z","title":"A proof of conver- gence for gradient descent in the training of artiﬁcial neur al networks for constant target functions","venue":null,"work_id":"077b8e63-48e0-4e0b-96f8-7a11a3d58da6","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.112707Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f78d976dc0296d905767992abaa64bbf05daa5cc3824e9e1f15284b3a9806cd1","observation_id":"981b5c36-5e7a-45cf-9ba0-d2ec49606f72","resolution":{"observed_at":"2026-08-10T14:10:56.186067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.169421Z","title":"Non-convergence of stochastic gradient descent in the training of deep neural networks","venue":null,"work_id":"a02e1ddb-2dfe-4a52-843e-826350bb1de9","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.116780Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:45f5739e6e3c827ae65a9a686165b2487a929f8a5cf8ae18e265969711f81648","observation_id":"67f90682-0a80-4db7-96cc-8f883e6cd23d","resolution":{"observed_at":"2026-08-10T14:10:56.173592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.157762Z","title":"Landscape analysis for shallow neural networks: complete classiﬁcation of critical point s for aﬃne target functions","venue":null,"work_id":"f2deb8bb-e8a5-404a-a359-2387ac7c227e","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.121575Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6833078ed30ecf18963ad082a9bfab6a03de3a9e17aee4b74cc793fb8dcccdad","observation_id":"96174e1b-66a5-43e1-9f10-caec25de07ed","resolution":{"observed_at":"2026-08-10T14:10:56.161634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.146156Z","title":"On the mathematical foundations of learning","venue":null,"work_id":"13da44e9-3c52-427d-b860-d3c9ead59c19","year":2002},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.125374Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:7601c7864d94914c2077b521fd11773e759faa79b4e6b75fc57514c32f676c19","observation_id":"298ebf6c-13f7-4d44-af12-ecf75480c4d6","resolution":{"observed_at":"2026-08-10T14:10:56.149980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.133283Z","title":"Conservative and semismooth derivatives are equiv- alent for semialgebraic maps","venue":null,"work_id":"f8013c03-e6c5-432f-959b-c1a642429079","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.128887Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:1c6b76ccaaf5e0026b8d0494d354fc9a7d5a0cf8518882eb569d412644df9084","observation_id":"c4d9f116-ace4-4096-9460-39d1965ca551","resolution":{"observed_at":"2026-08-10T14:10:56.137872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.120758Z","title":null,"venue":null,"work_id":"3fbd1c47-fe72-4d38-9b9f-a6800a83e53d","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.132991Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f088dcb847318d46de48b2a3c63c5b43ed8db8023b888c3b56d2c52edc28dab3","observation_id":"4dbe2bae-0527-4de1-a815-73e8aa838dae","resolution":{"observed_at":"2026-08-10T14:10:56.125431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08100","last_updated":"2024-07-11T00:10:35Z","snapshot_observed_at":"2026-08-10T18:44:54.735453Z","submitted_at":"2024-07-11T00:10:35Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08100","snapshot_observed_at":"2026-08-10T14:10:55.137201Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.137201Z"},"links":{"cited_paper":"/paper/2407.08100","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e9bf5e6d98d9420c6000737c99fc83269448cce985959c0fb4b7412328d12b76","observation_id":"f9aaa7f2-7500-4db6-b94c-683116f86386","resolution":{"observed_at":"2026-08-10T14:10:55.137201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09385","last_updated":"2024-01-09T16:01:17Z","snapshot_observed_at":"2026-07-06T10:42:32.217922Z","submitted_at":"2021-02-16T12:42:25Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09385","snapshot_observed_at":"2026-08-10T14:10:55.140914Z","title":"Convergence of stochastic gradient descent schemes for Lojasiewicz-landscapes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.140914Z"},"links":{"cited_paper":"/paper/2102.09385","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:c1f2a9c144985f86253f55432bce4cc3d7285c8977a83d175fd3712a53ffb814","observation_id":"c4232203-5f03-46fa-aed2-d4310676e10d","resolution":{"observed_at":"2026-08-10T14:10:55.140914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08858","last_updated":"2023-10-13T04:59:44Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T04:59:44Z","title":"Adam-family Methods with Decoupled Weight Decay in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08858","snapshot_observed_at":"2026-08-10T14:10:55.144839Z","title":"Adam-family Methods with Decoupled Weight Decay in Deep Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.144839Z"},"links":{"cited_paper":"/paper/2310.08858","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:1361e71fd4af0d1ef147db9fce678562b1d35f22e654a0f20257d412c4632308","observation_id":"8a76bc57-5b4e-49be-acea-7ad9090d1fc4","resolution":{"observed_at":"2026-08-10T14:10:55.144839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01413","last_updated":"2020-11-14T17:05:52Z","snapshot_observed_at":"2026-08-11T02:04:37.895221Z","submitted_at":"2019-11-04T18:56:58Z","title":"Sub-Optimal Local Minima Exist for Neural Networks with Almost All Non-Linear Activations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01413","snapshot_observed_at":"2026-08-10T14:10:55.149307Z","title":"Sub-Optimal Local Minima Exist for Neural Networks with Almost All Non-Linear Activations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.149307Z"},"links":{"cited_paper":"/paper/1911.01413","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:bb4719f0a33f33e6137a1ef9260f2a8892ece5a318c0d265d7765eefe42e8d38","observation_id":"45dc87df-2ace-4e74-80f8-32e5a802df13","resolution":{"observed_at":"2026-08-10T14:10:55.149307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10713","last_updated":"2020-12-07T23:36:20Z","snapshot_observed_at":"2026-08-01T05:26:13.979939Z","submitted_at":"2020-09-22T17:55:47Z","title":"Towards a Mathematical Understanding of Neural Network-Based Machine Learning: what we know and what we don't","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10713","snapshot_observed_at":"2026-08-10T14:10:55.153180Z","title":"Towards a Mathematical Under- standing of Neural Network-Based Machine Learning: what we know and what we don’t","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.153180Z"},"links":{"cited_paper":"/paper/2009.10713","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:cdcd1cff4613583c2a4f389324089ae8eb4bb0b10bdddc04abd2b96dc612af9f","observation_id":"237b81ec-86ee-4ab1-a3c2-a32df0fd1f55","resolution":{"observed_at":"2026-08-10T14:10:55.153180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.108894Z","title":null,"venue":null,"work_id":"05dc41c1-134c-4269-9d85-7dc7e08993be","year":1998},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.157102Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f8347d252d5df1a4828555b040b8a22f84b22c37ee089ad0323e6cabfae7fe2e","observation_id":"0b27e058-fa9f-4ea2-a1b0-eacf244f4589","resolution":{"observed_at":"2026-08-10T14:10:56.112630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15641","last_updated":"2022-11-28T18:49:09Z","snapshot_observed_at":"2026-08-09T05:34:32.474947Z","submitted_at":"2022-11-28T18:49:09Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15641","snapshot_observed_at":"2026-08-10T14:10:55.160595Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artiﬁcial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.160595Z"},"links":{"cited_paper":"/paper/2211.15641","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:925ab7b141fcca6076e2a5ccf24b34fbd80fc20c09955ff3f2fccbc36db300c4","observation_id":"d3d9e9cc-cec9-4211-a353-d84650cddd89","resolution":{"observed_at":"2026-08-10T14:10:55.160595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-08-09T01:25:35.554813Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-10T14:10:55.164695Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.164695Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:13ec606260db0772fbabd721af7846f386e806eacecd6748b55b497d81afdc38","observation_id":"01304cc6-e5b7-404b-a619-5801727b4eb9","resolution":{"observed_at":"2026-08-10T14:10:55.164695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08399","last_updated":"2022-09-17T20:26:19Z","snapshot_observed_at":"2026-07-06T13:53:25.231868Z","submitted_at":"2022-09-17T20:26:19Z","title":"Approximation results for Gradient Descent trained Shallow Neural Networks in $1d$","version":1},"cited_work":{"arxiv_id":"2209.08399","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08399","snapshot_observed_at":"2026-08-10T14:10:55.764603Z","title":"Approximation results for Gradient Descent trained Shallow Neural Networks in $1d$","venue":"cs.LG","work_id":"8136acc3-0801-44f1-bb2a-4b5a7d527c3f","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.168292Z"},"links":{"cited_paper":"/paper/2209.08399","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a9855ae509fffe145e8abfe321545141e705e023fe4864e5c64b4cc5ae61a8ec","observation_id":"34356b5b-423a-401e-be69-5d66b7e03ae3","resolution":{"observed_at":"2026-08-10T14:10:55.769225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10533","last_updated":"2025-02-15T04:17:23Z","snapshot_observed_at":"2026-08-06T19:55:56.983408Z","submitted_at":"2024-10-14T14:11:37Z","title":"Non-convergence to global minimizers in data driven supervised deep learning: Adam and stochastic gradient descent optimization provably fail to converge to global minimizers in the training of deep neural networks with ReLU activation","version":2},"cited_work":{"arxiv_id":"2410.10533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10533","snapshot_observed_at":"2026-08-10T14:10:55.748563Z","title":"Non-convergence to global minimizers in data driven supervised deep learning: Adam and stochastic gradient descent optimization provably fail to converge to global minimizers in the training of deep neural networks with ReLU activation","venue":"cs.LG","work_id":"8c0916f3-08aa-4adb-a531-f651568abf44","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.171951Z"},"links":{"cited_paper":"/paper/2410.10533","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:9198a1b97ab95596e742d59c0a5b8b974d7c6c6eff91d3ee3866343afe25ebaf","observation_id":"7d58f89a-2b2c-4fde-92c0-aca6e4701d44","resolution":{"observed_at":"2026-08-10T14:10:55.752584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07369","last_updated":"2023-06-22T18:05:01Z","snapshot_observed_at":"2026-07-06T12:18:35.507335Z","submitted_at":"2021-12-13T11:45:36Z","title":"Convergence proof for stochastic gradient descent in the training of deep neural networks with ReLU activation for constant target functions","version":2},"cited_work":{"arxiv_id":"2112.07369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.07369","snapshot_observed_at":"2026-08-10T14:10:55.733702Z","title":"Convergence proof for stochastic gradient descent in the training of deep neural networks with ReLU activation for constant target functions","venue":"cs.LG","work_id":"a5862223-25f9-487b-aa62-c7fa71ba09cb","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.176028Z"},"links":{"cited_paper":"/paper/2112.07369","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6cc12ca1a1a19c3c32a1ecb80f39d9b678818ee6fd48a8728d9ece5d17428aa1","observation_id":"65143bab-0e87-4d47-b350-06063f650409","resolution":{"observed_at":"2026-08-10T14:10:55.737848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13111","last_updated":"2025-08-28T23:18:51Z","snapshot_observed_at":"2026-08-10T13:10:11.440748Z","submitted_at":"2022-12-26T12:29:12Z","title":"Convergence to good non-optimal critical points in the training of neural networks: Gradient descent optimization with one random initialization overcomes all bad non-global local minima with high probability","version":2},"cited_work":{"arxiv_id":"2212.13111","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.13111","snapshot_observed_at":"2026-08-10T14:10:55.717638Z","title":"Convergence to good non-optimal critical points in the training of neural networks: Gradient descent optimization with one random initialization overcomes all bad non-global local minima with high probability","venue":"math.OC","work_id":"0f1655f0-8e07-48b3-a97d-2ff2c89ecee8","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.180503Z"},"links":{"cited_paper":"/paper/2212.13111","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a7e5289170c908c4b4e51c96ed4f8b27c3fa985b1d9f3aaf4f12faf08189a49a","observation_id":"af440117-6d22-4089-a733-751858c2023f","resolution":{"observed_at":"2026-08-10T14:10:55.721846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20360","last_updated":"2025-07-15T18:49:51Z","snapshot_observed_at":"2026-08-10T12:39:34.548288Z","submitted_at":"2023-10-31T11:01:23Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20360","snapshot_observed_at":"2026-08-10T14:10:55.184143Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.184143Z"},"links":{"cited_paper":"/paper/2310.20360","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:1110c733b360208c289c6d153fc606ab646516ec15aa4a96abde599a17c15956","observation_id":"23c3f78c-f589-4871-bc95-8213a9807e5f","resolution":{"observed_at":"2026-08-10T14:10:55.184143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09684","last_updated":"2022-07-13T15:12:38Z","snapshot_observed_at":"2026-08-10T06:15:18.832938Z","submitted_at":"2021-12-17T18:55:40Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","version":2},"cited_work":{"arxiv_id":"2112.09684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09684","snapshot_observed_at":"2026-08-10T14:10:55.689224Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","venue":"math.OC","work_id":"e052ff39-40fd-467f-8a4a-c648a258e421","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.187721Z"},"links":{"cited_paper":"/paper/2112.09684","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:aa17e93ad85902e206872fdd4a1c38a83dc9c01891cc8addff99e1c7fcb6e4fe","observation_id":"56865051-e276-4cac-8445-25a6fb17bf8d","resolution":{"observed_at":"2026-08-10T14:10:55.693711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.097046Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of dee p neural networks","venue":null,"work_id":"cbf29579-ad15-4741-b6dc-0b70591acbfb","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.191988Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3989c0a1d3337b8193507f4808c38e8591c1241885e24b315b47bdab32cfd02b","observation_id":"77ca3d51-68d6-42d2-9cb2-b1b4cb6e0829","resolution":{"observed_at":"2026-08-10T14:10:56.101057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.084590Z","title":"A proof of convergence for stochastic gradient descent in the training of artiﬁcial neural networks with ReLU activation for constant target functions","venue":null,"work_id":"308ea9e6-7206-4c73-84e2-2270b0421312","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.196026Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:b8af959ae0c5b815c8f0fdc4d5c70e19e4fa7b3858466bbe9b78553d47328e18","observation_id":"730c4d9f-1152-4a86-943e-3dc45a151caa","resolution":{"observed_at":"2026-08-10T14:10:56.089558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.072386Z","title":"Convergence analysis for gradient ﬂows in the training of artiﬁcial neural networks with ReLU activation","venue":null,"work_id":"a5e0f78c-9229-488a-968e-2eadb71bffc2","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.200155Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:8b031841b76a62d0ba9aecfda99c58f7513e81e1af2dc42a5069d813dfceda3f","observation_id":"4766fd9e-0563-4699-8fc0-cedf26672fda","resolution":{"observed_at":"2026-08-10T14:10:56.076929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05155","last_updated":"2024-02-07T16:14:04Z","snapshot_observed_at":"2026-08-10T03:55:19.040654Z","submitted_at":"2024-02-07T16:14:04Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and constructions of local minimizers in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05155","snapshot_observed_at":"2026-08-10T14:10:55.203554Z","title":"Non-convergence to global minimizers for Adam and stochastic gradient descent optimization and constructio ns of local minimizers in the training of artiﬁcial neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.203554Z"},"links":{"cited_paper":"/paper/2402.05155","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:2983199e5165bfd26bdf83d61f6e189fc37e290c17f408ade45fe15c619f1623","observation_id":"4eedb1c9-c93b-4322-95cf-0880eaeeb427","resolution":{"observed_at":"2026-08-10T14:10:55.203554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.059588Z","title":"M., and Lee, J","venue":null,"work_id":"28a83009-fade-4e73-833a-2fdccb7d9468","year":2018},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.207272Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:7ef5dbdd3890a375b5dd9acd62017269fba41c6487a90c2f44d53439bb2156ef","observation_id":"69f09e38-d5c9-4b34-a18e-2ce0ddbe999e","resolution":{"observed_at":"2026-08-10T14:10:56.064425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02666","last_updated":"2023-12-05T08:53:25Z","snapshot_observed_at":"2026-07-06T15:37:58.467574Z","submitted_at":"2023-06-05T08:01:50Z","title":"Does a sparse ReLU network training problem always admit an optimum?","version":2},"cited_work":{"arxiv_id":"2306.02666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02666","snapshot_observed_at":"2026-08-10T14:10:55.660302Z","title":"Does a sparse ReLU network training problem always admit an optimum?","venue":"cs.NE","work_id":"129d302a-9fd1-49a1-a7fe-b4f1cdef4bbe","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.211624Z"},"links":{"cited_paper":"/paper/2306.02666","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:5d4e141d952e1afdd03aded334454f76de863f3a57029f8e85830d4cf0611497","observation_id":"34629051-9f5a-49aa-8680-06075f1cd961","resolution":{"observed_at":"2026-08-10T14:10:55.664692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.048032Z","title":"On correctness of automatic diﬀerentiation for non-diﬀerentiable functions","venue":null,"work_id":"ee9e3ef0-1dfb-4aa9-93d2-6a7275aa3774","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.215356Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:428a8d5e95afaa61bea7defa392765c3956754e0afe0fa8681ef901820bd152e","observation_id":"fee10728-e53e-4f3a-9771-574812d91ad8","resolution":{"observed_at":"2026-08-10T14:10:56.052008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.036242Z","title":"S., and Tian, T","venue":null,"work_id":"2f9555b9-fac2-4dba-aef6-8ee6760e5601","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.219333Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:0ab0f6c7f6dd29fd995543a118c0a916c990c266f231161ef53726ecd9ae6b6f","observation_id":"59c9386c-576d-46db-b028-18257b59b67d","resolution":{"observed_at":"2026-08-10T14:10:56.040243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.024142Z","title":null,"venue":null,"work_id":"66e402cf-eb94-4900-ad5d-66c50580e622","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.223509Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:e39b1155718cfee6c81e5cdf16158a14ee1877a2846ee04a1b5a4f63607676aa","observation_id":"a2a99617-256c-44a6-ac47-bcdbedb122a8","resolution":{"observed_at":"2026-08-10T14:10:56.028119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:56.011174Z","title":"Introductory lectures on convex optimization , vol","venue":null,"work_id":"be5bbbde-6af3-4c31-8e37-cc7435b5b425","year":2004},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.227077Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:004c3bad218b009cb0be63e02096b253134179c61799bf98cab2e8eb8ef6a5b8","observation_id":"d9636a0d-b071-4e95-835d-0f5b0a7940b7","resolution":{"observed_at":"2026-08-10T14:10:56.015946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.999430Z","title":"Automatic diﬀerentiation in PyTorch","venue":null,"work_id":"53fa9336-9726-4352-8045-532dd9a16a03","year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.230372Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3094425c659c6b6c7c2219f207b665c0ef5cde7df41168af669540aca6107077","observation_id":"e73bedc5-766f-4a3e-9074-5399620c1a26","resolution":{"observed_at":"2026-08-10T14:10:56.003282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-10T14:10:55.234656Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.234656Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:3576b63c6071bc99a090cd41eabb6979da17706db900aa880dd147d8ebb2a585","observation_id":"18600bc8-8a6f-42d7-acfd-8744b14e2c17","resolution":{"observed_at":"2026-08-10T14:10:55.234656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.987933Z","title":"Conservative parametric optimality and the ridge method for tame min-max problems","venue":null,"work_id":"a62ee6d0-0ac2-48a1-8d9d-b2862dcfe9b6","year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.238390Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f07e8ae82a8734bd417a491d606c83175a48f63195d021459b218efefca5aded","observation_id":"a3d61f3a-0a6d-45ac-8add-0c11fabcb32f","resolution":{"observed_at":"2026-08-10T14:10:55.991827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.975905Z","title":"Topological properties of the set of functions generated by neural networks of ﬁxed size","venue":null,"work_id":"19a58f4b-02e0-46cd-a4f3-511c7126ab3a","year":2021},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.242309Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:4563fb7001057ff57465c2aa696788297b5ac4e267376944530465e411cfbf0f","observation_id":"c5e849ba-d9cf-4a7e-81b3-1e073f726c5d","resolution":{"observed_at":"2026-08-10T14:10:55.980143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.246396Z","title":"Mathematical theory of deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.246396Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:d678e9fcc0515bc21b1846fa33d962ddd0e361e2ecc429e517867fedd553d525","observation_id":"d8bd2e87-a613-4e51-8aa5-9ae1eee4fbcc","resolution":{"observed_at":"2026-08-10T14:10:55.246396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-10T14:10:55.250440Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.250440Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:efa11570973d434be59d27b49a441be9d6d7b4e0458515b8d0dba0dd0d6e416c","observation_id":"04fab9aa-cc6d-4de7-928d-caf7c839d88a","resolution":{"observed_at":"2026-08-10T14:10:55.250440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.963606Z","title":"T., and Wets, R","venue":null,"work_id":"681f77fa-b4cd-4f1e-a62f-10b1f1d3a08b","year":1998},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.254360Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:1dbeee2d11ee8238bb9e3a1d49692848bc0804d6944f5b2bb8114cfc11e1a964","observation_id":"6596ba1a-4111-4321-a318-7bb990f3c059","resolution":{"observed_at":"2026-08-10T14:10:55.967280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-10T14:10:55.258087Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.258087Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:6cf79a3219fc5c26ade23c813977d7e535d73ebd60bc8e78c81b9be640c65668","observation_id":"587b5c32-04c1-459a-b2e3-85e6a28f2179","resolution":{"observed_at":"2026-08-10T14:10:55.258087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.08968","last_updated":"2018-08-09T14:17:45Z","snapshot_observed_at":"2026-07-06T06:15:59.652998Z","submitted_at":"2017-12-24T21:00:10Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks","version":3},"cited_work":{"arxiv_id":"1712.08968","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.08968","snapshot_observed_at":"2026-08-10T14:10:55.555541Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks","venue":"cs.LG","work_id":"80626904-c29e-464b-8c6f-d4150665abd6","year":2017},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.261614Z"},"links":{"cited_paper":"/paper/1712.08968","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:46ea5eabccbd2156d228f1ffc0b041a51e9627d62fc1d4074b867f7cec5d6790","observation_id":"3e73331b-66c2-4d4e-a9b9-b4224f0c7db5","resolution":{"observed_at":"2026-08-10T14:10:55.559559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.265908Z","title":"The gradient’s limit of a deﬁnable family of functions is a co nservative set-valued ﬁeld","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.265908Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:db51a9d1e8781297de7d177bd2a0be2d0ad59e26114d049e6bb31cbe17189c05","observation_id":"aa99968d-afbc-48fa-8857-030d520112f9","resolution":{"observed_at":"2026-08-10T14:10:55.265908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.952444Z","title":null,"venue":null,"work_id":"34a31869-d9b1-4ae7-97c9-ae1211b910ab","year":2020},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.269590Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:fe1cc92275bfd0ae45f2f40fdd8955de50e70e0e989e766f39458ee23e311829","observation_id":"72b69994-0986-4f7c-8459-8d7434480bc8","resolution":{"observed_at":"2026-08-10T14:10:55.956109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08957","last_updated":"2019-12-19T00:23:18Z","snapshot_observed_at":"2026-08-05T19:03:39.733993Z","submitted_at":"2019-12-19T00:23:18Z","title":"Optimization for deep learning: theory and algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08957","snapshot_observed_at":"2026-08-10T14:10:55.368199Z","title":"Optimization for deep learning: theory and algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.368199Z"},"links":{"cited_paper":"/paper/1912.08957","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:490603f8e6b69844c6ef5a294e79833df75caaaa90bd0d653b2ab149c0f59fca","observation_id":"26fff830-1fc2-4193-a377-d46ca9e8f0c2","resolution":{"observed_at":"2026-08-10T14:10:55.368199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06310","last_updated":"2017-02-17T14:51:54Z","snapshot_observed_at":"2026-08-05T13:30:02.203408Z","submitted_at":"2016-11-19T05:49:22Z","title":"Local minima in training of neural networks","version":2},"cited_work":{"arxiv_id":"1611.06310","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.06310","snapshot_observed_at":"2026-08-10T14:10:55.466134Z","title":"Local minima in training of neural networks","venue":"stat.ML","work_id":"67c7545e-71b6-4453-961c-75892f193ffd","year":2016},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.372632Z"},"links":{"cited_paper":"/paper/1611.06310","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:ac56b8cea4419089b260ec12b0875e36f68fefe2aa55410b32321298870acdbe","observation_id":"f61b343a-98b8-488c-98a2-f0f5034bd062","resolution":{"observed_at":"2026-08-10T14:10:55.470243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.940917Z","title":"S., and Bruna, J","venue":null,"work_id":"7f14da55-b4bb-4fca-b0be-e0e5a41c8956","year":2019},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.376505Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:d52040c70776d3fd2527f3d8308b643db162c7007ac991a1abc57187e7488874","observation_id":"2e04d224-a0a5-4b26-8625-9e01e5213426","resolution":{"observed_at":"2026-08-10T14:10:55.944838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11696","last_updated":"2024-05-19T23:04:09Z","snapshot_observed_at":"2026-07-06T18:16:29.163229Z","submitted_at":"2024-05-19T23:04:09Z","title":"Approximation and Gradient Descent Training with Neural Networks","version":1},"cited_work":{"arxiv_id":"2405.11696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11696","snapshot_observed_at":"2026-08-10T14:10:55.447648Z","title":"Approximation and Gradient Descent Training with Neural Networks","venue":"cs.LG","work_id":"c29a296b-261d-4b30-9c9a-7ee689bc2c26","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.379861Z"},"links":{"cited_paper":"/paper/2405.11696","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:f14a9e72e78a13b656d33b204750cc5f217c91c20765a66123c8710ed1153511","observation_id":"c50e8cdc-96f1-4cd6-b8f4-348c3b7ac367","resolution":{"observed_at":"2026-08-10T14:10:55.453704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.929738Z","title":"Approximation results for gradient ﬂow trained neural netw orks","venue":null,"work_id":"ba51c07e-1292-4802-929d-2267795f8eb0","year":2024},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.383559Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a6214b53438443d6058fa1c4d98f3b56e074e093b93acea807fd0b864af312e6","observation_id":"b09235ce-e803-4d66-828b-d312a10535e8","resolution":{"observed_at":"2026-08-10T14:10:55.933568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03938","last_updated":"2024-02-19T07:59:56Z","snapshot_observed_at":"2026-07-06T15:24:04.050068Z","submitted_at":"2023-05-06T05:35:56Z","title":"Adam-family Methods for Nonsmooth Optimization with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03938","snapshot_observed_at":"2026-08-10T14:10:55.387153Z","title":"Adam-family Methods for Nonsmooth Optimization with Convergence Guarantees","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.387153Z"},"links":{"cited_paper":"/paper/2305.03938","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:bb6f324b8a173b6bbcef4724039944feaf0a963d2ad58ec462fff13191ae424a","observation_id":"18d67b15-0b65-4b23-84f4-71b7548b57a3","resolution":{"observed_at":"2026-08-10T14:10:55.387153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10053","last_updated":"2026-08-08T16:05:24Z","snapshot_observed_at":"2026-08-11T04:16:02.046089Z","submitted_at":"2023-07-19T15:26:18Z","title":"Stochastic Subgradient Methods with Guaranteed Global Stability in Nonsmooth Nonconvex Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10053","snapshot_observed_at":"2026-08-10T14:10:55.390854Z","title":"Convergence Guarantees for Stochastic Subgradient Methods in Nonsmooth Nonconvex Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.390854Z"},"links":{"cited_paper":"/paper/2307.10053","citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:a1a7fd1736071cb2ec64df8c341a3af74a877cbbed581289efd03d26d14134e9","observation_id":"409d5b73-5735-41b6-b555-24d8cf6ce3d2","resolution":{"observed_at":"2026-08-10T14:10:55.390854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:10:55.918445Z","title":null,"venue":null,"work_id":"0802d421-4ba3-4c1b-9211-00c244681d93","year":2022},"citing_paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:55.394691Z"},"links":{"citing_paper":"/paper/2501.15646"},"observation_digest":"sha256:9c67d586855d8c729d50a668cc35bca872546ada15361046671d56396025b844","observation_id":"02b81597-8b7b-4ff3-98c1-b4846b707d05","resolution":{"observed_at":"2026-08-10T14:10:55.922227Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15646","last_updated":"2025-01-26T19:11:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:20:19.983137Z","submitted_at":"2025-01-26T19:11:57Z","title":"Mathematical analysis of the gradients in deep learning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":11,"verified_fuzzy":22},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2501.15646."}