{"as_of":"2026-08-08T09:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbb632bd701c12a51a962b0624156a599ec633f346ecad607b0e81f21736010e","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:20:49.832951Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:09:36.912553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:38.373231Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22085","snapshot_observed_at":"2026-08-03T10:09:36.912553Z","title":"Jentzen, A., Kranz, J., and Riekert, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12238","last_updated":"2026-07-24T03:23:33Z","snapshot_observed_at":"2026-08-03T10:09:34.130928Z","submitted_at":"2026-01-18T03:27:21Z","title":"On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:09:36.912553Z"},"links":{"cited_paper":"/paper/2505.22085","citing_paper":"/paper/2601.12238"},"observation_digest":"sha256:e6823a209b7f1c7e819a3f0af0841672133fd586f07977de49c383588514afcd","observation_id":"c4250ee0-78b1-45b3-8508-61ed43f75d3c","resolution":{"observed_at":"2026-08-03T10:09:36.912553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"cited_work":{"arxiv_id":"2505.22085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22085","snapshot_observed_at":"2026-07-04T07:29:38.373231Z","title":"PADAM: Parallel averaged Adam re- duces the error for stochastic optimization in scientific machine learning.arXiv:2505.22085; Revision requested from J","venue":null,"work_id":"b78cdc23-63fd-4b10-b394-f808b3362450","year":2024},"citing_paper":{"arxiv_id":"2606.21433","last_updated":"2026-06-19T13:49:42Z","snapshot_observed_at":"2026-07-06T23:56:26.805329Z","submitted_at":"2026-06-19T13:49:42Z","title":"Central limit theorem for the averaged Adam optimizer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T13:29:08.750421Z"},"links":{"cited_paper":"/paper/2505.22085","citing_paper":"/paper/2606.21433"},"observation_digest":"sha256:534c42c317739f027a26b9e976f1259a9885cbc545039a9665ebca0dddb536db","observation_id":"b0941b4b-8e5c-49ff-ba18-6a59519f5548","resolution":{"observed_at":"2026-07-04T07:29:38.374677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22085/citation-record","integrity":"/paper/2505.22085/integrity","json":"/paper/2505.22085/citation-record.json","paper":"/paper/2505.22085"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.18199","last_updated":"2024-10-30T17:51:28Z","snapshot_observed_at":"2026-08-04T20:53:21.315273Z","submitted_at":"2024-05-28T14:08:04Z","title":"Adam with model exponential moving average is effective for nonconvex optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18199","snapshot_observed_at":"2026-08-07T13:20:44.027164Z","title":"Adam with model exponential moving average is effective for nonconvex optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.027164Z"},"links":{"cited_paper":"/paper/2405.18199","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:f702a7c5e9e17a64717e77fcc155bcd2caecbccd8add85032319541d239ea026","observation_id":"0ede2bde-50d0-4e6b-b914-b26768d3a5f4","resolution":{"observed_at":"2026-08-07T13:20:44.027164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07061","last_updated":"2024-11-11T15:25:48Z","snapshot_observed_at":"2026-08-06T06:15:19.216332Z","submitted_at":"2024-11-11T15:25:48Z","title":"General framework for online-to-nonconvex conversion: Schedule-free SGD is also effective for nonconvex optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07061","snapshot_observed_at":"2026-08-07T13:20:44.103140Z","title":"General framework for online-to- nonconvex conversion: Schedule-free SGD is also effective for nonconvex optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.103140Z"},"links":{"cited_paper":"/paper/2411.07061","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:711cc1cffa5fd533ab44c7fc8f6b0ad9843532fab62b7a8167d3bbc3a2954e9c","observation_id":"ce1f34b2-c3bc-4452-a082-0e5e2cfea8f5","resolution":{"observed_at":"2026-08-07T13:20:44.103140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:59.319682Z","title":null,"venue":null,"work_id":"43f5d181-76db-444e-b06b-1b2049d333a0","year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.251006Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:87de94e3c3ad6a0be52d0f8146e2d8f908c0339f7be452ea78acec8dd27c98d6","observation_id":"dbc51ba4-6467-4b70-b652-51e18dec4760","resolution":{"observed_at":"2026-08-07T13:20:59.424343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.934536Z","title":"Learning Theory from First Principles","venue":null,"work_id":"807b1f0a-3ada-4ec8-b7fb-054993596bb0","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.335953Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:eae14e3c3bd63b7b7ef3a1cba4f71a0c088509026a9e051b50220deafaa34bce","observation_id":"f655e2b0-de84-4ab0-aca7-6b406d49b244","resolution":{"observed_at":"2026-08-07T13:20:59.101490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.535530Z","title":"Convergence and dynamical behavior of the Adam algorithm for nonconvex stochastic optimization","venue":null,"work_id":"4cc5a24a-80ce-4328-b6b1-53bee3372b8c","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.420377Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d880265afdf1879f9a4f344178c9027ef9ce7f038d7c2dcb94c23e8774c41566","observation_id":"003918ea-9e35-4d1e-ac82-3ef4f2fff3e5","resolution":{"observed_at":"2026-08-07T13:20:58.683762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:58.259044Z","title":"Solving the Kolmogorov PDE by means of deep learning","venue":null,"work_id":"f2726a2c-9a9a-41c2-a8a8-e71a29947ad3","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.520870Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:2753bfe32a4dafe3e0b29da43b37e1b9a8e0139d9e60b0c1316330ebdc6ad463","observation_id":"66f837b2-360b-4c7a-9b98-1a88ab5c6eb6","resolution":{"observed_at":"2026-08-07T13:20:58.425929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.978432Z","title":"An overview on deep learning-based approximation methods for partial differential equations","venue":null,"work_id":"3c51d0d7-fba7-4b6c-8455-63530c85f055","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.587912Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:599b00a2ceb8f1561c283368380d420582623f3795ce0fcb2d1d6cfbb05fd033","observation_id":"603fecab-d84e-4768-8b14-0f59c951ab3d","resolution":{"observed_at":"2026-08-07T13:20:58.111151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.731638Z","title":"Solving high-dimensional optimal stopping problems using deep learning","venue":null,"work_id":"0318f682-130b-416a-bfce-a0bf26ab29f6","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.675429Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ed0c70dd0075787a90fb52ae77447a02759436467633dfc27445aff9112fdf5a","observation_id":"a9c69ac5-8cb3-460f-9215-91f249d6b530","resolution":{"observed_at":"2026-08-07T13:20:57.837111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.447420Z","title":null,"venue":null,"work_id":"8bead533-2572-4ee7-8288-a61adaafe084","year":2020},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.774332Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:b05a0452b02778d61c7166e38ba9fd3576bb5713c8fd517ca37935759c9dadb7","observation_id":"fb6639ea-405b-44e7-a370-97f4dd87b3ba","resolution":{"observed_at":"2026-08-07T13:20:57.565534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:57.149117Z","title":"G., Suau Cuadros, X., and Webb, R","venue":null,"work_id":"7e136c79-2098-4d76-9ef3-887e79e1d212","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:44.911287Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:72c011d1023bb3f84b97a5e3671472516931538ab9880b0e9ec8930e979b04e7","observation_id":"10695ec8-d505-4f1c-ab3c-475bc9ce6d2b","resolution":{"observed_at":"2026-08-07T13:20:57.266491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.876896Z","title":"Scientific machine learning through physics-informed neural networks: where we are and what’s next","venue":null,"work_id":"717ac0a6-5df6-48df-8bb5-d738a2c85743","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.018646Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:7d3ecc47963a226bf48f0d7d9ef8083d78a10ac897a59be9cd15fd3a0477d8ab","observation_id":"0cf9b7d8-f3cb-4c5b-b55e-232ad0c71007","resolution":{"observed_at":"2026-08-07T13:20:56.991187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15682","last_updated":"2024-10-29T22:40:23Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T16:20:46Z","title":"The Road Less Scheduled","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15682","snapshot_observed_at":"2026-08-07T13:20:45.123106Z","title":"A., Mehta, H., Mishchenko, K., Khaled, A., and Cutkosky, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.123106Z"},"links":{"cited_paper":"/paper/2405.15682","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:0d36a2dd80814e0cb294b2cf410ac34eae892d1defbb7e1e02f9dcdcc2df0c73","observation_id":"a8dddf37-23af-43f4-b8ac-005545f927e8","resolution":{"observed_at":"2026-08-07T13:20:45.123106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.561092Z","title":"A Simple Convergence Proof of Adam and Adagrad","venue":null,"work_id":"1618047b-95a7-4eab-9688-ad2bfe308436","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.226863Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:4a2edd53622caec02bb8c13c5fda390945de1dbff6a2b0ba53a145eb983d74ae","observation_id":"51a48e79-e6d9-435a-9995-498bf0e27a9b","resolution":{"observed_at":"2026-08-07T13:20:56.670464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:56.224798Z","title":"General multilevel adaptations for stochastic approximation algorithms II: CLTs","venue":null,"work_id":"6df39008-bca3-48d9-b14b-fbd1e0e1801f","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.364610Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:271ad75beeba8846544cd3c54322444be2dc4bc5cb1fffa712eb075a6dc75e54","observation_id":"c3cb9ab0-2fc9-45ed-ad59-5f53b7904919","resolution":{"observed_at":"2026-08-07T13:20:56.382981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21078","last_updated":"2024-07-29T22:49:04Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-29T22:49:04Z","title":"Convergence rates for the Adam optimizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21078","snapshot_observed_at":"2026-08-07T13:20:45.494765Z","title":"Convergence rates for the Adam optimizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.494765Z"},"links":{"cited_paper":"/paper/2407.21078","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:f7c24faa57d78c2661d4279eec46cbdac99d50e3a004d8be1c742fa796e29fe5","observation_id":"7561269f-221b-42ab-b3e7-386f24565866","resolution":{"observed_at":"2026-08-07T13:20:45.494765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.957715Z","title":"On the existence of minimizers in shallow residual relu neural network optimization landscapes","venue":null,"work_id":"a094fdc7-5c8f-45d8-bb90-5e1ce4fa21c5","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.533294Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:8791b12b69c670627bab4bb7ae91b06e6cefb4ca36f8f11eadf496f5f5722743","observation_id":"48240a19-5a1f-4a6d-9ae4-a7e6e0a34b9d","resolution":{"observed_at":"2026-08-07T13:20:56.058509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06081","last_updated":"2025-01-10T16:15:25Z","snapshot_observed_at":"2026-07-06T20:19:21.142837Z","submitted_at":"2025-01-10T16:15:25Z","title":"Averaged Adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06081","snapshot_observed_at":"2026-08-07T13:20:45.699370Z","title":"Averaged adam accelerates stochastic optimization in the training of deep neural network approximations for partial differential equation and optimal control problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.699370Z"},"links":{"cited_paper":"/paper/2501.06081","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:c62510c716657971a0a5a56f2333dd26645275134ed5b1442e212b9733820b40","observation_id":"87d7e869-f19e-427e-8c0a-7b832eba50bc","resolution":{"observed_at":"2026-08-07T13:20:45.699370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.700384Z","title":"Central limit theorems for stochastic gradient descent with averaging for stable manifolds","venue":null,"work_id":"e1144d2b-5de8-49c3-9a86-e50777faa3c6","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.799000Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:048ba5b364e53e358293883502a6a49838ef707177c8084b6b33a5656d0523c9","observation_id":"080081b6-b3f0-4147-9f37-997a168118e0","resolution":{"observed_at":"2026-08-07T13:20:55.827850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.403286Z","title":"On the existence of optimal shallow feedforward networks with ReLU activation","venue":null,"work_id":"93f367b3-3a10-4658-8502-ff5ed0202a1e","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:45.895036Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:785f65ce3b8833941f8a8450d3f1522859c914c1ff7619f6db9f4b30b84891d7","observation_id":"e29d8abd-3823-40d6-97db-4159f880da90","resolution":{"observed_at":"2026-08-07T13:20:55.531121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:55.104742Z","title":"General multilevel adaptations for stochastic approximation algorithms of Robbins-Monro and Polyak-Ruppert type.Numer","venue":null,"work_id":"053c9574-6e85-4098-894f-25ce6a3d632e","year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.038818Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:5b30be3e631c4fa0dd14b5faf6ead4ec283e70e14f1e9cdd069fe8b777d5161b","observation_id":"a998fdc4-adee-4388-aae0-cab3df4962ea","resolution":{"observed_at":"2026-08-07T13:20:55.228206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.743600Z","title":"Uniform convergence guarantees for the deep ritz method for nonlinear problems","venue":null,"work_id":"f401d25d-da32-4cbc-9117-225c8bd22dc4","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.144661Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:57867d3e5f73a1a3f84ef7453922136154d576238fca16cdff21b66c8e68e4af","observation_id":"7765285a-e5f8-44e7-8862-38d86e513211","resolution":{"observed_at":"2026-08-07T13:20:54.928881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.442755Z","title":"Deep learning-based numerical methods for high- dimensional parabolic partial differential equations and backward stochastic differential equations","venue":null,"work_id":"ecb8686b-2793-4543-b943-4b624731d01d","year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.247445Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:106c8c1bb2d4b1699a418fcbb15e7d8ce9498c81f400cfa59bd395f91ab61cde","observation_id":"2e25f9d3-d276-4245-8d69-89a207cbf049","resolution":{"observed_at":"2026-08-07T13:20:54.610718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:54.174787Z","title":"Algorithms for solving high dimensional PDEs: from nonlinear Monte Carlo to machine learning","venue":null,"work_id":"737a209e-f990-4788-958a-4163652e1925","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.383740Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3028e4d3e9e1ad4ede78f349738cf755ffb00328220b6d53adeed75631a63bb9","observation_id":"dd51ade3-a143-42ee-869d-c433c46f5dce","resolution":{"observed_at":"2026-08-07T13:20:54.327060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.894006Z","title":"The deep Ritz method: a deep learning-based numerical algorithm for solving variational problems","venue":null,"work_id":"2a75f70a-6faf-4326-bb4e-a986e7c387b8","year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.481643Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3a4371d6cb89e4fdd43aa0998d20a67b9703edb3b85800df3bf87dcedd5c721c","observation_id":"e4bdcae6-5852-49e7-afb1-ee27a3958610","resolution":{"observed_at":"2026-08-07T13:20:54.005662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.03342","last_updated":"2017-09-11T11:49:19Z","snapshot_observed_at":"2026-07-06T05:59:03.911368Z","submitted_at":"2017-09-11T11:49:19Z","title":"Optimal non-asymptotic bound of the Ruppert-Polyak averaging without strong convexity","version":1},"cited_work":{"arxiv_id":"1709.03342","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.03342","snapshot_observed_at":"2026-08-07T13:20:51.137834Z","title":"Optimal non-asymptotic bound of the Ruppert-Polyak averaging without strong convexity","venue":"math.ST","work_id":"74bb9d2a-9374-4a04-9ab6-09bb2d4329b2","year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.576139Z"},"links":{"cited_paper":"/paper/1709.03342","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:b8bde72949350bef8387cafad6d176ad3fd541e89e6f05b90b1355dde0a26e17","observation_id":"91ddcca1-97a5-4f04-9fca-01d5749814f3","resolution":{"observed_at":"2026-08-07T13:20:51.292006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15641","last_updated":"2022-11-28T18:49:09Z","snapshot_observed_at":"2026-07-06T14:24:05.948664Z","submitted_at":"2022-11-28T18:49:09Z","title":"Blow up phenomena for gradient descent optimization methods in the training of artificial neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15641","snapshot_observed_at":"2026-08-07T13:20:46.654207Z","title":"Blow up phenomena for gradient de- scent optimization methods in the training of artificial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.654207Z"},"links":{"cited_paper":"/paper/2211.15641","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:678eb17da1a8ccb06d57aca9e5d6b97a22b0e0f70efd0e33a0bfe77bbc70bc3e","observation_id":"3df7c9c6-1abd-410a-bfde-b0a24629b2e4","resolution":{"observed_at":"2026-08-07T13:20:46.654207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08068","last_updated":"2021-04-16T08:03:23Z","snapshot_observed_at":"2026-08-07T08:22:33.614391Z","submitted_at":"2021-01-20T11:06:23Z","title":"Neural networks-based algorithms for stochastic control and PDEs in finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08068","snapshot_observed_at":"2026-08-07T13:20:46.707687Z","title":"Neural networks-based algorithms for stochastic control and PDEs in finance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.707687Z"},"links":{"cited_paper":"/paper/2101.08068","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:5d0d6cd477f3a84137826a53725e1c662e7ce734bec822d4665dbcc8f018386b","observation_id":"40721e7e-24dd-4a0c-856e-320d5fdbda52","resolution":{"observed_at":"2026-08-07T13:20:46.707687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.622390Z","title":"Stochastic weight averaging revisited","venue":null,"work_id":"6b3efb5c-a32f-4a45-85bd-5ae712d17e92","year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.832622Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:23cf03ace5913ecbdd2f8897ec4020ae7554be985117b4c5a1b2f1ce9e746e6f","observation_id":"911bee71-a7b2-49a9-87b7-2c8b01730968","resolution":{"observed_at":"2026-08-07T13:20:53.734446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:53.288662Z","title":null,"venue":null,"work_id":"df868715-55e1-43ba-b301-615f783df8a1","year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:46.957269Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:2109e77ed647f99783a8139a148f581d1cb67097a6c91dd6d65ac89b04341a5b","observation_id":"74dad194-4c96-4a2f-844e-990a800d4b01","resolution":{"observed_at":"2026-08-07T13:20:53.453359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.958947Z","title":"Recent developments in machine learning methods for stochastic control and games","venue":null,"work_id":"08eb654e-a7b8-45c4-ba0c-a98cb716261a","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.034083Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:2b2be70465db901eafc633003552e18782a5ba2aa067a6af71495b99e240fab8","observation_id":"dd6775d0-2b8e-4823-ac1a-76cdd95391a3","resolution":{"observed_at":"2026-08-07T13:20:53.089257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-07T13:20:47.187971Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.187971Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:4707b1a6909c53eb5a01b32095b4c4842e91abe5b1964f1f0e0aa4cf2e6e2ac0","observation_id":"f24dec9c-4fdd-40dd-a4a8-135a1fe8edcd","resolution":{"observed_at":"2026-08-07T13:20:47.187971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20360","last_updated":"2025-07-15T18:49:51Z","snapshot_observed_at":"2026-08-05T06:24:22.525969Z","submitted_at":"2023-10-31T11:01:23Z","title":"Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20360","snapshot_observed_at":"2026-08-07T13:20:47.254649Z","title":"Mathematical Introduc- tion to Deep Learning: Methods, Implementations, and Theory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.254649Z"},"links":{"cited_paper":"/paper/2310.20360","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:9e47bee4cfed950b1c551198815c456f7aad8549c843539088c47fd7f99cc79a","observation_id":"8916bea2-64ea-48d1-b5c0-54fa55f3d09e","resolution":{"observed_at":"2026-08-07T13:20:47.254649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.743163Z","title":"On the existence of global minima and convergence analyses for gradient descent methods in the training of deep neural networks","venue":null,"work_id":"e4ba3224-4d75-4f08-9ee5-e9710b23dd4d","year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.384573Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ad38948c2cc58c632cd889c7d3b164405a2effc4599cf621c3dad6839c135531","observation_id":"e75e8d49-a8c5-49ac-91b3-de4e0cc451f8","resolution":{"observed_at":"2026-08-07T13:20:52.838309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T13:20:47.424978Z","title":"P., and Ba, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.424978Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:49a466bbae0eabab644e5134523f893f3aedc2239aaa91ab1b45af581c1ba44a","observation_id":"71cdcc58-6054-416f-b9c1-e954c0495dd4","resolution":{"observed_at":"2026-08-07T13:20:47.424978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09572","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:50.798165Z","title":"SAD Neural Net- works: Divergent Gradient Flows and Asymptotic Optimality via o-minimal Structures","venue":null,"work_id":"a3f9ea68-983a-4407-b06e-3648015c4d17","year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.515572Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:f33176b6380f2c2c7028f91cb97a245746087a8b57bacdb7344514453bcaf98c","observation_id":"d50492e0-b898-4191-a8c6-b43068b2341c","resolution":{"observed_at":"2026-08-07T13:20:50.894625Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13972","last_updated":"2023-11-07T03:12:49Z","snapshot_observed_at":"2026-07-06T15:20:37.222868Z","submitted_at":"2023-04-27T06:27:37Z","title":"Convergence of Adam Under Relaxed Assumptions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13972","snapshot_observed_at":"2026-08-07T13:20:47.571118Z","title":"Convergence of Adam Under Relaxed As- sumptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.571118Z"},"links":{"cited_paper":"/paper/2304.13972","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:93289d74e54965aa1279ecce8ccf924e39d01802662445f933acb13e4fb000b4","observation_id":"4b85d118-57fa-461d-80bd-5ab60eaed08c","resolution":{"observed_at":"2026-08-07T13:20:47.571118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14123","last_updated":"2025-02-19T21:55:11Z","snapshot_observed_at":"2026-08-07T18:03:33.324388Z","submitted_at":"2025-02-19T21:55:11Z","title":"Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression","version":1},"cited_work":{"arxiv_id":"2502.14123","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14123","snapshot_observed_at":"2026-08-07T13:20:50.443612Z","title":"Understanding SGD with Exponential Moving Average: A Case Study in Linear Regression","venue":"cs.LG","work_id":"9daddbdb-1804-4c20-86f8-35ad83f55862","year":2025},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.643359Z"},"links":{"cited_paper":"/paper/2502.14123","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:e61bbf2184de5cf9654b136b2ac94663f5bd5fd7d498470d8d8ebef34a674d1e","observation_id":"8102fa5d-3cb1-4def-8a85-973b59d35ec3","resolution":{"observed_at":"2026-08-07T13:20:50.561668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01852","last_updated":"2023-08-22T03:18:43Z","snapshot_observed_at":"2026-07-06T15:12:07.431442Z","submitted_at":"2023-04-04T15:01:06Z","title":"Summary of ChatGPT-Related Research and Perspective Towards the Future of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01852","snapshot_observed_at":"2026-08-07T13:20:47.730894Z","title":"Summary of ChatGPT-related research and perspective towards the future of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.730894Z"},"links":{"cited_paper":"/paper/2304.01852","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:584dbeff80e6cbf23fc92dd2509969c93510f1da8a5579eddc2bb78106a1916f","observation_id":"e11fa63e-2b52-4fda-8849-89de09810771","resolution":{"observed_at":"2026-08-07T13:20:47.730894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:20:47.787142Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.787142Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3174d967b309445fa95dbdb9f77ae5c774bb26ba5f89a94daccaabca36e599c6","observation_id":"dd8c1174-40ba-4975-a786-50ceab7bdbc9","resolution":{"observed_at":"2026-08-07T13:20:47.787142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05890","last_updated":"2020-12-29T05:33:37Z","snapshot_observed_at":"2026-07-06T08:00:13.822686Z","submitted_at":"2019-06-13T18:52:00Z","title":"Gradient Descent Maximizes the Margin of Homogeneous Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05890","snapshot_observed_at":"2026-08-07T13:20:47.870928Z","title":"Gradient Descent Maximizes the Margin of Homogeneous Neural Networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.870928Z"},"links":{"cited_paper":"/paper/1906.05890","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:87b95226f70f0df8b80f418dec2ff65233b0e741d1dbd5ac37617b10cdaadae5","observation_id":"ff0b6f8b-69f6-458d-8324-e607f2d38ff7","resolution":{"observed_at":"2026-08-07T13:20:47.870928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04289","last_updated":"2018-01-19T21:07:09Z","snapshot_observed_at":"2026-07-06T05:37:49.239583Z","submitted_at":"2017-04-13T22:17:30Z","title":"Stochastic Gradient Descent as Approximate Bayesian Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04289","snapshot_observed_at":"2026-08-07T13:20:47.962359Z","title":"D., and Blei, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:47.962359Z"},"links":{"cited_paper":"/paper/1704.04289","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:ef89bb4c3bf31329494b6c51873afae337e7bc6a9cfada4e591ae6f183935488","observation_id":"f5a2318d-ef61-414c-80ee-bb1a7df5a500","resolution":{"observed_at":"2026-08-07T13:20:47.962359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.509110Z","title":"Exponential moving average of weights in deep learning: Dynamics and benefits","venue":null,"work_id":"c827fc31-17c6-4a87-b9d3-32fb3cf545e9","year":2024},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.034105Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:8ca201c52c6d6b5bc6084e0dd34ebb5ea62f389883d8a4a8c8af023194be2712","observation_id":"5c447aaa-cef6-4293-a0f0-4205e3852af2","resolution":{"observed_at":"2026-08-07T13:20:52.605227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.324773Z","title":"Topological properties of the set of functions generated by neural networks of fixed size","venue":null,"work_id":"6f823bec-c191-42f9-83f4-f31f576b5e91","year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.183493Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:464833d65c93ac2690a9416126d4715c0c20fc10d18c7ed6a6e20401f59f0895","observation_id":"394582bf-e2c6-4e71-8955-e6c29c87a6dd","resolution":{"observed_at":"2026-08-07T13:20:52.390186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:52.097940Z","title":"Continuous-time stochastic control and optimization with financial applications, vol","venue":null,"work_id":"e088e9b0-40de-4402-902b-f45de88cb55f","year":2009},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.301435Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:a2227f1bbd33b12283b17d77fd7e17bfbf9253b70b79f394df43497864d425a4","observation_id":"0d60ffcf-2a5e-498c-96fa-3b4ddff012c6","resolution":{"observed_at":"2026-08-07T13:20:52.189882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.946845Z","title":null,"venue":null,"work_id":"f4ceecbd-0035-41ae-be2a-cfd7a9b7b961","year":1990},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.411360Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:3b1f53eecd2b5e5d4333f7132de7c171c46801d7fd7a590532b4df17fb6a2e56","observation_id":"20f15452-6034-473a-ba11-f349d65d8dc8","resolution":{"observed_at":"2026-08-07T13:20:52.012419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.729774Z","title":"T., and Juditsky, A","venue":null,"work_id":"fc99edcf-1100-43a4-ad77-97febdc40363","year":1992},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.626059Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:0b19230bf930f1be8ba1428f2aa848d6730bb6e28e548c51f5e0426ca1717bcb","observation_id":"dd5bac77-c224-42ca-91f4-df1fe0e02d0c","resolution":{"observed_at":"2026-08-07T13:20:51.839610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-07T13:20:48.749797Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.749797Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:431f7f05ee4230a26a89cc96914382af5f6691303112f94af4b4f1103214c46a","observation_id":"821a4347-7511-40bb-aac1-0a49b15ef796","resolution":{"observed_at":"2026-08-07T13:20:48.749797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-07T13:20:48.882281Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:48.882281Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:a71cc1980d7cd84667bc31fa76bdbb6d0a0fe8a7b18a1c7e67f4298f637e5dd3","observation_id":"8de2a81c-251e-457e-ad7f-3f692c0d2f2d","resolution":{"observed_at":"2026-08-07T13:20:48.882281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-07T13:20:49.032440Z","title":"High- resolution image synthesis with latent diffusion models.arXiv:2112.10752 (2022), 45 pages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.032440Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:aadc802b1b9290c7f85eabcf1edb265dd213f3086a92b9e314d6d1e15b77c645","observation_id":"5ceea0a7-d7e6-42e1-83a8-f50dc56cd332","resolution":{"observed_at":"2026-08-07T13:20:49.032440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-04T02:05:40.539691Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-07T13:20:49.150415Z","title":"An overview of gradient descent optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.150415Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:e49406e2d4bc1fde357164898f28d7692c2a50a62e4e266dd2490e5dca6e2684","observation_id":"08ca1edf-a5b2-41d6-998e-8c2c25e34313","resolution":{"observed_at":"2026-08-07T13:20:49.150415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:20:51.529056Z","title":"Efficient estimations from a slowly convergent Robbins-Monro process.Cor- nell University Operations Research and Industrial Engineering, hdl.handle.net/1813/8664 (1988), 1–34","venue":null,"work_id":"a978fd5b-8800-4f1b-be7b-828c3e52f83c","year":1988},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.266841Z"},"links":{"citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:1ed3806030c58990d1d80eac0c00f5dcebe1ed20a13e4d786c2ecd80a583e1ce","observation_id":"b7389969-55b8-4b52-9f5c-8df99e018d28","resolution":{"observed_at":"2026-08-07T13:20:51.601182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-07-06T13:12:59.688989Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11487","snapshot_observed_at":"2026-08-07T13:20:49.372617Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.372617Z"},"links":{"cited_paper":"/paper/2205.11487","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:38ed576d5ecd8704adae8a72e57d069246e06919d6a3e4c090e2854491128020","observation_id":"9ae9a0e3-f7c2-4cd3-a529-38c93cbaaf54","resolution":{"observed_at":"2026-08-07T13:20:49.372617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02312","last_updated":"2023-02-01T07:08:58Z","snapshot_observed_at":"2026-07-06T14:37:56.945127Z","submitted_at":"2023-01-05T21:58:46Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02312","snapshot_observed_at":"2026-08-07T13:20:49.539468Z","title":"Training tra- jectories, mini-batch losses and the curious role of the learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.539468Z"},"links":{"cited_paper":"/paper/2301.02312","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:231b3c218559b96593e2993b569eb35e42d2ed12247101b102642c621ec8bb36","observation_id":"59a99ae4-2b76-4bb0-ad7f-ecea03b0c639","resolution":{"observed_at":"2026-08-07T13:20:49.539468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02732","last_updated":"2022-10-02T10:33:53Z","snapshot_observed_at":"2026-08-06T02:24:02.564596Z","submitted_at":"2021-10-06T13:27:23Z","title":"On Margin Maximization in Linear and ReLU Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02732","snapshot_observed_at":"2026-08-07T13:20:49.699637Z","title":"On Margin Maximization in Linear and ReLU Networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.699637Z"},"links":{"cited_paper":"/paper/2110.02732","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:d6b957910bb37ffca4404deada7c09750d6c09bad6d4525ffffc01610d43f038","observation_id":"503a1d71-526c-4b3a-8797-e03a34ddf718","resolution":{"observed_at":"2026-08-07T13:20:49.699637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6651","last_updated":"2015-10-25T12:12:52Z","snapshot_observed_at":"2026-08-04T14:14:16.864745Z","submitted_at":"2014-12-20T13:22:23Z","title":"Deep learning with Elastic Averaging SGD","version":8},"cited_work":{"arxiv_id":"1412.6651","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.6651","snapshot_observed_at":"2026-08-07T13:20:50.047593Z","title":"Deep learning with Elastic Averaging SGD","venue":"cs.LG","work_id":"b855016e-c36b-454b-bd79-34650ff0a2d3","year":2014},"citing_paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:20:49.832951Z"},"links":{"cited_paper":"/paper/1412.6651","citing_paper":"/paper/2505.22085"},"observation_digest":"sha256:9660adbb1f4007c616501a57183599ed8a3d99d4062995682b122eb98f6804a1","observation_id":"de806598-2911-43d2-bd22-b44927348aae","resolution":{"observed_at":"2026-08-07T13:20:50.167971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22085","last_updated":"2025-05-28T08:07:34Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-07T13:13:06.021383Z","submitted_at":"2025-05-28T08:07:34Z","title":"PADAM: Parallel averaged Adam reduces the error for stochastic optimization in scientific machine learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 2 inbound Pith citation observations for arXiv:2505.22085."}