{"as_of":"2026-08-08T01:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48e3d9ffd1ea21d5a28051b53eb1566097c5eccd50307afeb01232eb648e7063","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:00.259466Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22578/citation-record","integrity":"/paper/2505.22578/integrity","json":"/paper/2505.22578/citation-record.json","paper":"/paper/2505.22578"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.075498Z","title":"Du, Wei Hu, Zhiyuan Li, and Ruosong Wang","venue":null,"work_id":"ff5e317a-9afb-4126-a3f1-cafa329c553e","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.332413Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:86f8c61adfa45f894ca321e94707ed19482ee9f43266d451407c2d25dc71b7c8","observation_id":"cf65120c-5e39-42e5-b796-7692035685d2","resolution":{"observed_at":"2026-08-07T13:13:09.203822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.810220Z","title":null,"venue":null,"work_id":"b8e45a86-0b82-4cf7-85a1-9f23b41921e3","year":2017},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.377545Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:2e03dd644fe0e027d335f49a221a2c75f45e3b2553af0b610d47aa4a5f1cc88b","observation_id":"83dd3c12-b08d-4f3a-81a2-57cb4c270077","resolution":{"observed_at":"2026-08-07T13:13:08.939482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.563366Z","title":"Penalising the biases in norm regularisation enforces sparsity https://papers.neurips.cc/paper_files/paper/2023/hash/b444ad72520a5f5c467343be88e352ed-Abstract-Conference.html","venue":null,"work_id":"5e5da127-2563-45bb-8774-a648ef7b4d34","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.451054Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:b2b91410340ac4d29e0ddbfcf1a1b5335209f38c288a0b71da77c2d48e5181b7","observation_id":"74c7d6ca-ef8d-41ef-a13f-d5ba1e3ad86e","resolution":{"observed_at":"2026-08-07T13:13:08.668772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2401.10791","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.041369Z","title":"Early alignment in two-layer networks training is a two-edged sword 10.48550/arxiv.2401.10791","venue":null,"work_id":"5fe93717-9fd3-4ad9-82ac-bb9d02f03e72","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.531975Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:2a887f13722ea7bd17a81c4d824b6a944dc242393f76b79a76d185edb1e2836c","observation_id":"9c1ef4dc-9322-4aff-a239-1c5c4fb6f1ca","resolution":{"observed_at":"2026-08-07T13:13:01.118361Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.428492Z","title":"Simplicity bias and optimization threshold in two-layer ReLU networks https://openreview.net/forum?id=qAarsvflTa","venue":null,"work_id":"d14498d0-ee07-46de-b8cf-f8ce5e090cc3","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.590775Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:acb1f300e633fe5cfc1b74a46bf1b3e4ee55d296757d47e924a773e68f8039d3","observation_id":"f6a9376d-c56c-4135-ae90-47898d9cfd9c","resolution":{"observed_at":"2026-08-07T13:13:08.496137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.286234Z","title":null,"venue":null,"work_id":"16fee694-f7b5-4b00-97a4-87ad8ca80571","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.664933Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:06a9299e1bf51e436612141c1e679edfaf4cdf15b2c4a9e3cd16a400bc7cd1bf","observation_id":"792d70e4-35af-48d8-be78-090179834cc0","resolution":{"observed_at":"2026-08-07T13:13:08.357491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.078258Z","title":"How Uniform Random Weights Induce Non-uniform Bias: Typical Interpolating Neural Networks Generalize with Narrow Teachers https://openreview.net/forum?id=3eHNvPHL9Z","venue":null,"work_id":"cb40c80e-71be-4341-94d0-dd3299deb2d4","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.756758Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:d59b849bfcc97702b90be4620c9267ed272159c3805712de5e33fa12ed5c3226","observation_id":"8f0db553-e388-4387-8853-a948e9210d09","resolution":{"observed_at":"2026-08-07T13:13:08.217059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2203.16462","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:00.766109Z","title":"Convergence of gradient descent for deep neural networks 10.48550/arxiv.2203.16462","venue":null,"work_id":"50795789-d680-4bd1-93f3-568f57f5c61c","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:54.914089Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:829a9fb58fac10b018a931377015fd37b96c91d9aacd528cae690d34d1619728","observation_id":"9b1854d3-34d3-4136-9f96-688a9f2403c1","resolution":{"observed_at":"2026-08-07T13:13:00.843877Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.954344Z","title":"Loss Landscapes are All You Need: Neural Network Generalization Can Be Explained Without the Implicit Bias of Gradient Descent https://openreview.net/forum?id=QC10RmRbZy9","venue":null,"work_id":"572e15cd-db48-47b7-963f-75cb96c233e0","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.032252Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:25084a7cd83482fc8c1b8f3c9ace704ab8997f8688844fbe6011cd20850fab6b","observation_id":"03f525e9-9160-44a3-a045-08d516f2efe6","resolution":{"observed_at":"2026-08-07T13:13:08.001695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.946270Z","title":null,"venue":null,"work_id":"6cd72bed-0e7d-4f35-82c2-80b2d7066993","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.152527Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:9d112be33754a048b4b52cb737ecf2531cf46f6d68a7c0d78c594f310f80c5cc","observation_id":"071cdf86-ea16-4c38-a119-33a3a0a780ff","resolution":{"observed_at":"2026-08-07T13:13:07.949186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.811444Z","title":null,"venue":null,"work_id":"c518bde8-26c9-4c67-9b0e-24f42b9107b8","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.306196Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:0ab6452530499bd812c3605a170955d9b76f46b4263d463ccc5cc01ec78d5f84","observation_id":"38f3a440-21cb-4a86-8869-33e040ebb0ae","resolution":{"observed_at":"2026-08-07T13:13:07.918542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.594311Z","title":null,"venue":null,"work_id":"be0b2e9c-13b3-44f5-b2aa-146ef9727257","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.474552Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:02c573a7719a706b16c97bed50dde5a6b146d4d2583a5d73f582d6ac06100c1e","observation_id":"64cdbab3-38e7-43c0-a369-5bd2ede0cb6c","resolution":{"observed_at":"2026-08-07T13:13:07.701863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:55.590174Z","title":null,"venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.590174Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a50912aa5e1c871758832adc109365425c2991732c29062ac1cbbe4a5ce62484","observation_id":"e30d8cd1-5d7c-4bdb-91ac-65168652e6dd","resolution":{"observed_at":"2026-08-07T13:12:55.590174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2502.16977","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:00.558225Z","title":"Bach, and Loucas Pillaud - Vivien","venue":null,"work_id":"f78a3958-9b64-418d-8900-31b0988d1bca","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.704138Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:6db7dc226f4bded3b7296803a62dc35bdb6a97d16a5d6fb92402a63dfcd96270","observation_id":"b4bd2716-0494-4d02-bfb8-c1da6de70724","resolution":{"observed_at":"2026-08-07T13:13:00.630343Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.384425Z","title":null,"venue":null,"work_id":"985b6c41-3085-4efe-b94a-35b0cf714c86","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.846688Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f9936820913979275d1c0a907c2121ed9f75e744befcedbf27e27d1cbcce29bd","observation_id":"e8e52731-abf1-486f-b05d-36faeb95cf96","resolution":{"observed_at":"2026-08-07T13:13:07.503025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:55.969941Z","title":"Kakade, and Jason D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:55.969941Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a89297c5a659a66bcd62dde3e543372e519ab670d60cce0440ccbf56b650ce44","observation_id":"79819969-13bd-4fc5-b1f9-a5e6b3778476","resolution":{"observed_at":"2026-08-07T13:12:55.969941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.091116Z","title":"https://www.jmlr.org/papers/v17/15-408.html CVXPY : A P ython-embedded modeling language for convex optimization","venue":null,"work_id":"0d5c30fa-b79b-4c91-9312-b9f1ae23870e","year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.058268Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:05b3ea10a9e9fa1fbce9c49962605a9b7fd3603af2fe9915b92539d926439dff","observation_id":"174a3a10-6587-46e7-8fa9-61538a6fc583","resolution":{"observed_at":"2026-08-07T13:13:07.256033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.811017Z","title":"Hamprecht","venue":null,"work_id":"6ef436b7-15e8-4d81-8f38-7fba02678459","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.230864Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:ef82646a4265e3734b21364ac0dffc0bc7ab6eac496a99904b4774e214f2b4cb","observation_id":"28dc0c1e-59b1-41da-9bd7-e02db3e4f05f","resolution":{"observed_at":"2026-08-07T13:13:06.951243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.611056Z","title":"Du, Xiyu Zhai, Barnab \\' a s P \\' o czos, and Aarti Singh","venue":null,"work_id":"3e14bf5c-72b0-4642-9a4b-8740e824c6c0","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.343084Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f1b20e761d177a6a8e35912f75f7fe3eb3e7312075eb1b07f82242f1c58c6d5e","observation_id":"2e16810a-a1fd-4a45-a54e-25e522cbd06a","resolution":{"observed_at":"2026-08-07T13:13:06.708498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.430466Z","title":"Convex Geometry and Duality of Over-parameterized Neural Networks http://jmlr.org/papers/v22/20-1447.html","venue":null,"work_id":"f0e77f9c-8574-4470-871a-d78f3149cbf6","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.443251Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f2bed80523bbdfdf976e4c67926bf120762a0bea9edbf58ceb70eba53cfbbba0","observation_id":"0b01b0f9-19ea-4923-afb6-ec89ca45688d","resolution":{"observed_at":"2026-08-07T13:13:06.540935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.235216Z","title":"An introduction to probability theory and its applications, volume 2","venue":null,"work_id":"703e6a4e-43b1-4f2a-a3ce-9ccb115adac5","year":1991},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.535095Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:f871db510927953574b404c31f17436166599515716f5ddda31337a7d9a9dbba","observation_id":"b7873b5f-3ba9-4ee0-8a70-c6cd7daa7e7c","resolution":{"observed_at":"2026-08-07T13:13:06.364081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.993139Z","title":"Vetrov, and Andrew Gordon Wilson","venue":null,"work_id":"47b6cf5b-55f2-475b-a1d5-97b0a7177ad1","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.639192Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4b7546712062dccdd912fcf1cc72a64a69711a00894c638e0d38ef3ddc378192","observation_id":"51ada76a-9c7e-49b9-b168-d8626d6c5b38","resolution":{"observed_at":"2026-08-07T13:13:06.086766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.851045Z","title":"https://openreview.net/forum?id=HgOJlxzB16 SGD Finds then Tunes Features in Two-Layer Neural Networks with near-Optimal Sample Complexity: A Case Study in the XOR problem","venue":null,"work_id":"db89ed97-facf-4566-87d7-a9dbbcc47e9b","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.757397Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:9e12961d3f80e371247398c50741a3dafd24c0f0226e3856c9b0c6a061a6c0f4","observation_id":"f8d588e8-3ef4-433d-ae93-2cedfb5b5b9a","resolution":{"observed_at":"2026-08-07T13:13:05.911555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.728008Z","title":"Truth or backpropaganda? An empirical investigation of deep learning theory https://openreview.net/forum?id=HyxyIgHFvr","venue":null,"work_id":"f2c4e578-f650-4205-a272-bb19d9c63524","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.826153Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4af46dffef246957b1e43c1d23be51eaa852bd7e0884d0b0d10f79d095f9fcd6","observation_id":"28a6c832-38c5-4355-9f20-5bb655161c75","resolution":{"observed_at":"2026-08-07T13:13:05.787591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12762","last_updated":"2024-05-21T13:15:19Z","snapshot_observed_at":"2026-08-06T04:56:28.221817Z","submitted_at":"2024-05-21T13:15:19Z","title":"Clarabel: An interior-point solver for conic programs with quadratic objectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12762","snapshot_observed_at":"2026-08-07T13:12:56.938493Z","title":"Goulart and Yuwen Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:56.938493Z"},"links":{"cited_paper":"/paper/2405.12762","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:40f1d8949b8170fc9bfd54bb18ca83664fbb272ae8e5104b7cd29edd0c7d8ada","observation_id":"febe0f18-62a5-4f05-a621-8c1522f71328","resolution":{"observed_at":"2026-08-07T13:12:56.938493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.023287Z","title":"Haeffele and Ren \\' e Vidal","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.023287Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:84acd73420f59b9988fad58067b54163e25566851ecabca754ab2321a562baf4","observation_id":"a96253ce-1c46-4c1f-b9cc-8169e7197c6b","resolution":{"observed_at":"2026-08-07T13:12:57.023287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.570695Z","title":"Piecewise linear activations substantially shape the loss surfaces of neural networks https://openreview.net/forum?id=B1x6BTEKwr","venue":null,"work_id":"de3c9e40-322c-4513-b98a-d220d330c320","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.197644Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:57567835b37338117270de4b5a3f12104ea7013d381e499c9067acb54bed8856","observation_id":"12dd8075-579f-4650-b68b-bc03a8f58350","resolution":{"observed_at":"2026-08-07T13:13:05.676439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.324053Z","title":"Deep Residual Learning for Image Recognition 10.1109/cvpr.2016.90","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.324053Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4e3c51d8f88eaff5306e088986b7f22e6c778f890cca714d5417181281814551","observation_id":"c6928d55-1f75-46db-bb7c-805e90b5bf41","resolution":{"observed_at":"2026-08-07T13:12:57.324053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.382727Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks https://proceedings.neurips.cc/paper/2018/hash/5a4be1fa34e62bb8a6ec6b91d2462f5a-Abstract.html","venue":null,"work_id":"e8a599c6-296c-4ea8-b7c7-64ffdbead779","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.442933Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:e1dc54e16038d1717f0e753675cd91f97b120527c359c5296df743e7ae877325","observation_id":"752329bc-34da-4c9c-97ac-02aaa5a0259e","resolution":{"observed_at":"2026-08-07T13:13:05.456856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:57.560687Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.560687Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:c351b8262c8a88e036b1c766e01e919330fd9edec7c1f3b0beab6b1229d83d44","observation_id":"16283734-4f5a-42f1-bc36-49195400c4fa","resolution":{"observed_at":"2026-08-07T13:12:57.560687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.186573Z","title":"Mildly Overparameterized ReLU Networks Have a Favorable Loss Landscape https://openreview.net/forum?id=10WARaIwFn","venue":null,"work_id":"04d0ec8d-ff20-4514-93c8-bfe446b1ca0b","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.708312Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:40ff5806b122f4f9eb15663a23c1be8d66d10db350e4f06257df7b4ac28ab403","observation_id":"f4c597be-e459-448e-9c63-6d5b0870e528","resolution":{"observed_at":"2026-08-07T13:13:05.283568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.932037Z","title":"Deep Learning without Poor Local Minima https://proceedings.neurips.cc/paper/2016/hash/f2fc990265c712c49d51a18a32b39f0c-Abstract.html","venue":null,"work_id":"2a6db262-f141-4e5d-a60e-5fb7e6141948","year":2016},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.835214Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:93ffd119ae0f86d5b48265121088722aa9bc9942d12898344d993faafd8569f0","observation_id":"46685940-4451-4b0e-8239-74ac682d9155","resolution":{"observed_at":"2026-08-07T13:13:05.082243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.760606Z","title":"Exploring The Loss Landscape Of Regularized Neural Networks Via Convex Duality https://openreview.net/forum?id=4xWQS2z77v","venue":null,"work_id":"6a62ab2d-90f4-41bf-bcda-2a4eb499e44d","year":2025},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.920365Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:d21fdf612e90bbcbeab228c7ae5a19b40ab477332861b4e8420f2b843a5ecd3d","observation_id":"eee97ce2-6b4e-4dad-983b-60b3b5db89fb","resolution":{"observed_at":"2026-08-07T13:13:04.832441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.531973Z","title":"Deep Linear Networks with Arbitrary Loss: All Local Minima Are Global http://proceedings.mlr.press/v80/laurent18a.html","venue":null,"work_id":"0e1ec4f0-fbdd-49f2-a020-2067e383d14f","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:57.982098Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4711bcd48fd12649829c1fca507ab03bac1566ea49c61dced3ba4548cb6d8bf7","observation_id":"2dc68690-56d3-48db-8bf9-d4c0fb558842","resolution":{"observed_at":"2026-08-07T13:13:04.610229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.387932Z","title":"Michaud, and Max Tegmark","venue":null,"work_id":"4870c99b-cf07-4074-a724-14eabe22a688","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.075285Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:cf6d7c8b3b5d4bc9fbe1860def5d637d6588fd2a04b479ce4d68947c80b1fc81","observation_id":"e05247a5-00b8-498d-a4fc-57a01db631b3","resolution":{"observed_at":"2026-08-07T13:13:04.456563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.225646Z","title":"Gradient Descent on Two-layer Nets: Margin Maximization and Simplicity Bias https://proceedings.neurips.cc/paper/2021/hash/6c351da15b5e8a743a21ee96a86e25df-Abstract.html","venue":null,"work_id":"a2af208a-121c-4072-aa8b-692b92446ba4","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.144580Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:c69e2f627f1fc19aaa509f1697e2c5217f3979bac7d2d67f61c25f7dc12a4073","observation_id":"79238af5-cf16-4216-898e-969faaaa50b1","resolution":{"observed_at":"2026-08-07T13:13:04.326855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.081028Z","title":"Lee, and Wei Hu","venue":null,"work_id":"275836de-b692-4d81-8bf9-c99f6088eef9","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.265403Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:61882a865f2cae04f931103f9322acc58c7adfea2722be215acc515159400d6a","observation_id":"7dcba60d-5130-4eb8-a06f-75bed81ef595","resolution":{"observed_at":"2026-08-07T13:13:04.151036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08367","last_updated":"2018-03-22T14:08:58Z","snapshot_observed_at":"2026-07-06T06:29:40.070023Z","submitted_at":"2018-03-22T14:08:58Z","title":"Gradient Descent Quantizes ReLU Network Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08367","snapshot_observed_at":"2026-08-07T13:12:58.348208Z","title":"Gradient Descent Quantizes ReLU Network Features http://arxiv.org/abs/1803.08367","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.348208Z"},"links":{"cited_paper":"/paper/1803.08367","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:31174eb3a6b4499c8e597fef67c6ff236a3d961e30d6a31ff33506339aafdb01","observation_id":"7f4f4e97-1a83-4c3e-95aa-f8f1cb223d96","resolution":{"observed_at":"2026-08-07T13:12:58.348208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:58.426905Z","title":"A mean field view of the landscape of two-layer neural networks 10.1073/pnas.1806579115","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.426905Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:8aa606a3dfff76590c60a3c0799b101034453c1d6ab42873398340f7db5667e1","observation_id":"bb55700f-f0c9-4f44-a56d-d5e518060c56","resolution":{"observed_at":"2026-08-07T13:12:58.426905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.876494Z","title":"Early Neuron Alignment in Two-layer ReLU Networks with Small Initialization https://openreview.net/forum?id=QibPzdVrRu","venue":null,"work_id":"a37ef39d-b299-474c-9c24-0b18bc0db4e7","year":2024},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.544465Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:cb8202b0671c1946fa5b3b56a4c7b83eaa4dff0e8cf4b629071842bc85f88e95","observation_id":"349c5a1b-fa92-42ed-b34e-603a66389385","resolution":{"observed_at":"2026-08-07T13:13:03.976474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.692654Z","title":"Optimal Sets and Solution Paths of ReLU Networks https://proceedings.mlr.press/v202/mishkin23a.html","venue":null,"work_id":"d8f07f35-68d6-46ae-ab99-7406450974a1","year":2023},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.664378Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:7e6b3c1be250f6eaa59f54285b2101f98af921dfebc4bdb9728b75372eb80c8c","observation_id":"279e937b-4b17-45e4-bad8-8d78436d72b9","resolution":{"observed_at":"2026-08-07T13:13:03.780828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6614","last_updated":"2015-04-16T18:48:31Z","snapshot_observed_at":"2026-08-04T18:00:43.680629Z","submitted_at":"2014-12-20T06:52:25Z","title":"In Search of the Real Inductive Bias: On the Role of Implicit Regularization in Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6614","snapshot_observed_at":"2026-08-07T13:12:58.738470Z","title":"In search of the real inductive bias: On the role of implicit regularization in deep learning 10.48550/arxiv.1412.6614","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.738470Z"},"links":{"cited_paper":"/paper/1412.6614","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a12f57a6a28fba04d0eb286032beefd064270d368a9a5d64603241d3591c7d94","observation_id":"14ad19bc-d854-492b-9efd-5753fc7dc9e5","resolution":{"observed_at":"2026-08-07T13:12:58.738470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.529962Z","title":"On Connected Sublevel Sets in Deep Learning http://proceedings.mlr.press/v97/nguyen19a.html","venue":null,"work_id":"a1a6a08f-5b2d-46ce-9789-58dfdd4a6f61","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.852854Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:05beaf949403c72906b2a87bafd242ecc52c64d8096f9b1e2c52df94b59c6686","observation_id":"7b1bb096-e0cc-491c-b36e-c123b365e76b","resolution":{"observed_at":"2026-08-07T13:13:03.632268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08576","last_updated":"2021-01-21T12:43:26Z","snapshot_observed_at":"2026-08-04T06:11:21.991101Z","submitted_at":"2021-01-21T12:43:26Z","title":"A Note on Connectivity of Sublevel Sets in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08576","snapshot_observed_at":"2026-08-07T13:12:58.964229Z","title":"A Note on Connectivity of Sublevel Sets in Deep Learning https://arxiv.org/abs/2101.08576","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:58.964229Z"},"links":{"cited_paper":"/paper/2101.08576","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:3e813ba01605e49610fb7f66b8d55262ee2867a4a43e9b1a02213ab22e2721da","observation_id":"9331022f-4f6d-48ce-b281-a344eee577ab","resolution":{"observed_at":"2026-08-07T13:12:58.964229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.374982Z","title":"When Are Solutions Connected in Deep Networks? https://proceedings.neurips.cc/paper/2021/hash/af5baf594e9197b43c9f26f17b205e5b-Abstract.html In NeurIPS, pages 20956--20969, 2021","venue":null,"work_id":"e90741e0-bb37-4301-b203-246c5464ff83","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.027410Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:fc6de8dd244e51bcddb5c631b6e9d32927ed8bd3be3776aff7038e26c83cb864","observation_id":"0d225fce-7953-4a55-ae08-b58b9f4cdc38","resolution":{"observed_at":"2026-08-07T13:13:03.463658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6258.35463","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.358737Z","title":"Banach space representer theorems for neural networks and ridge splines https://dl.acm.org/doi/10.5555/3546258.3546301","venue":null,"work_id":"23aefc9a-4cce-4ff4-b91b-2a820b42f7b0","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.146372Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:446434fded84c7f59407e19a2fbbb443acaa7676441483dbbbb447ede49c3d25","observation_id":"ded24de2-dbb3-4229-b5a3-351500f6c86a","resolution":{"observed_at":"2026-08-07T13:13:01.452769Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.189086Z","title":"Neural Networks are Convex Regularizers: Exact Polynomial-time Convex Optimization Formulations for Two-layer Networks http://proceedings.mlr.press/v119/pilanci20a.html","venue":null,"work_id":"080c145d-b60f-43e9-bc64-ac6e2a2211df","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.231078Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:a6fe8df90a1bcd33f975ef46b21d356b948612bff45738b5e391f1cf643a2d22","observation_id":"027e40ea-cedb-4cb4-bbe5-9e2f036d8106","resolution":{"observed_at":"2026-08-07T13:13:03.250869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02177","last_updated":"2022-01-06T18:43:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-06T18:43:37Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02177","snapshot_observed_at":"2026-08-07T13:12:59.316611Z","title":"Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets https://arxiv.org/abs/2201.02177","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.316611Z"},"links":{"cited_paper":"/paper/2201.02177","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:8d163025df6e290651149b68e66fd6c8fd5db46ba3dc202470b481ada6d6513c","observation_id":"af995fc2-0e66-43c6-827f-2fdf0ae520e5","resolution":{"observed_at":"2026-08-07T13:12:59.316611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.419770Z","title":"Trainability and accuracy of artificial neural networks: An interacting particle system approach 10.1002/cpa.22074","venue":null,"work_id":null,"year":1935},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.419770Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:052adccef84aff25f1c4a8e487d4d665994748c316e5c1fd4b5df2d6b6617d3d","observation_id":"147fe6d0-4954-400d-b601-98d8cdd4522c","resolution":{"observed_at":"2026-08-07T13:12:59.419770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.009540Z","title":"Spurious Local Minima are Common in Two-Layer ReLU Neural Networks http://proceedings.mlr.press/v80/safran18a.html","venue":null,"work_id":"26e971bb-c199-4805-8848-a79a76cb9131","year":2018},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.498281Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:33ba78f51c8507cd433c7e57112add3351ca6824a970fe979170b9744d198de9","observation_id":"a7b54f09-d21b-4f87-9ddd-80e61a9a7a81","resolution":{"observed_at":"2026-08-07T13:13:03.111915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.839677Z","title":"How do infinite width bounded norm networks look in function space? http://proceedings.mlr.press/v99/savarese19a.html In COLT, pages 2667--2690, 2019","venue":null,"work_id":"3e17b5df-595e-4cbe-aa66-906452927ff4","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.586553Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:487554391387a2139fdae10032dc7bd2ce5b7671f37208dfeec5dfe31b1cd4e8","observation_id":"f60e7662-4104-42ba-b431-718fd99987c1","resolution":{"observed_at":"2026-08-07T13:13:02.939431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.653892Z","title":"Understanding machine learning: From theory to algorithms 10.1017/CBO9781107298019","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.653892Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:d88fcd0de4c8ec9cb3e610853cbdc52eb0be1d23a39f1ac3a3db0f62a7bc0f68","observation_id":"52ee293f-9430-491e-915b-45413cc09286","resolution":{"observed_at":"2026-08-07T13:12:59.653892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.577198Z","title":"Jamaloddin Golestani","venue":null,"work_id":"4ff86b76-946c-4857-aab1-07ad480e817f","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.707457Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:3573ff105478eb1bbf39574768f8d294cc04fe8621a4f42de0285ed8c45ef022","observation_id":"3a176d66-6b8b-45b8-83d3-617a6339a7b5","resolution":{"observed_at":"2026-08-07T13:13:02.705425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.357842Z","title":"Geometry of the Loss Landscape in Overparameterized Neural Networks: Symmetries and Invariances http://proceedings.mlr.press/v139/simsek21a.html","venue":null,"work_id":"abfe1f58-037d-49b9-a2fd-ab29cecfabe9","year":2021},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.787288Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:69ffb4405ce4ab0f2fe971496b366728e98f9ad9eece04cc83a8b973e9127ba3","observation_id":"0855d4a2-ac27-4f9b-bfdc-55c07735c983","resolution":{"observed_at":"2026-08-07T13:13:02.467783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:12:59.866232Z","title":"The Global Landscape of Neural Networks: An Overview 10.1109/msp.2020.3004124","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.866232Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:1076851967057565b2b247c687eff903ce9028b23a9e27d74552d9fa15a60c9a","observation_id":"8fc4d611-2594-4d34-ab6c-1d366d687115","resolution":{"observed_at":"2026-08-07T13:12:59.866232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.180876Z","title":"Bandeira, and Joan Bruna","venue":null,"work_id":"c8de3167-cbf9-45e2-8433-decd24518210","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:12:59.972636Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4a47752fbcbb400b82552bee37b83cfba80eca96070c98d31c4822663645e9d2","observation_id":"42386525-5e0c-41b5-b985-efdf1ddaf1e1","resolution":{"observed_at":"2026-08-07T13:13:02.276608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.001090Z","title":"The Hidden Convex Optimization Landscape of Regularized Two-Layer ReLU Networks: an Exact Characterization of Optimal Solutions https://openreview.net/forum?id=Z7Lk2cQEG8a","venue":null,"work_id":"26b8d0b4-c7e5-4d7e-a4fa-d1045ca2be89","year":2022},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.068517Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:95afd38739742be6897ff2355b81001307a84d62136852d649f2bfed0db4a0c9","observation_id":"c461e396-90eb-48de-954c-3a24e8ad053d","resolution":{"observed_at":"2026-08-07T13:13:02.091759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13530","last_updated":"2020-05-27T17:54:17Z","snapshot_observed_at":"2026-08-04T19:21:23.556086Z","submitted_at":"2020-05-27T17:54:17Z","title":"On the Convergence of Gradient Descent Training for Two-layer ReLU-networks in the Mean Field Regime","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13530","snapshot_observed_at":"2026-08-07T13:13:00.129590Z","title":"On the Convergence of Gradient Descent Training for Two-layer ReLU-networks in the Mean Field Regime https://arxiv.org/abs/2005.13530","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.129590Z"},"links":{"cited_paper":"/paper/2005.13530","citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:daf982ce5698ed84bec4b6fca0db263ac8cfdd1383ef8e3638bc748a4a3c15e7","observation_id":"064d0a4b-9a0b-4ce9-a5ac-6bb0e04fee23","resolution":{"observed_at":"2026-08-07T13:13:00.129590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.787562Z","title":"Woodworth, Suriya Gunasekar, Jason D","venue":null,"work_id":"4f0b02a7-408e-4175-9aad-206dc5b2cd39","year":2020},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.191389Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:2e6ae34f105d632983fd9810980f4cbf5e21c6c456633f4f828b8b26846cfd7f","observation_id":"047842c8-cae0-4b6f-88e8-63aebf6436ef","resolution":{"observed_at":"2026-08-07T13:13:01.882611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.635999Z","title":"Small nonlinearities in activation functions create bad local minima in neural networks https://openreview.net/forum?id=rke\\_YiRct7","venue":null,"work_id":"623d02dc-55f1-4eb9-ac7d-485b59a2bf13","year":2019},"citing_paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:13:00.259466Z"},"links":{"citing_paper":"/paper/2505.22578"},"observation_digest":"sha256:4f40713bb037c9ab64c47d48fd47dbac1cb3368905e460b1042e6c03684e7944","observation_id":"a1e10686-1355-4d63-8293-7c13b534aa61","resolution":{"observed_at":"2026-08-07T13:13:01.699375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22578","last_updated":"2026-06-29T09:33:28Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:21:38.848840Z","submitted_at":"2025-05-28T16:53:48Z","title":"Favorability of Loss Landscape with Weight Decay Requires Both Large Overparametrization and Initialization"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":35},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2505.22578."}