{"as_of":"2026-08-10T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d870261314e51f7aee000bae46a8efc91b6a5a0c7e0461fee1bd73c2110a649","coverage":[{"denominator":124,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:47:40.728250Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:23:02.017903Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01763","snapshot_observed_at":"2026-08-02T05:49:26.668562Z","title":"arXiv preprint arXiv:2502.01763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:26.668562Z"},"links":{"cited_paper":"/paper/2502.01763","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:a7f358194d1031a48a4442cc6aa47d9e39c5f769555d2827c1da51ddd5c7f207","observation_id":"c594bbe2-d8d7-4cec-bd63-908906f78eb9","resolution":{"observed_at":"2026-08-02T05:49:26.668562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01763","snapshot_observed_at":"2026-08-04T04:23:02.017903Z","title":"arXiv preprint arXiv:2502.01763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T04:23:02.017903Z"},"links":{"cited_paper":"/paper/2502.01763","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:c8e248e7abdc12fd88a52d3e57a997d4da573e7de0d53a7cfcfebf3e27afceed","observation_id":"5512bc06-639e-46bb-ac2b-6717516fa8eb","resolution":{"observed_at":"2026-08-04T04:23:02.017903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01763/citation-record","integrity":"/paper/2502.01763/integrity","json":"/paper/2502.01763/citation-record.json","paper":"/paper/2502.01763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.304467Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.304467Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e23e4b4776fcae1e2072a702003f2e873fd383ccbcbbca1eef8b23eb467464ac","observation_id":"bce02749-8550-4b65-9051-fb87ac1530e8","resolution":{"observed_at":"2026-08-09T14:47:40.304467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.309277Z","title":"B., and Misiakiewicz, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.309277Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:fd048c89771d4bcb76563e43038b31e2902cced956da4805386c7841d67cd8b7","observation_id":"7193376e-7dd6-48c3-b2a8-b33e0f8e89e2","resolution":{"observed_at":"2026-08-09T14:47:40.309277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.313480Z","title":"B., and Misiakiewicz, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.313480Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:31cd3645f374b524c0e9e13691bd36aed404fba95cf97b2efa5099ffd16dd072","observation_id":"2f320a98-16b5-4740-b412-3c65974b592d","resolution":{"observed_at":"2026-08-09T14:47:40.313480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.317319Z","title":"Optimization algorithms on matrix manifolds","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.317319Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f1bd549cd5fc117f7a78959943f4e67f65596ccfb568759724d37ebd67e41bd0","observation_id":"1f82431a-f5ef-45a0-919a-6a9adada6074","resolution":{"observed_at":"2026-08-09T14:47:40.317319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.321442Z","title":"and Pennington, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.321442Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1e5f1f5f24039b9bf8d480990f88c171a15ac53cfad9588c0ef77ffa19634641","observation_id":"de925ca4-f8c1-4d47-bbbd-fa25391ce57f","resolution":{"observed_at":"2026-08-09T14:47:40.321442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.325138Z","title":"and Parrilo, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.325138Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:56dd5e0fe72e4b0075350f9653e8b9ecab12823ecf90947c12f0838cc6d7ef67","observation_id":"fbb44cb4-3cd9-4723-9b84-6abc71b8a4a4","resolution":{"observed_at":"2026-08-09T14:47:40.325138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10732","last_updated":"2020-12-08T19:12:44Z","snapshot_observed_at":"2026-08-10T11:28:20.275496Z","submitted_at":"2020-06-18T17:57:26Z","title":"When Does Preconditioning Help or Hurt Generalization?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10732","snapshot_observed_at":"2026-08-09T14:47:40.329559Z","title":"When does preconditioning help or hurt generalization? arXiv preprint arXiv:2006.10732, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.329559Z"},"links":{"cited_paper":"/paper/2006.10732","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d7cdf8a41c2e01786a1be48dec40db63dfd8a4bcd7797fbfc53da264c3674d55","observation_id":"bc46bb90-4b9e-4c1f-8db1-4c69c55aa12b","resolution":{"observed_at":"2026-08-09T14:47:40.329559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.334202Z","title":"Locoprop: Enhancing backprop via local loss optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.334202Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:afdb4e256603f01a06687ed7ccca27ae822408027d580f202b8e457bde664bb1","observation_id":"4d693f72-8cd8-44b1-b08b-cd2ea91164e3","resolution":{"observed_at":"2026-08-09T14:47:40.334202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-09T14:47:40.338674Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.338674Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:fc67f31b33bf66e146879b3672fbdbe3cae482e14ee18362bbfe25c352219e87","observation_id":"f6ee63cb-87d5-46c8-b7e5-4bfbe809579d","resolution":{"observed_at":"2026-08-09T14:47:40.338674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15459","last_updated":"2025-02-10T09:33:48Z","snapshot_observed_at":"2026-08-05T15:27:10.774229Z","submitted_at":"2024-05-24T11:34:31Z","title":"Repetita Iuvant: Data Repetition Allows SGD to Learn High-Dimensional Multi-Index Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15459","snapshot_observed_at":"2026-08-09T14:47:40.343242Z","title":"Repetita iuvant: Data repetition allows SGD to learn high-dimensional multi-index functions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.343242Z"},"links":{"cited_paper":"/paper/2405.15459","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:58f9292d0e2635b33f2a6c0b941a9f328a1bdcee20e6e153df1069e03bc7119e","observation_id":"10a1e903-c85c-402b-b5c9-ed75f1db0ffd","resolution":{"observed_at":"2026-08-09T14:47:40.343242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.348170Z","title":"Implicit regularization in deep matrix factorization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.348170Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:69c485ea8fbc6da7bb92532797c2ed9d89d465bb4fc5f3968fba231f0151675e","observation_id":"ffc32a11-37db-4fb2-84a0-6b7db5fd17ad","resolution":{"observed_at":"2026-08-09T14:47:40.348170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.354122Z","title":"B., and Martens, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.354122Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:3b19bc5a2bf962d88f7721f068902383a303b52354eda17cd28deaa6a7524018","observation_id":"9e0fea14-736a-46a7-85e0-4113327f6a78","resolution":{"observed_at":"2026-08-09T14:47:40.354122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.361665Z","title":"A., Suzuki, T., Wang, Z., Wu, D., and Yang, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.361665Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:912b0e77ebb3ba76a35874ba55b91dd5ea53a5d30b4777653749f746e3b94a96","observation_id":"b3f1fec8-b5c5-4e6a-bedc-373c61660763","resolution":{"observed_at":"2026-08-09T14:47:40.361665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.367830Z","title":"A., Suzuki, T., Wang, Z., and Wu, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.367830Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:6c5ce8222fc9caa257697a5c10cf8550a0bd470e2446d3bbb7df711eea89573e","observation_id":"b5fb6e65-fc38-4903-9e15-552dc4f0c857","resolution":{"observed_at":"2026-08-09T14:47:40.367830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.372639Z","title":"Scaling laws of optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.372639Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d19dc1dbe6fa25b6d6fd271bd456b5f6959871e01cf3d9d5fcfa50802e166129","observation_id":"07808b72-662a-4e0d-aa38-38a34939e8f9","resolution":{"observed_at":"2026-08-09T14:47:40.372639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.377075Z","title":"and Lee, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.377075Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4859522842c1bdf806ce87204634b62588c920cf52ceb7ef832914ba5de8cb7c","observation_id":"872b33da-ce0b-410a-b93f-b550286e9611","resolution":{"observed_at":"2026-08-09T14:47:40.377075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.381857Z","title":"Hidden progress in deep learning: SGD learns parities near the computational limit","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.381857Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:41ca276cf2d3dcaa7a2930ff4ad9ac874a7032cc02f23007dd05039dddf2c17c","observation_id":"67f30173-e43f-4a91-89fa-d175b3d5ef5c","resolution":{"observed_at":"2026-08-09T14:47:40.381857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.386686Z","title":"Online stochastic gradient descent on non-convex losses from high-dimensional inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.386686Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f2398124a0d5992ce29e3d96d2d95558d473fb189622e738cf725e8e8c7f5b6a","observation_id":"298c1374-61c3-40f4-a042-331e08af5ff4","resolution":{"observed_at":"2026-08-09T14:47:40.386686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.391577Z","title":"Gradient descent on neurons and its link to approximate second-order optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.391577Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1319f522dea8e05eb8f1289774afcf7534d857927c8774cbebba6f7da226147f","observation_id":"cfa5e545-948c-440d-b037-85207d68765e","resolution":{"observed_at":"2026-08-09T14:47:40.391577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-10T11:25:39.006498Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-09T14:47:40.399031Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.399031Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e3fef63c99d2ad8d42b0a1217eb342765048af9cfd497a49d847dd418780dff0","observation_id":"e104b005-4fdb-4942-9cd6-7ff6a9ed5fc9","resolution":{"observed_at":"2026-08-09T14:47:40.399031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-09T14:47:40.403483Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.403483Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e6aab5a143141b0d1ebaa503012e653164c6ea983c6733c34297fac773468bbc","observation_id":"b146c1de-38bf-40c4-a319-a6fd06b40fd3","resolution":{"observed_at":"2026-08-09T14:47:40.403483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.408891Z","title":"Learning time-scales in two-layers neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.408891Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:8d5c6a523333248efc79ca98008a115e603c263a63ffe5cb15b3b504ba811c12","observation_id":"a64b08e4-4b17-473d-8c9e-329c965a33c7","resolution":{"observed_at":"2026-08-09T14:47:40.408891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.412814Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.412814Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:0bd3d14d555ba5d54839059b4570dfdda20552b4b121dec12ae8b3c1d7284db6","observation_id":"1fbfaf72-6a26-49b0-88a2-c72effb17601","resolution":{"observed_at":"2026-08-09T14:47:40.412814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.418425Z","title":"and Mondelli, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.418425Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d078a04333caccf79fc6aa48578814bc3b8c778097eb8a9e6bd8803034646fec","observation_id":"30f40d95-194f-4b0e-a58f-bead24c7b0b2","resolution":{"observed_at":"2026-08-09T14:47:40.418425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14787","last_updated":"2025-05-27T20:36:47Z","snapshot_observed_at":"2026-08-10T11:25:02.843968Z","submitted_at":"2024-10-18T18:01:11Z","title":"Privacy for Free in the Overparameterized Regime","version":2},"cited_work":{"arxiv_id":"2410.14787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14787","snapshot_observed_at":"2026-08-09T14:47:42.495361Z","title":"Privacy for Free in the Overparameterized Regime","venue":"stat.ML","work_id":"6f96ef27-a68a-4964-b61a-ed9556bca306","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.422681Z"},"links":{"cited_paper":"/paper/2410.14787","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:8a78b3295c0c0da7d407f262c92ac41befc77d44816f9c60cba4705c0f288790","observation_id":"bf328dcd-c6a2-4e14-8f98-9b2938b8b042","resolution":{"observed_at":"2026-08-09T14:47:42.500114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.428124Z","title":"Beyond the universal law of robustness: Sharper laws for random features and neural tangent kernels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.428124Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b2206596d6795030e9e67bda09a95c82765b759fe5cf94ab225f3ad718a40f2b","observation_id":"517db258-d052-4692-875b-96881237575e","resolution":{"observed_at":"2026-08-09T14:47:40.428124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.432156Z","title":"Practical Gauss- Netwon optimisation for deep learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.432156Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f2f1c1babb16afb4864a2d5f83b04a1ef1968b305ec81ccee4c2441a730825ec","observation_id":"8a41c11c-128f-4786-90a2-a04690a6f33b","resolution":{"observed_at":"2026-08-09T14:47:40.432156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.435829Z","title":"H., Hansen, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.435829Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:78380eb0d003a0acdab6528c1381caf1b35bd1dd97ca7affd9ac2dc1a3db7173","observation_id":"d8ade78a-5882-4f91-9a98-047061157a6e","resolution":{"observed_at":"2026-08-09T14:47:40.435829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11675","last_updated":"2019-09-25T15:28:33Z","snapshot_observed_at":"2026-08-10T11:24:55.287566Z","submitted_at":"2019-05-28T08:30:24Z","title":"Gram-Gauss-Newton Method: Learning Overparameterized Neural Networks for Regression Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11675","snapshot_observed_at":"2026-08-09T14:47:40.439889Z","title":"Gram-Gauss- Netwon method: Learning overparameterized neural networks for regression problems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.439889Z"},"links":{"cited_paper":"/paper/1905.11675","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:f7ba33f280dedaaf727115390e865df8dfffac56d00eddc50d349f1f0e7e6a05","observation_id":"e9f04798-4a48-4bab-a702-aa64104d58f7","resolution":{"observed_at":"2026-08-09T14:47:40.439889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.443948Z","title":"Exploiting shared representations for personalized federated learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.443948Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4c3361566f1fb0da015d8f55fc26a2f593ff34283dd4b371ec36be5ce487061f","observation_id":"dcdce652-6755-4296-acbc-cf9716c7fb7f","resolution":{"observed_at":"2026-08-09T14:47:40.443948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.449327Z","title":"Provable multi-task representation learning by two-layer ReLU neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.449327Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d9dde131dd6c83eb2fc80d1ab421a96e5ac41ad4180ecca402f41fc316bd10af","observation_id":"5d5657af-e725-4a2b-a3a8-09f1b66ba8d6","resolution":{"observed_at":"2026-08-09T14:47:40.449327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.453841Z","title":"Asymptotics of feature learning in two-layer networks after one gradient-step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.453841Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:aa9ba5098b01e1143ffc724de3396c428a7dd415c1979f9ee75b45a709aa9c3a","observation_id":"256b669c-b153-4ee5-b57c-08d152b1bdbc","resolution":{"observed_at":"2026-08-09T14:47:40.453841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07179","last_updated":"2025-06-18T11:00:36Z","snapshot_observed_at":"2026-08-10T11:26:12.337520Z","submitted_at":"2023-06-12T15:21:02Z","title":"Benchmarking Neural Network Training Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07179","snapshot_observed_at":"2026-08-09T14:47:40.457590Z","title":"E., Schneider, F., Nado, Z., Agarwal, N., Sastry, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.457590Z"},"links":{"cited_paper":"/paper/2306.07179","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d51db1d682eeefcae2701e42b06bc6fb3d59750012409e2c2f3a0123d1b46092","observation_id":"fa88d2c3-f48e-4033-8299-440b908b08ec","resolution":{"observed_at":"2026-08-09T14:47:40.457590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.462358Z","title":"Neural networks can learn representations with gradient descent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.462358Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a75f2944144961ce2dc5f4621752746f1a9141b19a00599ce722305a12d7ad65","observation_id":"b1bbd743-58fa-4b98-93d6-9628fe76a564","resolution":{"observed_at":"2026-08-09T14:47:40.462358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.466603Z","title":"How two-layer neural networks learn, one (giant) step at a time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.466603Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:41a5971c72913cfb4e4d26f2787e9108278013a7e7b59b6889f152deb530b732","observation_id":"22cf088e-f81b-41dd-8090-046e598c859a","resolution":{"observed_at":"2026-08-09T14:47:40.466603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18938","last_updated":"2024-10-24T17:24:34Z","snapshot_observed_at":"2026-08-10T00:03:27.002170Z","submitted_at":"2024-10-24T17:24:34Z","title":"A Random Matrix Theory Perspective on the Spectrum of Learned Features and Asymptotic Generalization Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18938","snapshot_observed_at":"2026-08-09T14:47:40.471320Z","title":"M., and Loureiro, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.471320Z"},"links":{"cited_paper":"/paper/2410.18938","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:287c81c1eba81b0b4b809cf063bf54fe300370e0aa4774cbbe9e9ce7785baa35","observation_id":"84927feb-beac-4eb3-a64a-d1fe23e2c2bf","resolution":{"observed_at":"2026-08-09T14:47:40.471320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.475810Z","title":"The benefits of reusing batches for gradient descent in two-layer networks: Breaking the curse of information and leap exponents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.475810Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:823d15ee9e8d469a07ae2e1176a932bf1052b28944253cc950108fadb2d770b4","observation_id":"7e01e8de-9c7e-4716-afc4-6d14356ae73b","resolution":{"observed_at":"2026-08-09T14:47:40.475810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.480451Z","title":"Modular block-diagonal curvature approximations for feedforward architectures","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.480451Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:0967c719ed8611e35eef3749f8187ee675fe74aa428db123747f30a07dbd57ed","observation_id":"73454c87-a7f4-4455-9fd0-ed35153d6aec","resolution":{"observed_at":"2026-08-09T14:47:40.480451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08100","last_updated":"2024-07-11T00:10:35Z","snapshot_observed_at":"2026-08-09T22:04:18.191604Z","submitted_at":"2024-07-11T00:10:35Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08100","snapshot_observed_at":"2026-08-09T14:47:40.486358Z","title":"Non-convergence of Adam and other adaptive stochastic gradient descent optimization methods for non-vanishing learning rates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.486358Z"},"links":{"cited_paper":"/paper/2407.08100","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e32a165624cded8bb01b7fc946438ae042de971ff2e8fc06e06ab36bfb42ea4b","observation_id":"6866259e-82f7-440b-84eb-964097cfc13f","resolution":{"observed_at":"2026-08-09T14:47:40.486358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.490862Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.490862Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:aff6c61ddb0e2d3b782bbf33c9cd0669ea8c73949f1e01791b0b9dbe91b4cc41","observation_id":"c762e9fa-410a-40ba-8934-edbd513acfc9","resolution":{"observed_at":"2026-08-09T14:47:40.490862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.495605Z","title":"and Wager, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.495605Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:3f49299f68e678ee3341e4bd46fffbad1908abc5c6ec06f80e06f1b58ccf0e25","observation_id":"25d7dbda-a607-4810-85b7-8cb65679855e","resolution":{"observed_at":"2026-08-09T14:47:40.495605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.500141Z","title":"S., Hu, W., Kakade, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.500141Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:53ac888633887b9e2c295f7a0c5084b5cff436d10c202ca53c67f92432cd56ac","observation_id":"15c500be-be2a-4cc5-a5e2-fa8686a15c2a","resolution":{"observed_at":"2026-08-09T14:47:40.500141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.505091Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.505091Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c06f8820016dad02506ab9093db4755f3aa3423d80c43d3cafd427ec78f31c54","observation_id":"bc16ca31-d1cc-4744-85a8-393eb048238e","resolution":{"observed_at":"2026-08-09T14:47:40.505091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.509479Z","title":"Proximal backpropagation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.509479Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:3813b9d894a6a31e9b7bc096040092e2d5d349017a0fec0d417919f2230d0c42","observation_id":"ff4ce0d6-8580-4bcf-8fab-76c3c9ef8204","resolution":{"observed_at":"2026-08-09T14:47:40.509479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17201","last_updated":"2024-11-26T08:14:48Z","snapshot_observed_at":"2026-08-10T11:26:21.971305Z","submitted_at":"2024-11-26T08:14:48Z","title":"Learning Hierarchical Polynomials of Multiple Nonlinear Features with Three-Layer Networks","version":1},"cited_work":{"arxiv_id":"2411.17201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17201","snapshot_observed_at":"2026-08-09T14:47:42.438358Z","title":"Learning Hierarchical Polynomials of Multiple Nonlinear Features with Three-Layer Networks","venue":"cs.LG","work_id":"e114caf1-18ae-49ec-99ab-24bd737bdf2a","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.513091Z"},"links":{"cited_paper":"/paper/2411.17201","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5b5bc1093562a44b623dd38c01ea28f9e6dcca89ea7c7eda92f45143348906f8","observation_id":"c99f2b0f-2772-4e15-9be3-6dcaa37c2bb9","resolution":{"observed_at":"2026-08-09T14:47:42.442595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.516867Z","title":"Linearized two-layers neural networks in high dimension","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.516867Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:036518d4580986af6cf7efb44b823f42062117b148b278e2f1d4029e8c75c50a","observation_id":"252bdf19-c590-4bbc-9cd7-29e0d50eb381","resolution":{"observed_at":"2026-08-09T14:47:40.516867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.520374Z","title":"When do neural networks outperform kernel methods? Journal of Statistical Mechanics: Theory and Experiment, 2021 0 (12), 2021 b","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.520374Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:3fca276d78c6b887a87722eb51ff503c8c092e26f40740be3328baf307b45618","observation_id":"f7931c78-ba89-4082-85ee-c5923442b1b1","resolution":{"observed_at":"2026-08-09T14:47:40.520374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.524058Z","title":"A family of variable-metric methods derived by variational means","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.524058Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e3ac5ab1d4cb1a833e8e7e9476ff5de17fa75693d4003d8d46b2f8dfdd999847","observation_id":"85e99ff8-1046-4e3e-a3f8-18dd3eafd38e","resolution":{"observed_at":"2026-08-09T14:47:40.524058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.528448Z","title":"Practical quasi- Netwon methods for training deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.528448Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c4b31c1d46b6525099ad929a8f6a37a2ba4aa5d7a3ea571a8b5e6053f5213124","observation_id":"82c83bb6-3165-4b28-9f16-a163af501fd2","resolution":{"observed_at":"2026-08-09T14:47:40.528448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.533185Z","title":"The G aussian equivalence of generative models for learning with shallow neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.533185Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4f3d25f5488b0a9578e1ea567cb6897b1542ceacff4c5abe5097367030a54fe6","observation_id":"abe35d8f-a5d0-4268-8cc0-5d98c753aa40","resolution":{"observed_at":"2026-08-09T14:47:40.533185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14055","last_updated":"2023-10-21T16:23:59Z","snapshot_observed_at":"2026-08-10T11:27:04.906886Z","submitted_at":"2023-10-21T16:23:59Z","title":"Spectral Phase Transitions in Non-Linear Wigner Spiked Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14055","snapshot_observed_at":"2026-08-09T14:47:40.537284Z","title":"Spectral phase transitions in non-linear wigner spiked models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.537284Z"},"links":{"cited_paper":"/paper/2310.14055","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:133165049cb0a619c5188b47d92ef8e226675b9c73abdab50441dd6a6e947748","observation_id":"e457abdd-3640-4945-8bb9-6fc4db3ca515","resolution":{"observed_at":"2026-08-09T14:47:40.537284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.541398Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.541398Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:0f2bb12c5e918145e4a54b4c7736263689c39d8ce9bb5df690e69cc3284ac388","observation_id":"421b455b-ee73-471f-a4a2-ca042e11dd29","resolution":{"observed_at":"2026-08-09T14:47:40.541398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.545269Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.545269Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a14de203ba48d37d459b49224286104927483195fefceced76a426fea5b5a85c","observation_id":"8126d448-d040-4a49-b6ac-1eff22992fcd","resolution":{"observed_at":"2026-08-09T14:47:40.545269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.548962Z","title":"and Nica, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.548962Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:d5773f47281a5c22a4c7d1f9196f8fc66d878d303dd569155a4dc98bc2d5275b","observation_id":"bcebb231-9ae7-4250-bd93-c2e08d1f1d6d","resolution":{"observed_at":"2026-08-09T14:47:40.548962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.552782Z","title":null,"venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.552782Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:79d47446689fc073427f85041b3242e6eb5823aba8470504b5e21e8bac26f9de","observation_id":"5a6fb108-5b8d-4047-90f3-6f33e8decf73","resolution":{"observed_at":"2026-08-09T14:47:40.552782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.556647Z","title":"and Javanmard, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.556647Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4cd9dfdb1f7251a84ee5b34a2459d22edf5026159e2b662b141f6a8dc7f5fc0e","observation_id":"f2471c44-e407-4422-923a-84655537715f","resolution":{"observed_at":"2026-08-09T14:47:40.556647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.560608Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.560608Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:76894d6004b506785dbc162cfe4904f1f84e5f6aba373ed978ced1dd47ee1ee7","observation_id":"29217597-fb3d-4d51-ae01-90ea07e95239","resolution":{"observed_at":"2026-08-09T14:47:40.560608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.211484Z","title":"M., and Zhang, T","venue":null,"work_id":"50946303-e0f9-4edd-ad69-618953ca3478","year":2012},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.564868Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:2777171fc898ff7df76487bff6a6a2a193498a1efb6af962be610cb241008882","observation_id":"9c12a425-d4ce-4403-aaf6-f07e0d3354ab","resolution":{"observed_at":"2026-08-09T14:47:43.215635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.197169Z","title":"and Lu, Y","venue":null,"work_id":"36ad3309-c894-462f-b8b6-1fe7c865b25f","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.568825Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:19bb5c43f9560f3fdcdb7efed4e072de7416a8521c0f54629a51e00714192982","observation_id":"bc7af867-b87f-45f9-adec-00bdf6d797ae","resolution":{"observed_at":"2026-08-09T14:47:43.201443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.184878Z","title":"and Szegedy, C","venue":null,"work_id":"c4ae6710-4c3b-4183-bcb8-b6d83659b0ce","year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.572424Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b95162ff8726e483c1090083958e54d0e071e97622d01f9f50b058f1faf1d2fb","observation_id":"f54e91de-1899-4096-adac-1fae999788d5","resolution":{"observed_at":"2026-08-09T14:47:43.188677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12226","last_updated":"2024-06-08T08:45:12Z","snapshot_observed_at":"2026-08-06T03:17:03.846308Z","submitted_at":"2023-12-19T15:12:39Z","title":"On the Parameterization of Second-Order Optimization Effective Towards the Infinite Width","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12226","snapshot_observed_at":"2026-08-09T14:47:40.576362Z","title":"and Karakida, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.576362Z"},"links":{"cited_paper":"/paper/2312.12226","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:952970e785cf64a7b30fa02f8866510aff117d4593e885caf43d951ce848bc04","observation_id":"f9d9e5e1-2cef-4e89-836f-81fc90171b64","resolution":{"observed_at":"2026-08-09T14:47:40.576362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.172230Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":"cd28a444-2183-448a-8917-7dc222db1cfd","year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.580605Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:204dd77b5cb453b204aeb6455748788a1736dcc20c4d72a70d3bbe3a2f05d41b","observation_id":"690ad69d-fb90-4bbb-b54e-8173f53389ed","resolution":{"observed_at":"2026-08-09T14:47:43.176504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.158330Z","title":"Low-rank matrix completion using alternating minimization","venue":null,"work_id":"dc121db3-947f-4ed4-b4ed-c2bdb6ca0308","year":2013},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.584397Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:95538a31874742220deaaea3748f25a3cae8abaa8c6b034014897ad69b0b2c09","observation_id":"1279429c-1794-4140-be6d-178de71424b7","resolution":{"observed_at":"2026-08-09T14:47:43.163081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.143599Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"4fa6197d-b14a-401f-88e4-ec9a556057e2","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.589217Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:57b3762f992aa10478c0a2d9a8be5a82289ddfe5fb23a1ecc987d5c2b563621d","observation_id":"026a4f86-c81a-4f80-9bd7-24b01f956401","resolution":{"observed_at":"2026-08-09T14:47:43.147831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07628","last_updated":"2017-12-20T18:34:08Z","snapshot_observed_at":"2026-08-07T18:27:25.346124Z","submitted_at":"2017-12-20T18:34:08Z","title":"Improving Generalization Performance by Switching from Adam to SGD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07628","snapshot_observed_at":"2026-08-09T14:47:40.593164Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.593164Z"},"links":{"cited_paper":"/paper/1712.07628","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c8c430c634df30d3425d1b5aa1c97c15847a94a250aa368e20e13a01eae3e180","observation_id":"e77cab59-85e7-4356-b651-1126434c3d34","resolution":{"observed_at":"2026-08-09T14:47:40.593164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.597248Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.597248Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:7c4397b88c5eb306d74eacb5eaee0e173b08ebe3bfab376406fb5ef056e897d0","observation_id":"652e5d86-f409-41c7-ae50-3cc85dabc55a","resolution":{"observed_at":"2026-08-09T14:47:40.597248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.118786Z","title":"M., Ma, T., and Liang, P","venue":null,"work_id":"2e20b296-c57b-4429-80fc-8194ab9125c2","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.601177Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c4635f4e33694fcbee24aff8abaf702ba7c25668424ab64bc6a31fcc6be065cd","observation_id":"869a9e7f-5c29-4588-8006-ceb7733b6b02","resolution":{"observed_at":"2026-08-09T14:47:43.123219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14813","last_updated":"2024-05-23T17:23:30Z","snapshot_observed_at":"2026-08-10T06:23:17.427470Z","submitted_at":"2024-05-23T17:23:30Z","title":"Scalable Optimization in the Modular Norm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14813","snapshot_observed_at":"2026-08-09T14:47:40.604767Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.604767Z"},"links":{"cited_paper":"/paper/2405.14813","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:37be4b740c13867f5106ab60f590e6611f047cf9d9d31162875fa080888b01b1","observation_id":"72e137fb-aec8-4d12-af33-abbead0af4b2","resolution":{"observed_at":"2026-08-09T14:47:40.604767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.105410Z","title":"and Massart, P","venue":null,"work_id":"c015076a-86dc-4def-8cc6-2f159b67f232","year":2000},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.609198Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:36beab85d383edb51af5eee5a9d54e3a27a25f5a2e2b446b5109f6eca4401b91","observation_id":"836c0b76-eeb2-4ac8-8076-2ae655001634","resolution":{"observed_at":"2026-08-09T14:47:43.109668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.092456Z","title":"Demystifying disagreement-on-the-line in high dimensions","venue":null,"work_id":"25ce2bd8-d81b-477d-9839-de91c623bfc3","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.613267Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:6db876eec508e963f8e45e40b1a5a18b41741224f6af31f14dcd180b7e4e43fa","observation_id":"f975a99a-dee8-4548-9e66-394fcce7a653","resolution":{"observed_at":"2026-08-09T14:47:43.096942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01581","last_updated":"2024-12-22T09:59:09Z","snapshot_observed_at":"2026-08-10T11:25:39.474518Z","submitted_at":"2024-06-03T17:56:58Z","title":"Neural network learns low-dimensional polynomials with SGD near the information-theoretic limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01581","snapshot_observed_at":"2026-08-09T14:47:40.617364Z","title":"D., Oko, K., Suzuki, T., and Wu, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.617364Z"},"links":{"cited_paper":"/paper/2406.01581","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:6a56050a051df716057172c0c12114279f034e734c643b7f7cb41aedd2739375","observation_id":"4a46ccb1-c848-4c3b-ae50-394da2df9736","resolution":{"observed_at":"2026-08-09T14:47:40.617364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.080167Z","title":"S., Tajwar, F., Kumar, A., Yao, H., Liang, P., and Finn, C","venue":null,"work_id":"b9304870-416e-40e4-8fc4-16327e6e8977","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.621410Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1d59bf38b00a4c99e9afd54dd38cf43e155ee5378e3f9689f92dd24ff6433217","observation_id":"c7f7b1aa-9db5-41af-b91c-70601291b98c","resolution":{"observed_at":"2026-08-09T14:47:43.084316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.066165Z","title":"and Dobriban, E","venue":null,"work_id":"e59c5b99-b20a-441c-97fd-3bcc467aaa19","year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.624853Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5572c0e5f7a6bdd1797b8369d8a741f5dc36637b9a52736d106d4b7fafcca33c","observation_id":"367733f4-e4ea-4cee-bbcc-fb3d3563caa0","resolution":{"observed_at":"2026-08-09T14:47:43.070732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.053183Z","title":"E., and Makhzani, A","venue":null,"work_id":"8d37231a-2e34-4059-83ea-bb92280c8f33","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.628536Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5f8b55a1ddaa02f08a2deb83d5b300a41799e6ce19af5f13ab0c8b8ee9e4d1ca","observation_id":"b12ff897-c3ca-4236-9049-ae560dbd4a27","resolution":{"observed_at":"2026-08-09T14:47:43.057485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.632426Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.632426Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:e782101c93eb28ff1d100c547745a0c34c236188be08580043dead3ef59acf0c","observation_id":"388f6a38-5390-42c8-9c6d-1631db713a18","resolution":{"observed_at":"2026-08-09T14:47:40.632426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.032879Z","title":"Deep learning via Hessian -free optimization","venue":null,"work_id":"4a8ced4d-3897-48fd-b362-e3dbd444d0b9","year":2010},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.636203Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:34f91530dacc927aec84199a3fe278e0b86025f9e3195aa777337bc3e050cdf7","observation_id":"d154584e-0edb-45c6-8104-9eb67556d371","resolution":{"observed_at":"2026-08-09T14:47:43.037180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.640176Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.640176Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:1f6b182c6237bd02bd4d9eb4496f0935aa887553e9d6d5d49a8a7670e4258a47","observation_id":"a8a14744-97ca-4df6-982b-504df2350ef7","resolution":{"observed_at":"2026-08-09T14:47:40.640176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:43.013085Z","title":"and Grosse, R","venue":null,"work_id":"f64288bd-6c3c-4bea-bc50-654b06e5c05c","year":2015},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.643973Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a4b5993612b4dd13967c8fe7329e4135b49aacd29244cd8cecb04fb1dca9cd49","observation_id":"d26dd43c-c00c-44eb-99e2-7541db46b928","resolution":{"observed_at":"2026-08-09T14:47:43.016984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.999475Z","title":"The benefit of multitask representation learning","venue":null,"work_id":"87a70c02-0a59-406d-9425-98a9d1e22ce6","year":2016},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.647750Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:69f8f295dec432769ddc453a2dd963344e93ab45bd6648cb7929d3ce89e6ec45","observation_id":"ea6facc4-7413-47de-9477-bb75f5272864","resolution":{"observed_at":"2026-08-09T14:47:43.004539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.651377Z","title":"and Montanari, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.651377Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:92ff205e46ae8991d802f32ba9709320bec30ac79d26fe0bea5643017002c1e6","observation_id":"ca064cd8-24a5-4eff-a8e5-82afb1ec2bed","resolution":{"observed_at":"2026-08-09T14:47:40.651377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.979839Z","title":"Announcing the results of the inaugural AlgoPerf : Training algorithms benchmark competition, 2024","venue":null,"work_id":"4216a635-3add-4e65-a98e-2efcc489222d","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.655175Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b9fee6a3d862dbe278ecae6574c2c2e77ba707477f46a0bb0fd2874e61534626","observation_id":"72c85b7c-06ff-4720-8cb5-7bc8c702ff7c","resolution":{"observed_at":"2026-08-09T14:47:42.984276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03702","last_updated":"2024-12-07T21:32:39Z","snapshot_observed_at":"2026-08-10T11:24:52.315181Z","submitted_at":"2024-12-04T20:31:47Z","title":"Asymptotics of Linear Regression with Linearly Dependent Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03702","snapshot_observed_at":"2026-08-09T14:47:40.658970Z","title":"and Hassani, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.658970Z"},"links":{"cited_paper":"/paper/2412.03702","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:38ef3782292bd9e3d915633ffda9bcca31de24c34a128430dfba8086f6bb7f1a","observation_id":"dfc3bb58-f64e-4136-8191-d2ceed24bcf8","resolution":{"observed_at":"2026-08-09T14:47:40.658970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18274","last_updated":"2024-05-28T15:24:35Z","snapshot_observed_at":"2026-08-10T11:26:12.535235Z","submitted_at":"2024-05-28T15:24:35Z","title":"Signal-Plus-Noise Decomposition of Nonlinear Spiked Random Matrix Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18274","snapshot_observed_at":"2026-08-09T14:47:40.662641Z","title":"and Hassani, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.662641Z"},"links":{"cited_paper":"/paper/2405.18274","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:455371dfbe870ee63abea9c70ac9d955f20c0f3317908c202af3d96a87eb6951","observation_id":"49b4fddf-ba51-4679-b613-98ca54407e0b","resolution":{"observed_at":"2026-08-09T14:47:40.662641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.967756Z","title":"A theory of non-linear feature learning with one gradient step in two-layer neural networks","venue":null,"work_id":"d137561c-ac50-40ea-b5eb-8ee619d46749","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.666465Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:9aca84024fefeac435bd6825ffa10bc9ad622db6311b6f874bced2dd9d06c63b","observation_id":"dc3c028a-32bc-490d-b3cb-245003e03137","resolution":{"observed_at":"2026-08-09T14:47:42.971707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01544","last_updated":"2023-03-22T16:53:25Z","snapshot_observed_at":"2026-08-10T11:27:40.320564Z","submitted_at":"2019-11-05T00:15:27Z","title":"The generalization error of max-margin linear classifiers: Benign overfitting and high dimensional asymptotics in the overparametrized regime","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01544","snapshot_observed_at":"2026-08-09T14:47:40.669988Z","title":"The generalization error of max-margin linear classifiers: High-dimensional asymptotics in the overparametrized regime","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.669988Z"},"links":{"cited_paper":"/paper/1911.01544","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:c6c47ae247e4c18ab21820c18573a5e3af0bf9a0d40f490d5201b56c5b92af75","observation_id":"cd2205b1-aa50-48c0-b8f3-5eb254c2b041","resolution":{"observed_at":"2026-08-09T14:47:40.669988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-10T11:27:04.225227Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-09T14:47:40.673899Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.673899Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4a47b7344ee0e5dc1001fde768db49c90377ae8ecac826790e3c63037a3d9d1d","observation_id":"c3a67bcd-ac56-446b-b883-d372f0cb6099","resolution":{"observed_at":"2026-08-09T14:47:40.673899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.955715Z","title":null,"venue":null,"work_id":"43245962-d98f-4c49-add7-d1b1713c0e09","year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.678103Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:9e350bc6596159cb090b8cf6e0b9c9793fce51259633bd4c07cfc593231f0034","observation_id":"5c6387ee-d047-4a34-8b20-226e3634757a","resolution":{"observed_at":"2026-08-09T14:47:42.959520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21696","last_updated":"2025-02-27T06:07:09Z","snapshot_observed_at":"2026-08-10T11:24:37.152154Z","submitted_at":"2024-10-29T03:27:08Z","title":"The Effects of Multi-Task Learning on ReLU Neural Network Functions","version":4},"cited_work":{"arxiv_id":"2410.21696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21696","snapshot_observed_at":"2026-08-09T14:47:42.205894Z","title":"The Effects of Multi-Task Learning on ReLU Neural Network Functions","venue":"stat.ML","work_id":"8167b706-a440-481a-94de-1d1d03db15c8","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.681743Z"},"links":{"cited_paper":"/paper/2410.21696","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:88ced1bce004501d5355349e7263cb566f1caa59f6078dbbfeba64568c280cc7","observation_id":"cd8868c1-1a99-41ee-9b96-5036ab4b028c","resolution":{"observed_at":"2026-08-09T14:47:42.212659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.943525Z","title":"and Vaswani, N","venue":null,"work_id":"b7dce5fb-2bbe-401f-87c9-8378008978d7","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.685732Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:a20a346605639aecb578e9a105e341ff8ef609ad9bedf2c5ea7f54adc4ba9ae5","observation_id":"e8b91276-6fb6-4dcf-b223-3a0ebf4c5970","resolution":{"observed_at":"2026-08-09T14:47:42.947872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.931613Z","title":null,"venue":null,"work_id":"d59a3762-951d-4c12-b96d-b2b6714c9249","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.689591Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5cbf13067de3ba216df473d93acd1e209a49587e5baae75fe9096a07a67b6ad6","observation_id":"231319a4-4634-44bb-b4b2-d86129a81411","resolution":{"observed_at":"2026-08-09T14:47:42.935618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.918168Z","title":null,"venue":null,"work_id":"2dba342a-81fa-46f4-85d5-ee2b0c2df700","year":2024},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.693289Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:b4543127307b3916b9539768db843e603609d026a2830978f3e45ddacb7adec5","observation_id":"842238ef-a75e-4a88-8da8-3d2c4826019e","resolution":{"observed_at":"2026-08-09T14:47:42.922094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.696612Z","title":"and Wright, S","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.696612Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:9413befd8eca942ef611d10b1c89b813ddd92ac230c6e21b54898e7d244e7e04","observation_id":"59412849-2ae1-4f39-9488-9994150bfc71","resolution":{"observed_at":"2026-08-09T14:47:40.696612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:40.700012Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.700012Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:4743400eedd3a110fe6347524029cb9bfbd60533720312be4c6db342d274324e","observation_id":"c8c6eed3-3c23-4b61-98ce-4e57ab071899","resolution":{"observed_at":"2026-08-09T14:47:40.700012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.892758Z","title":"and Recht, B","venue":null,"work_id":"92039b22-eecd-4589-a6ea-06db119133d7","year":2007},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.704030Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:14aa516edc215f9b01b10a57ce2410a1a806ebfaf3124ac855887d1b23691162","observation_id":"cb2ddf47-a413-4315-88d7-fc3902713327","resolution":{"observed_at":"2026-08-09T14:47:42.896569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.880775Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":"a012d1b9-d50f-44f1-b70a-0a65f602af5a","year":2018},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.708947Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5b2df2e70a54d8608f7b8e63a5cc494ee548682c59a9fd62938aa9486acdad62","observation_id":"d88406f9-136f-404b-a8b6-3ccc80639d69","resolution":{"observed_at":"2026-08-09T14:47:42.884738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.868527Z","title":"and Vershynin, R","venue":null,"work_id":"2de420b5-3e27-42ad-b005-d899eff88234","year":2013},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.712662Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:bebd6a88d0e089e1b02517c644dfa1af7cdd9bf220e74786cdf1b2688b0227bb","observation_id":"af7d01e1-2641-4f1c-a187-18c9bc667570","resolution":{"observed_at":"2026-08-09T14:47:42.872327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.857652Z","title":"M., Schneider, F., and Hennig, P","venue":null,"work_id":"c0d11325-d466-4910-8294-de0ce00dbceb","year":2021},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.716403Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:8a40e5b999aae990237acdd2f3c216e362330e43047639919ce29110aaefc8b2","observation_id":"fd2c4366-ab72-4c83-92f8-fe022a0627a5","resolution":{"observed_at":"2026-08-09T14:47:42.861461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.846988Z","title":null,"venue":null,"work_id":"4803a07a-e623-45b5-a5cb-910fa3f1faca","year":2002},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.720427Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:5fe8bcc7b2f14847433f8a17d83d1cfeded9fedfd83d3c8f0fa2daf0caf3bf3a","observation_id":"6e58c8ab-04e5-466d-9273-3cf1e012a7ed","resolution":{"observed_at":"2026-08-09T14:47:42.850858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06497","last_updated":"2023-09-12T18:11:10Z","snapshot_observed_at":"2026-08-05T09:31:11.684666Z","submitted_at":"2023-09-12T18:11:10Z","title":"A Distributed Data-Parallel PyTorch Implementation of the Distributed Shampoo Optimizer for Training Neural Networks At-Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06497","snapshot_observed_at":"2026-08-09T14:47:40.724257Z","title":"M., Lee, T.-H., Iwasaki, S., Gallego-Posada, J., Li, Z., Rangadurai, K., Mudigere, D., and Rabbat, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.724257Z"},"links":{"cited_paper":"/paper/2309.06497","citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:700596f6d7e629ddf4bdb4cd72d016b65e5e803ab6396dc16a4d9e31588cafcd","observation_id":"5ce83e7f-3c9c-4240-9c0a-ed5c29df1bf1","resolution":{"observed_at":"2026-08-09T14:47:40.724257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:47:42.834121Z","title":"A theoretical analysis on feature learning in neural networks: Emergence from inputs and advantage over fixed features","venue":null,"work_id":"afa35e0f-8185-424b-bd0c-b12662b4de17","year":2022},"citing_paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-09T14:47:40.728250Z"},"links":{"citing_paper":"/paper/2502.01763"},"observation_digest":"sha256:50e5771bf2c7fe14a58e4c50fafc6922f5d912851b193efdcd1a407489011c10","observation_id":"c59315d4-4c51-4e1b-a509-6f4a23834c4f","resolution":{"observed_at":"2026-08-09T14:47:42.838365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01763","last_updated":"2025-02-03T19:08:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T11:24:38.785549Z","submitted_at":"2025-02-03T19:08:32Z","title":"On The Concurrence of Layer-wise Preconditioning Methods and Provable Feature Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":124},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 124 outbound references and 2 inbound Pith citation observations for arXiv:2502.01763."}