{"as_of":"2026-08-07T21:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79901897717c7ab347603ff40a20b52be68c142ff18634c88dd529ebf6a1c807","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:47:36.321431Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:56.227441Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-07-06T09:01:12.515300Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"reference_index":196,"source":"arxiv_source","source_observed_at":"2026-05-21T10:30:58.601351Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2003.00295"},"observation_digest":"sha256:110860014b9f93b22cf387bc445331b739e182ddf00e577af359d1a8d63cd178","observation_id":"bccefbbd-be4d-4c98-8b61-1ba210c4253f","resolution":{"observed_at":"2026-05-21T10:30:58.754320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-07T13:47:36.321431Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21394","last_updated":"2025-05-27T16:23:23Z","snapshot_observed_at":"2026-08-07T13:26:22.747594Z","submitted_at":"2025-05-27T16:23:23Z","title":"Dual Averaging Converges for Nonconvex Smooth Stochastic Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:47:36.321431Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2505.21394"},"observation_digest":"sha256:1f8590b8e61e3c66338e8165c4d0247730e0e037862d068cfd644600c6f7b94b","observation_id":"08d1e229-8927-4b87-8566-90672bbda644","resolution":{"observed_at":"2026-08-07T13:47:36.321431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-07T12:32:07.720112Z","title":"On the convergence of adaptive gradient methods for nonconvex optimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24399","last_updated":"2025-05-30T09:28:38Z","snapshot_observed_at":"2026-08-07T12:21:00.636032Z","submitted_at":"2025-05-30T09:28:38Z","title":"LightSAM: Parameter-Agnostic Sharpness-Aware Minimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:07.720112Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2505.24399"},"observation_digest":"sha256:cc94936cfc8890e2e5a0dbdd37761b854a5436a6ffd6efc4c89cf37fb6145596","observation_id":"3f164c29-be32-4d24-9a0b-52ed3180529c","resolution":{"observed_at":"2026-08-07T12:32:07.720112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-07T11:40:11.956311Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01863","last_updated":"2025-06-02T16:52:51Z","snapshot_observed_at":"2026-08-07T11:30:04.158536Z","submitted_at":"2025-06-02T16:52:51Z","title":"Unified Scaling Laws for Compressed Representations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.956311Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2506.01863"},"observation_digest":"sha256:ad3c9722db34b2240f171b9e29151b086fd61991a3141e05d174a6165e8fa22f","observation_id":"87c234ca-22bf-4fd3-9933-f7575c503978","resolution":{"observed_at":"2026-08-07T11:40:11.956311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-05T11:25:45.073914Z","title":"t−1X τ=0 µτ ˜Et+1−τ ∗ # +µL t−1X τ=0 µτ E[max{ϵ, ηαt−τ }] ≤ µtκ√r√ b + (1−µ) √rE","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.073914Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:dacfb1180d0df7ccb4a0d747ff0ee781a674edf0ecaa95107ada04e106622348","observation_id":"450a164b-d7cd-4752-8a10-00037206b6d5","resolution":{"observed_at":"2026-08-05T11:25:45.073914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:3007f9266121549a779e0652cf479f88dca9cabaeb79f530c8cb05ff11ebc005","observation_id":"d3816d0f-3c14-4be1-a3be-b3d9ca3484b9","resolution":{"observed_at":"2026-05-18T15:56:34.125799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2604.08742","last_updated":"2026-04-09T20:09:24Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T20:09:24Z","title":"Adam-HNAG: A Convergent Reformulation of Adam with Accelerated Rate","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:24.402328Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2604.08742"},"observation_digest":"sha256:3ea5d2128e7a97ba1ed512d2d8d3b1f8b878abe9bcb4d890291afc627c976293","observation_id":"99e3d395-1878-45e9-9a30-e3f728ead727","resolution":{"observed_at":"2026-05-11T08:16:00.264734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":200,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:5aeca1ac8e595d8999a0fa457f8276a5e2c92ed0f6d6597436b684969baa2aae","observation_id":"2a3d186c-4a3d-418c-a054-8b6a9f3313a5","resolution":{"observed_at":"2026-07-02T07:06:44.983118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:1852f6b09117751cc0b810bf2cb3ec93e0ed6e68d8d7787628e57061ad486faf","observation_id":"ec4e2980-1b78-422f-abd2-a03388884ca0","resolution":{"observed_at":"2026-07-03T00:27:30.171233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":"1808.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-03T20:18:56.227441Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":"33dcf797-e9b2-41c6-8ecb-296eacbdd3a9","year":2018},"citing_paper":{"arxiv_id":"2606.17526","last_updated":"2026-06-16T05:10:29Z","snapshot_observed_at":"2026-07-06T23:53:07.149182Z","submitted_at":"2026-06-16T05:10:29Z","title":"MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:53.550342Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2606.17526"},"observation_digest":"sha256:36fcbff6825e08456bac318df6eea15450b2312b076df2651f7f0275192e62d8","observation_id":"932d527f-7689-4bfb-bd0d-c7d83dabc482","resolution":{"observed_at":"2026-07-03T20:18:56.228895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-07-12T00:07:55.485589Z","title":"arXiv preprint arXiv:1808.05671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03763","last_updated":"2026-07-04T08:31:49Z","snapshot_observed_at":"2026-08-07T12:54:26.891354Z","submitted_at":"2026-07-04T08:31:49Z","title":"FedACT: Federated Adaptive Coordinate Trust Modulation for Robust Transformer Training under Data Heterogeneity","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-12T00:07:55.485589Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2607.03763"},"observation_digest":"sha256:2f9c39b9470c6209b3425ab1e4a7767ca48fd348336455afc84ca139d9b582b6","observation_id":"1b01ec68-af3b-433f-9650-6f3a773a9610","resolution":{"observed_at":"2026-07-12T00:07:55.485589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1808.05671/citation-record","integrity":"/paper/1808.05671/integrity","json":"/paper/1808.05671/citation-record.json","paper":"/paper/1808.05671"},"outbound":[],"paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:1808.05671."}