{"as_of":"2026-08-09T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8aea72fb3ff57146510f7c57cccb6c70ddc59341c976d63a21da1f3fd734cee7","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:21:43.961303Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08360/citation-record","integrity":"/paper/2506.08360/integrity","json":"/paper/2506.08360/citation-record.json","paper":"/paper/2506.08360"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.539842Z","title":"Efficient full-matrix adaptive regularization","venue":null,"work_id":"933c6c01-ae59-4a37-87ed-61b2eeb94a15","year":2020},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.795541Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:b6f5a3c7f972e7ac53b04320404b27364573f6a97f2dc6e6f1053976f9dd5f03","observation_id":"894cbacf-f12d-4614-bd66-13dc020069d9","resolution":{"observed_at":"2026-08-07T05:21:44.544773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.800824Z","title":"Gradient descent on neurons and its link to approximate second-order optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.800824Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:d1204f6df11cb6106d5bc295054443124a95843747734bda67c17229144ca60f","observation_id":"503dd169-4cbe-4a26-a8e9-85e4355dc15a","resolution":{"observed_at":"2026-08-07T05:21:43.800824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.515775Z","title":null,"venue":null,"work_id":"0f6d30f6-ed84-4617-ae04-139c6fc1190e","year":1970},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.805068Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:8a3642909bfd94e189c61d803671fb6b20895047cbea6672ae8b7ac2ba0cf91b","observation_id":"8b5f130c-d1f1-42f5-9dd8-7fbdbc4972a0","resolution":{"observed_at":"2026-08-07T05:21:44.519838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.500775Z","title":null,"venue":null,"work_id":"2f90dfb1-9200-42ae-a1f8-a1a726f63a98","year":2019},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.809687Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:17c31725fa85ba5502d139466d300b20ed9342f4e9cfd26feedd0e075f465dd7","observation_id":"7647de9e-1f04-48f0-9de0-d06c5591c90c","resolution":{"observed_at":"2026-08-07T05:21:44.505846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.486354Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"fee7c1af-8106-47d8-81c6-2ffa69187164","year":2009},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.813999Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:7a8ff294d9baf909c599f22d802d9216531771d90d26034fe6ae6984157726ee","observation_id":"cfa1fd1b-94ad-47ff-8b33-dade0fd73526","resolution":{"observed_at":"2026-08-07T05:21:44.491363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.472287Z","title":"Fletcher","venue":null,"work_id":"85db6ac4-9e60-49ff-b0ff-6eda040e2a85","year":1970},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.818466Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:50d3bf62c410d8d4791085541306ba14b1298abf8b0f634417756237fdc66dfb","observation_id":"c2cd5995-36dd-4db4-8897-3b8d7794bb51","resolution":{"observed_at":"2026-08-07T05:21:44.476782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.457217Z","title":"Sketchysgd: reliable stochastic optimization via randomized curvature estimates","venue":null,"work_id":"976a6111-16a5-4ff7-b903-7fa16373d78a","year":2022},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.823285Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:16573d4c1afd22f66199a90d833f9e24074f3381846c317161944af7d39b3446","observation_id":"7dd34c60-11b4-45ed-9d28-290d8faf9dfa","resolution":{"observed_at":"2026-08-07T05:21:44.461977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.441576Z","title":"Tropp, and Madeleine Udell","venue":null,"work_id":"3a7deefb-bef2-431c-89ef-3b797fb7c6f8","year":2023},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.827309Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:dae8b80f7ed86eadcd125817dcec5ec5e0bbf234dc3d7fd1f0760935792b64da","observation_id":"5b2f41fe-959f-43e4-8265-14bef42c7301","resolution":{"observed_at":"2026-08-07T05:21:44.446090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.427676Z","title":"M-FAC: Efficient matrix-free approximations of second-order information","venue":null,"work_id":"12d98d79-e68e-4eb0-8139-b9fe4322142f","year":2021},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.831345Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:89ce80f75ec1f6d481d7158faf3a09297ae40f0859ef1115f5ab86e2719e6048","observation_id":"f122456a-c5fd-487f-a570-5702d7acbcdd","resolution":{"observed_at":"2026-08-07T05:21:44.431928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.412134Z","title":"A family of variable-metric methods derived by variational means.Mathematics of Computation, 1970","venue":null,"work_id":"4a984ab9-8dfe-45ef-9381-fe1aa7803096","year":1970},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.835071Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:ba29efdbf7f98c08da32753e9044a59df28a7cce49717e44e40bbe70510d301f","observation_id":"4d62d7fd-11bd-4cde-8fa8-e0ca96f860bb","resolution":{"observed_at":"2026-08-07T05:21:44.416976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.398140Z","title":"Practical quasi-newton methods for training deep neural networks","venue":null,"work_id":"6fff1949-7730-40fd-8d38-34ebb07abec4","year":2020},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.838948Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:cff37a6a884f056893d69a9efe3f62b260e4abaf716fedacde93ba1d8cff09f6","observation_id":"668e86af-09c0-4d69-bee2-5a2b63e5b655","resolution":{"observed_at":"2026-08-07T05:21:44.402382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.383685Z","title":"Girshick, Pieter Noordhuis, Lukasz Wesolowski, Aapo Kyrola, Andrew Tulloch, Yangqing Jia, and Kaiming He","venue":null,"work_id":"b589ddc8-4664-4585-9e83-b061d16d14aa","year":2017},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.842800Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:a2d5fed05bf2760a3011bd75ca9c01b743e22e7da0b8e6b635c3bee050c460e2","observation_id":"3be394f9-344e-4f0f-bef7-a867c634bfdb","resolution":{"observed_at":"2026-08-07T05:21:44.387964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.847078Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.847078Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:e62527478bda5b846f05d94b4251e73f249485dc9fdd0937c601645b310509aa","observation_id":"7ac955a6-59a2-43e6-ba46-aecb3de89c5f","resolution":{"observed_at":"2026-08-07T05:21:43.847078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.851051Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.851051Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:c93dbf593744a800d1fc033b2b2ab66737106f50b4bca2f8f34c4fde012e4377","observation_id":"969d0e74-c4b3-4d6f-9f58-fee0189b94c3","resolution":{"observed_at":"2026-08-07T05:21:43.851051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.350016Z","title":"Augment your batch: better training with larger batches","venue":null,"work_id":"d68d0e71-e938-400d-8ac1-1216471402c3","year":2019},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.855352Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:f34f241148af6c39f4345b6e208e3e185196d7da016c91c8a09a946628a82be2","observation_id":"640a7efc-5f90-42c0-b26f-978e61eaf16b","resolution":{"observed_at":"2026-08-07T05:21:44.354294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.334739Z","title":"Train longer, generalize better: closing the generalization gap in large batch training of neural networks","venue":null,"work_id":"ed6334d5-14e6-4c99-80ac-cacd5f66dc40","year":2017},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.859814Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:ffc8cf2be51f2b507f401842fda5bdf729ba6d9f92735f9993d9603debeab91f","observation_id":"0b207aae-d426-4425-9cc5-08f9af165e66","resolution":{"observed_at":"2026-08-07T05:21:44.339600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.320819Z","title":"Weinberger","venue":null,"work_id":"41eecba0-b1ee-4095-aff6-91dc467a63a6","year":2016},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.863763Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:d9eff794a73a4037a8d438b751727f8e481c5b692aef8f1c3f86d2febd8f547f","observation_id":"ff858c24-0277-4f07-ac48-c132bd715248","resolution":{"observed_at":"2026-08-07T05:21:44.325121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.304918Z","title":"Weinberger","venue":null,"work_id":"a74fa1f3-205b-4648-9e5a-fccbc1074f5b","year":2016},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.867688Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:057bafb4df92b4908e4be7d4ce1af5d3f0345c10b05273c01d7a64c0d3862ad1","observation_id":"fc2bfd1c-d938-499b-b15b-e1ce46e297bf","resolution":{"observed_at":"2026-08-07T05:21:44.310715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.871532Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.871532Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:b8b0f81f96036ce988c582a2fdfea026dec6463d645ba504022facfd01b9d6e1","observation_id":"3343c7e4-8acb-408b-b8f4-29781ac582e8","resolution":{"observed_at":"2026-08-07T05:21:43.871532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.875571Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.875571Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:cc523494d3434d5deff56235cdc525bf3d4c1d9f02017a24e01dfd39b5f9757f","observation_id":"12996438-b785-4774-af47-9f5f3e2850ff","resolution":{"observed_at":"2026-08-07T05:21:43.875571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.879933Z","title":"Lecun, L","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.879933Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:3426c527ebb388b47fbf519d314fc7db9fc777da0e233d8c1fee3a2ec725e90b","observation_id":"a143749b-51c4-4829-83a6-e05adfd361e2","resolution":{"observed_at":"2026-08-07T05:21:43.879933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.261486Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":"fddfe34d-9656-4759-995c-81b010b84605","year":2024},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.883709Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:553d0ce42f02b885d14437aaa49cb146a5de718a33b3d4d26040f88fa2977bb4","observation_id":"a2acc989-28f9-4026-b611-8f0b0ce5f2d5","resolution":{"observed_at":"2026-08-07T05:21:44.265838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.247360Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"7f30a670-9771-4345-a0fe-c07f01aaf9d0","year":2016},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.887881Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:54324e3be34b0fb563a85b66cd642dbca7abc30d39d47eb0e28c495f2ddd3d74","observation_id":"65fefbdb-e643-4921-b935-5fbb15b83c06","resolution":{"observed_at":"2026-08-07T05:21:44.251522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.891971Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.891971Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:ddf551923e5cadee4aa17355760d4fa76c5caefe316af18ce9df599bcd802499","observation_id":"2d64b463-123b-41d7-8f66-4e19b4cfb1e3","resolution":{"observed_at":"2026-08-07T05:21:43.891971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.896266Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.896266Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:70d369c182ff63a6be31b72e2dc4fdaaed362aed8209d075519a5001fc88fc63","observation_id":"270ecbdb-7fc1-46ba-aca9-b866c95678a5","resolution":{"observed_at":"2026-08-07T05:21:43.896266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.212887Z","title":"Müller and Frank Hutter","venue":null,"work_id":"5a252a06-fb05-49d5-a0d6-81f2839f7ee7","year":2021},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.900125Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:cd6c244479a2ead95590edd6be8cf42f019a70325d372dee91ff43944c5e4830","observation_id":"0dee1a5a-6d05-479a-a22b-7abe4eba278d","resolution":{"observed_at":"2026-08-07T05:21:44.217318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.198834Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"9cb6a276-502c-4ffd-8d67-0848fce6af8e","year":2019},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.904031Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:bacdfe695669ed223b63cf877ce790fa84d1a6e5cf8b3e7f4eaf630b25d68f8a","observation_id":"f902bb00-4b53-433c-beb6-b769e3f39c69","resolution":{"observed_at":"2026-08-07T05:21:44.203425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.184265Z","title":"Sublinear time approximation of text similarity matrices","venue":null,"work_id":"eb30a690-68a3-4b71-ac31-0bc40440514a","year":2021},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.908243Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:8614e4b8a152c1646f96648bc2e94b30bb54be95a3911b7a99401ca6e78c13fb","observation_id":"6c741606-3c12-417d-8f2a-10f01c926df0","resolution":{"observed_at":"2026-08-07T05:21:44.188722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.169033Z","title":"A stochastic approximation method","venue":null,"work_id":"10ee7c34-fd7a-4602-af68-4d0982dc9396","year":1951},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.912357Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:6b6a8b3eeb8308406ae76eb716cc16070627d78213732a3f056a8bcc170ce0ae","observation_id":"d2798688-a2df-4571-b600-6f1417088129","resolution":{"observed_at":"2026-08-07T05:21:44.173580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.155356Z","title":null,"venue":null,"work_id":"c64b34c8-31c9-46df-a15b-e23e41b2ea6c","year":1970},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.916557Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:11f9547f873ec98dafb78a9f15354b9d5ef82f3fafd071361827a3557757d1ef","observation_id":"99dfc4d4-0a85-4cad-929f-507c6f94d191","resolution":{"observed_at":"2026-08-07T05:21:44.159582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.141484Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"d08b9d1f-f607-4571-8516-dc9c2ec3b3b0","year":2015},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.920714Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:1d7ca568201273e53ea73120a6bdfff17af3f566099a4baf88259168ea11e2f4","observation_id":"df231b7a-0fb6-4a59-ae0f-650dc8e78a6f","resolution":{"observed_at":"2026-08-07T05:21:44.145671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.127296Z","title":"Skfac: Training neural networks with faster kronecker-factored approximate curvature","venue":null,"work_id":"f4f9cc79-5a9f-454c-8036-ff9797c5d798","year":2021},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.925020Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:2e008c6d163a5a132cfc2061a4cab824174666ae6339eb84f1561ce3e3858ad2","observation_id":"b4111d9a-78c2-4644-9b44-96103589a2c1","resolution":{"observed_at":"2026-08-07T05:21:44.131566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.111780Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"97d51188-a72c-44ec-91e5-110291889691","year":2020},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.928859Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:fa05becdcb54c7b59013a8022ed15eb69b76d5dc3b25311b8741fd9fe4c80bbb","observation_id":"f26a976c-b8d8-4fe8-bca3-8244c150dd17","resolution":{"observed_at":"2026-08-07T05:21:44.117185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.096789Z","title":"Better SGD using second-order momentum","venue":null,"work_id":"9bea3c78-15d3-4324-832c-a65ee24556c6","year":2022},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.932795Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:837433ed1e323e9053c5539a788b991ad1086b8eded30dcca93cbc5ccc05a1bf","observation_id":"fe7b1a5a-e061-4569-9c67-ae728ea2b5f1","resolution":{"observed_at":"2026-08-07T05:21:44.101439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.081702Z","title":"Tropp, Alp Yurtsever, Madeleine Udell, and V olkan Cevher","venue":null,"work_id":"3d731349-5ae8-4447-9faa-d676fd6eed87","year":2017},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.936714Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:a3c8ef5a3c2500fa8dbf8c6c719201cc770e53e204225986f202e29fbb718ffc","observation_id":"9cc146dd-74d2-4665-a2a0-01eac1b73ca5","resolution":{"observed_at":"2026-08-07T05:21:44.086402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.067468Z","title":null,"venue":null,"work_id":"83483ed5-78b3-4a0f-95f7-e763028ef52a","year":2000},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.940691Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:b46052764abac472ab1187891d770d245089f63b395668c2154b00aaa7de7784","observation_id":"f14b78de-52a6-4ebf-9d0c-b4dc3ffff3e7","resolution":{"observed_at":"2026-08-07T05:21:44.071795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.051685Z","title":null,"venue":null,"work_id":"74878e9a-6e23-4247-9157-fd71578a926f","year":2020},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.944718Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:8387f6939ba1a2e578a244da6bc7aa5bce853d823a3124cbcbbcbbbbc053d9fd","observation_id":"809a5bca-1f83-4580-98a3-c8fe4eda8196","resolution":{"observed_at":"2026-08-07T05:21:44.056168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.036959Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"87bd3b7b-d599-4cb2-8d3e-a0966b233eab","year":2019},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.949005Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:ec43c45e3865a0e51333d36bca17a36979affee18d40930a15326c4438a4831f","observation_id":"1ae7991a-f570-4c81-b07a-5859e0a914a4","resolution":{"observed_at":"2026-08-07T05:21:44.041577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.952989Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.952989Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:4c05258b4c88baafc235bed5be68ad7cc7a299b67a119551686ba854bb90c8a2","observation_id":"d8024c27-cedd-4df6-9153-2146a12c6bcc","resolution":{"observed_at":"2026-08-07T05:21:43.952989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:44.010453Z","title":"Eva: Practical second-order optimization with kronecker-vectorized approximation","venue":null,"work_id":"c0c6be0d-658a-4042-8e51-e7d4879fef0c","year":2023},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.957365Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:53065af6726e27274df3091f203a7db94a3e32a8cff776594b397fc61db4bb2b","observation_id":"0186fdc4-0fc5-4727-b45c-0bbece7eb254","resolution":{"observed_at":"2026-08-07T05:21:44.014992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:43.993088Z","title":"Random erasing data augmentation","venue":null,"work_id":"1ccbb49c-aedd-4688-8d67-539126c0efe8","year":2017},"citing_paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:21:43.961303Z"},"links":{"citing_paper":"/paper/2506.08360"},"observation_digest":"sha256:817cfd29e0f112810f4ca5c2e70f07e4b89ad79f879fa54d7b396f944f0b0469","observation_id":"2ec94dc4-bb78-40cd-89c9-2a0745b1adbe","resolution":{"observed_at":"2026-08-07T05:21:43.999866Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08360","last_updated":"2025-06-10T02:18:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:10:43.620304Z","submitted_at":"2025-06-10T02:18:08Z","title":"NysAct: A Scalable Preconditioned Gradient Descent using Nystrom Approximation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.08360."}