{"as_of":"2026-08-08T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a4bec7a2b4fb95992d8cb1aac424135b7f5b5e1ea2a23b6ae7c0d110c22ba70","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:17:10.648494Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08464/citation-record","integrity":"/paper/2506.08464/integrity","json":"/paper/2506.08464/citation-record.json","paper":"/paper/2506.08464"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.180108Z","title":"Natural gradient works efficiently in learning.Neural Computation, 1998","venue":null,"work_id":"14e2f970-908f-47c1-be15-1a8142e5f90b","year":1998},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.485816Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:bd538ac22141604fd9ffde9d1b3a965f52d601a1acf2d56d3c7ffbfda5e92211","observation_id":"1d46f501-35ee-49cf-8e55-3bb8092121ca","resolution":{"observed_at":"2026-08-07T05:17:11.183909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.168197Z","title":"Distributed second-order optimization using kronecker-factored approximations","venue":null,"work_id":"fe6738aa-aaca-43ea-ae27-e7304a88b461","year":2016},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.490105Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:8ea573f885897af88313798c96102ac2ff7ecf8c6bd3f6949b1bf066b1cb561b","observation_id":"fd8ab8c3-ec7d-41c0-b00c-4fc2096278de","resolution":{"observed_at":"2026-08-07T05:17:11.173034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.156448Z","title":"Gradient descent on neurons and its link to approximate second-order optimization","venue":null,"work_id":"05af7cf4-af37-4afb-b471-de3694299a3f","year":2022},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.493737Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:47125b14c57de7870bcbb7cbf490fea9ea00c4765aae927950b9538fbe14dc52","observation_id":"fb5cc6da-3356-4ac6-9535-1e70c4e00804","resolution":{"observed_at":"2026-08-07T05:17:11.160512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.144230Z","title":"Multi- grain: a unified image embedding for classes and instances.ArXiv, 2019","venue":null,"work_id":"f2fce8e8-3886-41ff-8b39-71511d82a195","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.497207Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:21a484807274ecc71f71ef7f2995eeff68e22bdc06f9fb812eadccf152ff628d","observation_id":"db03ea9b-f366-4beb-a448-779e715d8a9d","resolution":{"observed_at":"2026-08-07T05:17:11.148698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.132723Z","title":null,"venue":null,"work_id":"0d92e9e1-6b2b-45d6-9c20-0083cd10e3e2","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.500760Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:21f3e94a84672f4dd3fcc0ec5e514d68970494f704b0e81c122b08d05965c2af","observation_id":"2507826a-2b4e-4332-a5f6-cfb53162469e","resolution":{"observed_at":"2026-08-07T05:17:11.136375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.122851Z","title":"Li, and Li Fei-Fei","venue":null,"work_id":"eb9383a4-e7d3-4092-91c6-42092cb292eb","year":2009},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.504000Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:b6b4bb10d11e4442fd5526ea019ca24eda047c59eb939a8597ded0085a0d2029","observation_id":"e279aae1-1835-4dbc-8e70-149fbde4df02","resolution":{"observed_at":"2026-08-07T05:17:11.126108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.111905Z","title":null,"venue":null,"work_id":"2ccd46ad-25d0-47f2-a2c0-727116a9b3b0","year":2017},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.507553Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:668e067e57e40bb15c40551838966fc7f7bf5d694c8e5c146bf66206ee36fefc","observation_id":"29f0c084-ae66-4b35-a59c-ce920dfd0e75","resolution":{"observed_at":"2026-08-07T05:17:11.115477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.510537Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.510537Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:9d77fb74c67867189d74a601b4318c20897ef5c4e59afb9858d6282b59bf79c6","observation_id":"f3842598-2fc7-4240-80c1-440c08b00a2f","resolution":{"observed_at":"2026-08-07T05:17:10.510537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.095134Z","title":"Du, Xiyu Zhai, Barnabas Poczos, and Aarti Singh","venue":null,"work_id":"b56731a5-0346-4bcd-86af-60be71a7781c","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.514043Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:b851fe9b56e722dd4d2af368f964606b81a15d889f8daf57f61c3c3f5a08f84d","observation_id":"afa57dc8-0175-4c51-86ef-89ff4dbc3b08","resolution":{"observed_at":"2026-08-07T05:17:11.098893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.084096Z","title":"M-FAC: Efficient matrix-free approximations of second-order information","venue":null,"work_id":"17f2d005-33a8-4529-88b2-643a4fac840f","year":2021},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.517058Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:18a1c85202bc9f4fbf4bead101fa4710c9b1b267cb37d1e9903437e341d8204b","observation_id":"a61b3621-2467-4aea-af47-1d8862517141","resolution":{"observed_at":"2026-08-07T05:17:11.088216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.071839Z","title":"Practical quasi-newton methods for training deep neural networks","venue":null,"work_id":"4967ebc9-50f9-441b-9203-355eaac711e0","year":2020},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.520983Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:38fe0628b731c1df9d17a8ed12d1af21f442ee5adbb01ffd2f9b9233f3b99c18","observation_id":"b3f7c73d-139c-4ff5-b2d0-85e8e904d632","resolution":{"observed_at":"2026-08-07T05:17:11.075885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.058024Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"4a1a5cba-9e78-4175-a667-f1946999d53b","year":2018},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.524768Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:22cb8dec6ed79376a7d97bf8176641e6ae2f2192bde7ba98dde069369e4e35d2","observation_id":"4f6b391b-fb66-41ca-9d6d-ef9ec3a7f99a","resolution":{"observed_at":"2026-08-07T05:17:11.062853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.043411Z","title":"Deep residual learning for im- age recognition","venue":null,"work_id":"d0af94c8-4781-45be-ba66-cfa8751ea842","year":2016},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.529308Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:0fcabfad96ab47d1f88897ea754ea770c272aa9503ad915ffce1ec0facd20a54","observation_id":"0483b3c9-5c9c-452b-b839-47e73a804f8c","resolution":{"observed_at":"2026-08-07T05:17:11.047835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.030281Z","title":"Augment your batch: better training with larger batches.ArXiv, 2019","venue":null,"work_id":"46509ea5-ad15-4c99-a327-2702da75564e","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.534102Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:d4ea6360c7a69d01addf844c2ce02957d2cffd823ec350028e6707d735044c6a","observation_id":"ce042a25-2eff-45b2-97be-78c979801fa6","resolution":{"observed_at":"2026-08-07T05:17:11.034445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.017947Z","title":"Weinberger","venue":null,"work_id":"ffd3c816-b31e-4bd7-b140-8cbbb6f3c4ba","year":2016},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.538195Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:37fbaa615c04f0850d6d0b34b7fe022c201abe571da9599ba7b91419aa053b30","observation_id":"81b97ce0-b87f-4812-888a-8ed869b860fc","resolution":{"observed_at":"2026-08-07T05:17:11.022047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:11.004866Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"edb33f7d-3edb-4878-8598-a019d3d3168d","year":2015},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.541969Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:0ba1c4db841e71f408ec2f676b388880955dc799489f72b7d9fc21f389b34ff0","observation_id":"e9d2e296-baf4-44f1-b615-0ac742666e09","resolution":{"observed_at":"2026-08-07T05:17:11.009568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.991413Z","title":"Efficient approximations of the fisher matrix in neural networks using kronecker product singular value decomposition.ESAIM: Proceedings and Surveys, 2023","venue":null,"work_id":"c1982975-b5be-44fd-ba80-716f714ca324","year":2023},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.545595Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:4692b8dfd5c24d7cbad1475f12d381575cf79cc09216ef58361147597a00fd38","observation_id":"d8883a3b-4e46-47ee-880d-cc00a2538cea","resolution":{"observed_at":"2026-08-07T05:17:10.996028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.549214Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.549214Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:fe70a20b901a7f4fbd943551c37cd5002a121011609e82c7c9fef8dae9488ed2","observation_id":"a1dae585-622f-4782-982d-5249fef9a7de","resolution":{"observed_at":"2026-08-07T05:17:10.549214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.553501Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.553501Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:72c531b349f169b3b7275049ad211ae5f388b98a27c1f74aeb4afc48fab07f79","observation_id":"9c2895e6-7635-4f2f-ba93-6ed852c9d0b1","resolution":{"observed_at":"2026-08-07T05:17:10.553501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.964379Z","title":"Lecun, L","venue":null,"work_id":"99c6f3c5-aa01-452d-85f1-cb3431e3cecb","year":1998},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.557483Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:1ae0e6a0aa6a1d67ab19629d13b5b4e0ed91fc94258e62ad722330dc73fcf005","observation_id":"72a43a52-db8b-40c4-87c1-4838e415eb63","resolution":{"observed_at":"2026-08-07T05:17:10.968227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.950515Z","title":"Turner, and Alireza Makhzani","venue":null,"work_id":"84e910f2-cad7-4209-a334-4d094e0fb7a0","year":2023},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.561431Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:d2aaa4b57615ec9286c16d50574d412b1a6f6f3a08555d83cd0b766af168906c","observation_id":"610ae801-5e74-4c37-baa0-f87bf4cbdb4c","resolution":{"observed_at":"2026-08-07T05:17:10.955338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.937949Z","title":"Simplifying momentum-based positive-definite submanifold optimization with applications to deep learning","venue":null,"work_id":"bc016884-9286-42fd-936b-eb63475fbed2","year":2023},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.565491Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:b02a86a779d623620c6b1a8857687c0573487da172b95121a8be22edb7b04afc","observation_id":"026d9955-f059-4d68-9eeb-543d45d4eb42","resolution":{"observed_at":"2026-08-07T05:17:10.942068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.925859Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":"4c0f6538-41c5-4a7c-9c1f-fd34a0c1a4c5","year":2024},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.569378Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:9a231b442092174d4a346dc930ef498205cee13ef812a3a358a830b5c1b35f8e","observation_id":"2847cd46-050c-401c-9ccc-5bba07e6db22","resolution":{"observed_at":"2026-08-07T05:17:10.929722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.913928Z","title":"A layer-wise natural gradient optimizer for training deep neural networks","venue":null,"work_id":"1a25cec4-5d08-45f1-a755-f3ece23cc1cf","year":2024},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.572935Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:d4e17a3b1f7fe699e96b16371e025f991a7f502912ab31c8eac26e806ea56d68","observation_id":"ee5c025c-d299-4716-a86f-8e5827735f28","resolution":{"observed_at":"2026-08-07T05:17:10.918243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.901643Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows.IEEE/CVF International Conference on Computer Vision (ICCV), 2021","venue":null,"work_id":"07e3e252-df8f-40a0-b253-6aa00fe165bc","year":2021},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.576542Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:3764d8d36c6f3df25c21fc55819558c7f8a0e90d33845f5a02ea21944b4d3ee7","observation_id":"372145ab-023f-4386-891a-5526e080c927","resolution":{"observed_at":"2026-08-07T05:17:10.905993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.889853Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"c3414683-0bc7-4487-bd9a-b6b855d2ff1b","year":2016},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.580349Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:83d7763c44d7ff5adda8c3395731f6807101f281de3bdf4f0247dc64014a0eb0","observation_id":"698d7088-7771-429f-b9f6-98a85e909a8d","resolution":{"observed_at":"2026-08-07T05:17:10.893695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.583971Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.583971Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:32c268966b6ab0b4280a41360b3863d9193d779dc2136b32252f886067f84790","observation_id":"6da05896-a062-4115-b31b-8a8e61370c8f","resolution":{"observed_at":"2026-08-07T05:17:10.583971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.869175Z","title":"Optimizing neural networks with kronecker-factored ap- proximate curvature","venue":null,"work_id":"e66ed1f3-1c1e-420a-bc33-2ba9e6b0f3ae","year":2015},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.587581Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:b326429e2eea9a582a474ec60a42006a9076464a5f8555b2b5fa626ceffd0b97","observation_id":"8d36b2fb-7a69-49cb-8890-d142446f6854","resolution":{"observed_at":"2026-08-07T05:17:10.874008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.857066Z","title":"Müller and Frank Hutter","venue":null,"work_id":"33440974-0ee6-4547-9227-8a9c2682e8de","year":2021},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.591914Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:80bccc280434f4764b2b6d95a1e98ac7b43a00e48c8e6a59b1053993b2b6a4a1","observation_id":"d937628b-0db7-40f2-beea-c3935abee7af","resolution":{"observed_at":"2026-08-07T05:17:10.861350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.595345Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.595345Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:08ddc1ab10c372a936c6b235044fbb2d0309e7613490cc68e54d94860ddf0d23","observation_id":"75020cb3-85da-4bc5-84a9-b16435bda0ec","resolution":{"observed_at":"2026-08-07T05:17:10.595345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.836310Z","title":null,"venue":null,"work_id":"e9668214-6a20-4822-8f0b-59c65b00c8e6","year":1911},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.599076Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:9a0a61f8bee5955ca1b41c254b59ba51df06ed06a12e436050bba5e232a3142b","observation_id":"ddfd595d-431f-496d-b20f-4e5aa7064ae2","resolution":{"observed_at":"2026-08-07T05:17:10.839907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.824182Z","title":"Rethinking the inception architecture for computer vision.IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 2818–2826, 2015","venue":null,"work_id":"932993ee-19c7-4537-8ef8-82b68276113b","year":2015},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.602968Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:80fe194a3e314b3de2ef57cd6f880a4d2ada42018ce424e008f4c2d4dc44c003","observation_id":"14cb8fb8-87ea-4a9d-8b35-f62dad079b0c","resolution":{"observed_at":"2026-08-07T05:17:10.828404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.812056Z","title":"Skfac: Training neural networks with faster kronecker-factored approximate curvature.IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 13474–13482, 2021","venue":null,"work_id":"82a3fa0a-b2e2-45c8-bca4-f403c58d7e4c","year":2021},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.606553Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:81e82fb1e49039e93c7e732a14243c0100ee39f1b5b65ceb7b47dda4a93a7e55","observation_id":"8e785c3d-f706-4c19-8add-9555bd6ed6ca","resolution":{"observed_at":"2026-08-07T05:17:10.816442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.799691Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"a32908a9-773c-42b1-9e19-7c3af908e15a","year":2020},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.610463Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:e7a3cfd714c559251fd72b8b03d19cf6cde2eeabb6325c74c0f31ec05660f636","observation_id":"e2719896-dbf9-4c6e-8f44-392f7c85d550","resolution":{"observed_at":"2026-08-07T05:17:10.803775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.787711Z","title":null,"venue":null,"work_id":"7b57b5f5-e8fb-481a-8e8f-0f1b9cf61e43","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.614162Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:24b892af826ef01cd1c800f731555c27e750bfd8a3d63ab30206f566e8a9a2bd","observation_id":"4a0879d8-3967-40a0-bb81-281976e36854","resolution":{"observed_at":"2026-08-07T05:17:10.791601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.617438Z","title":"Fashion-mnist: a novel image dataset for benchmarking machine learning algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.617438Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:23eac0b3c6fb3e4d343eb9a383f2efff03b0ad22cca5c134bec54ff382876c30","observation_id":"c193ab2f-cf11-4de7-aa30-e697da1c8380","resolution":{"observed_at":"2026-08-07T05:17:10.617438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.767772Z","title":null,"venue":null,"work_id":"8e13b988-dba8-49d9-bf29-a87ee7135a9d","year":2020},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.621242Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:c5bb2d7cc9ce2adb48b672f5e7a5777efde3cfcd98ef33d9a8f86a8d40bc708f","observation_id":"8829e7ac-587b-447c-8e88-84448e48f7fa","resolution":{"observed_at":"2026-08-07T05:17:10.771993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.755320Z","title":"Samworth","venue":null,"work_id":"dd6e4050-b45b-43cd-840d-6c12009e7d1c","year":2014},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.625927Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:b8115bf51d24dab6bfd25445fe61527fee7fa7dad54e11c0aee0bec83e221003","observation_id":"645fcb38-3318-4b6f-b471-d6951f9e7fa5","resolution":{"observed_at":"2026-08-07T05:17:10.759957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.742028Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"868a26de-ed13-4dc0-9662-3df661b8a239","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.629699Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:941a680a79f13cf60808d628250a033203054647e55b3939526eaa96a3cfb367","observation_id":"29cdf730-c136-43d7-b57c-a6cd9575a443","resolution":{"observed_at":"2026-08-07T05:17:10.746626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.729145Z","title":"Wide residual networks.British Machine Vision Conference, 2016","venue":null,"work_id":"e1b94cc1-3601-4bb2-8d90-2c7ffc2cdec2","year":2016},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.633221Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:150dfeb22d67e4158b4c0821d0ea4ca09e5daedc1847fec70d0dfc276dcda8e3","observation_id":"41823d0b-ade8-4c19-8cbf-3057193a0b28","resolution":{"observed_at":"2026-08-07T05:17:10.732925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.716893Z","title":"Fast convergence of natural gradient descent for overparameterized neural networks, 2019","venue":null,"work_id":"61bf79a5-9854-4348-8403-8840955925ba","year":2019},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.636860Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:ffb2a585a7397371ce9ba547a40768ae68cf5cc7a8b9f92607c747a889e9c90b","observation_id":"8d27baa9-cd46-4761-86c8-08d67421e4ee","resolution":{"observed_at":"2026-08-07T05:17:10.720707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.704592Z","title":"Dauphin, and David Lopez-Paz","venue":null,"work_id":"3892e01b-07a5-4c32-b330-0655ae8b1c89","year":2018},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.640620Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:d6176412172250675a5786edd3246b5f8790f50e1073da5fd0333b3fb349c1b5","observation_id":"a0ef7793-9a4c-48dc-926c-2ef22bc2f106","resolution":{"observed_at":"2026-08-07T05:17:10.708454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.692303Z","title":"Eva: Practical second-order optimization with kronecker- vectorized approximation","venue":null,"work_id":"9ea46b9a-e828-42e2-93bd-14a931587448","year":2023},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.644703Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:57bd1fa8fea815b7ddb267efa071d84cfce1cd1900a2acb0602ca51ede50dd41","observation_id":"bce84376-017f-4181-b36e-1a73480a10b8","resolution":{"observed_at":"2026-08-07T05:17:10.696477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:17:10.677822Z","title":"Random erasing data augmentation.AAAI Conference on Artificial Intelligence, 2017","venue":null,"work_id":"2d542294-d582-414a-bc6f-7a425cf0d2d5","year":2017},"citing_paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:17:10.648494Z"},"links":{"citing_paper":"/paper/2506.08464"},"observation_digest":"sha256:79c019ea013e01d9a4a3311ee3cc72ff08b95f573d798ecbb3daca54e092654a","observation_id":"80a51d15-a37c-4cee-920c-be80f966cff8","resolution":{"observed_at":"2026-08-07T05:17:10.683527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08464","last_updated":"2025-11-11T08:18:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:07:56.999932Z","submitted_at":"2025-06-10T05:38:04Z","title":"MAC: An Efficient Gradient Preconditioning using Mean Activation Approximated Curvature"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.08464."}