{"as_of":"2026-08-23T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b731604196e3dbe4358b4453b00774b62172ec1bb9d6cc08628d8eb2bfc2a00e","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:15:01.382444Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:21:53.393381Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:56:28.460650Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"cited_work":{"arxiv_id":"2507.18807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.18807","snapshot_observed_at":"2026-07-02T01:56:28.460650Z","title":null,"venue":null,"work_id":"224a58b4-8de6-425c-afec-a1e921d6d031","year":2025},"citing_paper":{"arxiv_id":"2606.03904","last_updated":"2026-06-02T17:00:15Z","snapshot_observed_at":"2026-08-09T02:41:51.378123Z","submitted_at":"2026-06-02T17:00:15Z","title":"MAdam: Metric-Aware Multi-Objective Adam","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:21:53.393381Z"},"links":{"cited_paper":"/paper/2507.18807","citing_paper":"/paper/2606.03904"},"observation_digest":"sha256:6ea1c4a60f9f5aebdb75d7c4d91a5b8d50280e9f3ede6a655e786e73c2284485","observation_id":"f2737304-9b7a-4f0e-8263-ad022b564db6","resolution":{"observed_at":"2026-07-02T01:56:28.462907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.18807/citation-record","integrity":"/paper/2507.18807/integrity","json":"/paper/2507.18807/citation-record.json","paper":"/paper/2507.18807"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.046375Z","title":"C., Soatto, S., and Perona, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.046375Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:26fdb3f66dc11fd02b50f6ea487b493d3d4087219ac7bdf8decd4994ba631506","observation_id":"5579f870-7696-4b3f-ada9-50ceab7cf09e","resolution":{"observed_at":"2026-08-15T18:15:01.046375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.565185Z","title":"Natural gradient works efficiently in learning","venue":null,"work_id":"c67e4ee2-d3d4-4ea2-ac43-116c7a21f51d","year":1998},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.053136Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:f3dedeae2954626fcc4127e357c16bb32a85db88278e8f0d65671b8355532b90","observation_id":"1228c7ad-9c30-441b-a577-4113473c457d","resolution":{"observed_at":"2026-08-15T18:15:02.572958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.547718Z","title":null,"venue":null,"work_id":"42f77b51-fcbf-4240-8c54-3af24c6478e5","year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.058326Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:afb478efd9bfb21ed56bdf2a348110543c90a3e3b3a7101b5eb58926851bf7d8","observation_id":"593a7da1-3b64-4aad-9ef3-bca009927f6e","resolution":{"observed_at":"2026-08-15T18:15:02.553114Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.524565Z","title":"B ack PACK : Packing more into backprop","venue":null,"work_id":"88be2f2f-672c-4d78-905e-3f49ee61957b","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.063063Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:e9be733afd21022adb2d7cc0f0bbc3a8491343f14ddafae805fb0525d463c0e6","observation_id":"b4c1eae6-94ef-4d7c-8df7-fd7ef0661857","resolution":{"observed_at":"2026-08-15T18:15:02.532633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.480783Z","title":"N., Pascanu, R., Gulcehre, C., Cho, K., Ganguli, S., and Bengio, Y","venue":null,"work_id":"4f6e7805-07cb-4381-b49f-e72dc7b066c0","year":2014},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.068172Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:c4bd50e50cb6ceb51183ce333ea61aacdeb21af0e14d7c7e24e07d999bc54b85","observation_id":"a7c75588-4b57-4a24-88f5-ce9eefeea9da","resolution":{"observed_at":"2026-08-15T18:15:02.490322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.451039Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"f3766bd4-5f10-487a-bf7d-2859cb0797c1","year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.073905Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:f60bbfaf4fe9d9e8de9916b8258189dacfcb5a5725cf6ada22b4584ab7c0d9c1","observation_id":"20b5ec84-1cb5-4de3-a8ee-857cdcbc911f","resolution":{"observed_at":"2026-08-15T18:15:02.458015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.429096Z","title":"Incorporating nesterov momentum into adam, 2016","venue":null,"work_id":"6383e560-8cc9-408c-a558-6baeffeb57ff","year":2016},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.079362Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:ab02137f51451e61fd78c617931223d40b3bb132c5ea1256056816917e818a47","observation_id":"7b6a5e18-074b-4737-9908-b710f6391210","resolution":{"observed_at":"2026-08-15T18:15:02.436522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.412278Z","title":null,"venue":null,"work_id":"ae8f9747-e02f-4e8f-ab10-47a39c316ab0","year":1922},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.083526Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:3219127712d568083e1fcc3ffe6038ee9f93a901235207d252e3683d13a87ade","observation_id":"7c2f724a-80f7-47d3-8c26-c4a658731d0d","resolution":{"observed_at":"2026-08-15T18:15:02.416482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13257","last_updated":"2025-01-09T22:21:56Z","snapshot_observed_at":"2026-08-20T07:57:48.645407Z","submitted_at":"2024-03-20T02:38:01Z","title":"Arcee's MergeKit: A Toolkit for Merging Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13257","snapshot_observed_at":"2026-08-15T18:15:01.087873Z","title":"Arcee's mergekit: A toolkit for merging large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.087873Z"},"links":{"cited_paper":"/paper/2403.13257","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:c90fbb076c84b0188e706d84cebb05b888af86bf7a6f07a8fd7e764e084c1cae","observation_id":"ee750cd3-12b0-4caf-b578-99f6697106f6","resolution":{"observed_at":"2026-08-15T18:15:01.087873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16397","last_updated":"2025-03-10T18:42:22Z","snapshot_observed_at":"2026-08-16T13:49:24.208828Z","submitted_at":"2024-05-26T01:25:02Z","title":"AdaFisher: Adaptive Second Order Optimization via Fisher Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16397","snapshot_observed_at":"2026-08-15T18:15:01.092059Z","title":"M., Zhang, Y., Belilovsky, E., Wolf, G., and Hosseini, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.092059Z"},"links":{"cited_paper":"/paper/2405.16397","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:dad78d1bb2f7297ca0db40bda75b14e6173c6ec0034905a9b4072fb6a6f07e41","observation_id":"2804ee44-c504-4357-b1b9-0add4bd47111","resolution":{"observed_at":"2026-08-15T18:15:01.092059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.096911Z","title":"and Stork, D","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.096911Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:f3477ad3fcaadd4b279eb62ae1e7391ff6e4ba56d14b944574f90cd857aac5ae","observation_id":"a0720482-97ce-4a3f-b3c1-429c914e9127","resolution":{"observed_at":"2026-08-15T18:15:01.096911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.381758Z","title":"J., Han, D., Yun, S., Kim, G., Uh, Y., and Ha, J.-W","venue":null,"work_id":"7f8189b7-a8d1-4b06-902b-2f3f68a6d068","year":2021},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.102670Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:2d31af373fec8d7800a131e6c209e2b036b652aa8d7cde97e2c2c5af2ff4a8c1","observation_id":"d8ae452f-bc95-46ac-8ea0-259ab91f9903","resolution":{"observed_at":"2026-08-15T18:15:02.387656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12807","last_updated":"2024-09-03T21:00:39Z","snapshot_observed_at":"2026-08-19T09:41:46.401942Z","submitted_at":"2024-05-21T13:58:17Z","title":"FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12807","snapshot_observed_at":"2026-08-15T18:15:01.106616Z","title":"Fadam: Adam is a natural gradient optimizer using diagonal empirical fisher information","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.106616Z"},"links":{"cited_paper":"/paper/2405.12807","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:b828cbe2bf6e17dd3a45494858c8b9c00cbdbc6bc59e912bed4ec23e4dc273fc","observation_id":"e1bd8e33-7b19-4a56-87bf-08f518dbfdba","resolution":{"observed_at":"2026-08-15T18:15:01.106616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-15T18:15:01.113045Z","title":"T., Wortsman, M., Gururangan, S., Schmidt, L., Hajishirzi, H., and Farhadi, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.113045Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:2f7ed448deb7467caff7f190a7ace71cdc71f08860b15d804c338f2bb7aa0351","observation_id":"41769275-9bc7-4b42-837b-b921bc30047a","resolution":{"observed_at":"2026-08-15T18:15:01.113045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.364643Z","title":"and Osawa, K","venue":null,"work_id":"3b5acd95-03b8-4986-9fca-2ce0c3e6018a","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.118315Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:60447c03ff28c862faecd36b2f81c35d094d705f9d9797ab969883093905fd0a","observation_id":"d2e6cbbd-3d5b-4ed8-b84c-2a686cb45630","resolution":{"observed_at":"2026-08-15T18:15:02.369716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.350642Z","title":"Universal statistics of fisher information in deep neural networks: Mean field approach","venue":null,"work_id":"136fc638-2a80-433e-80d1-c22a0c7b77ff","year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.122694Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:e82e695a4eca4ea2cbb2e41c6eadadaab9ff80efbfa61836b6ef5511db7ad6a6","observation_id":"cb4d5443-a3ee-49e5-82be-c3813b8f5714","resolution":{"observed_at":"2026-08-15T18:15:02.355517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T18:15:01.127103Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.127103Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:0e8e29faca11646af75cb7fb9c19ce8b54d589b7bd92e35f3a9d16eb12aaabdd","observation_id":"078e0133-481e-4b48-866b-d67e31d9fa6a","resolution":{"observed_at":"2026-08-15T18:15:01.127103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.131440Z","title":"A., Milan, K., Quan, J., Ramalho, T., Grabska-Barwinska, A., et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.131440Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:7e13a07b68c7163defcb9ce5c62be22f21512084e6d089ca6292ed2cd91615bc","observation_id":"c5418969-00f1-4fa9-8c48-f1db90d19df3","resolution":{"observed_at":"2026-08-15T18:15:01.131440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.135674Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.135674Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:e56b835af8a254bb162119fb73a1b8b69016d73f1a2de94a2a9b1b0a26eb91c0","observation_id":"cfd96adf-4f51-4d18-8b85-72177cbda788","resolution":{"observed_at":"2026-08-15T18:15:01.135674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.139611Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.139611Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:25ce5cedf1a86bd3502f4fe6927435128e43be2ecf58d807378b4c5bc90d1d05","observation_id":"f6ae41e1-2cb1-4a7f-a69c-f469ba1d7543","resolution":{"observed_at":"2026-08-15T18:15:01.139611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.288189Z","title":"Limitations of the empirical fisher approximation for natural gradient descent","venue":null,"work_id":"d23b7817-1cba-4578-b2d9-f2fbf3b554f4","year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.143483Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a7a1fb136e3d573de7c1e43e5f3ada167dd84dfadd362e47fc9ee88ae1ddf8a1","observation_id":"3b78237c-c597-4108-a4a3-79abf0a7121f","resolution":{"observed_at":"2026-08-15T18:15:02.295521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.147425Z","title":"Optimal brain damage","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.147425Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:753fe9eed8390c72f005755e0ae7d8faa46906382314d23588b90b60d8c5222c","observation_id":"e5f78108-21f1-4ca4-9046-2840d4fe63bb","resolution":{"observed_at":"2026-08-15T18:15:01.147425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.151303Z","title":"B., and M \\\"u ller, K.-R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.151303Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:7ff671edf0d1a47a2593b8ebab54d0f043fdae7bf25cee0fd138402e2179ed0a","observation_id":"8f927d77-b81a-47fd-930f-cac1b5db85d3","resolution":{"observed_at":"2026-08-15T18:15:01.151303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-16T20:01:36.160048Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-15T18:15:01.155407Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.155407Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:b977d2124562ad66c4d1f1114bb296725146fe0c41aaf6d11a7d451c9066c55f","observation_id":"5f48680e-acbe-422f-9630-3fcca00fc199","resolution":{"observed_at":"2026-08-15T18:15:01.155407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.251816Z","title":"E., and Makhzani, A","venue":null,"work_id":"f6911481-f4af-4b1e-b492-176e9345f40d","year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.159823Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:060a926f5a48773580075d3f1693746181544dd28ca2c35c48f5039b0ac09872","observation_id":"39e29a11-1ff9-4406-8b2d-89ea4372838d","resolution":{"observed_at":"2026-08-15T18:15:02.256686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.236378Z","title":"On the variance of the adaptive learning rate and beyond","venue":null,"work_id":"04ac5208-8b1a-41b1-aa5f-974116595089","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.163478Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:04ca2f960a98f635a6c02f5a947ebd9e563c35d097582fea4538d86937ce70bc","observation_id":"524eaa33-2ec0-42f0-bf86-596490027f59","resolution":{"observed_at":"2026-08-15T18:15:02.242851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T18:15:01.168256Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.168256Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:3c55101060f6fccd820a5821eb4630ba2407ab071e76cd132e8f89c46f63699d","observation_id":"aca63567-e5d5-4446-86c8-a31d37bb43e0","resolution":{"observed_at":"2026-08-15T18:15:01.168256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T18:15:01.173014Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.173014Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:556577cd6dfc6093b7dc0c078eaee4f90b9917059dbf523cbf76e80077e4725a","observation_id":"63e0b4d0-3578-4e0e-8125-10e8fa93e3dc","resolution":{"observed_at":"2026-08-15T18:15:01.173014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.05014","last_updated":"2020-09-10T17:21:21Z","snapshot_observed_at":"2026-08-19T09:41:43.420702Z","submitted_at":"2020-09-10T17:21:21Z","title":"OrthoReg: Robust Network Pruning Using Orthonormality Regularization","version":1},"cited_work":{"arxiv_id":"2009.05014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.05014","snapshot_observed_at":"2026-08-15T18:15:01.569360Z","title":"OrthoReg: Robust Network Pruning Using Orthonormality Regularization","venue":"cs.CV","work_id":"8aa7a528-6a9d-4736-8168-6714c210e047","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.178532Z"},"links":{"cited_paper":"/paper/2009.05014","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a51d7ddf86f5d1302422c2ab6d0e49e3f8cd7a875d94029711816cd2f1a06de2","observation_id":"a640d477-8f80-40a4-a500-85d9c868b8c2","resolution":{"observed_at":"2026-08-15T18:15:01.578040Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.224455Z","title":"P., and Wagenmakers, E.-J","venue":null,"work_id":"adca2df7-1678-491c-a9e9-0ede64b61aad","year":2017},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.183762Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:7cbbfe0cba139336c8d6c778ecd10f6095851dc7d310d3dcd46281ebf891e229","observation_id":"33fa4c6f-f590-4844-a16c-70f304c6eb0e","resolution":{"observed_at":"2026-08-15T18:15:02.228304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.209729Z","title":"and Yarats, D","venue":null,"work_id":"efaf113e-9dd0-487d-85ec-1d596f91ae52","year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.188454Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:157d76ae19d1756c7afdc1d65ea1349ec7abc5fffb9a2c887307b01ad65f3068","observation_id":"8f68191b-85ee-4b28-a46b-4ac6995a7169","resolution":{"observed_at":"2026-08-15T18:15:02.213730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.201791Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.201791Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:d145d87af8fac0281b66eebcc370cc1c9c92c21bae3919c04f96acc34b80f803","observation_id":"c5c0b708-1762-4abc-992d-6a2e5233c429","resolution":{"observed_at":"2026-08-15T18:15:01.201791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.207085Z","title":"New insights and perspectives on the natural gradient method, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.207085Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:1b1249a04aec4b79afa959cd18bf42974ef321341710e04e92cde854c52bcd09","observation_id":"de36313d-9d6b-45e8-b505-d3445132c372","resolution":{"observed_at":"2026-08-15T18:15:01.207085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.177467Z","title":null,"venue":null,"work_id":"8975a00b-7540-45cd-b181-ae071424eeec","year":2022},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.211357Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:9857c3ffb1b98093561f082226c12cc322253805db747eb6b110c6981d92b051","observation_id":"d3ca70e9-24e4-47ad-983d-01c29f3439ab","resolution":{"observed_at":"2026-08-15T18:15:02.181747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.158248Z","title":null,"venue":null,"work_id":"c711b65a-fd12-4d9d-b34b-44983bbd8da2","year":2012},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.216402Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:76fcd5800d1d6279f8f2fef949d240830cff0c47864de8e745f54fdf7d133490","observation_id":"6f7fffa3-63a6-4098-acce-2d1e3d0ba7b9","resolution":{"observed_at":"2026-08-15T18:15:02.162907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.222258Z","title":"Asdl: A unified interface for gradient preconditioning in pytorch, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.222258Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:6758fdd0241f073ec903d048980fabb8f25da77e619ab6cb4d64f5e697229c64","observation_id":"a7664123-991d-49d5-89ad-e2e17bb1c5f5","resolution":{"observed_at":"2026-08-15T18:15:01.222258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01088","last_updated":"2019-02-27T19:07:16Z","snapshot_observed_at":"2026-08-14T18:04:56.544241Z","submitted_at":"2018-11-02T21:04:24Z","title":"Sentence Encoders on STILTs: Supplementary Training on Intermediate Labeled-data Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.01088","snapshot_observed_at":"2026-08-15T18:15:01.226674Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.226674Z"},"links":{"cited_paper":"/paper/1811.01088","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:50632596c1dcba68fee948909d5d46c400f78c57011c9fc093dafee9a0b4e225","observation_id":"a43ae48d-5f11-4a13-9de5-fca7874a2a52","resolution":{"observed_at":"2026-08-15T18:15:01.226674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00628","last_updated":"2020-05-09T05:23:02Z","snapshot_observed_at":"2026-08-19T09:41:45.047138Z","submitted_at":"2020-05-01T21:49:34Z","title":"Intermediate-Task Transfer Learning with Pretrained Models for Natural Language Understanding: When and Why Does It Work?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00628","snapshot_observed_at":"2026-08-15T18:15:01.231505Z","title":"M., Zhang, X., Pang, R","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.231505Z"},"links":{"cited_paper":"/paper/2005.00628","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:5409dab9df67ee7ff57a742a087f752bef930eee10b34a53df2ce88274fe35dc","observation_id":"92b623c9-3826-4d97-9b98-efdcdecf8846","resolution":{"observed_at":"2026-08-15T18:15:01.231505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.129641Z","title":null,"venue":null,"work_id":"5ef517d5-769f-4d39-81a9-eee8e1547813","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.236616Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:c4d3afd2e7644656b2eaac7327f7240018618d5a45c9606b6b3d23ddf11404f5","observation_id":"3c4b0265-2732-4f0f-af47-01991990e86a","resolution":{"observed_at":"2026-08-15T18:15:02.135637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.110992Z","title":"J., Kale, S., and Kumar, S","venue":null,"work_id":"79ac1944-be26-459c-bec5-3459fbc40450","year":2018},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.240996Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:14d5a5c37729642bc9899763fd0b9ff222eef6a76409518c193a7a18e094ffc7","observation_id":"ceffe48a-6975-4ef2-bd09-d259b4cf5dce","resolution":{"observed_at":"2026-08-15T18:15:02.116269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.091074Z","title":"and Monro, S","venue":null,"work_id":"b20e1b9c-8553-4a69-a8de-6ec32bc05a74","year":1951},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.246155Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:c0e0058164265c93db2fa4d4b199787f7dd2089cf2cc101e89cee97bfb8e2d51","observation_id":"d1452242-1322-4882-8587-d52e734dafb7","resolution":{"observed_at":"2026-08-15T18:15:02.100706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.064522Z","title":"Control chart tests based on geometric moving averages","venue":null,"work_id":"75835370-344a-4715-9cef-565e63578998","year":1959},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.250137Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:101226108c9233a90a9d8375b0becf9f716cba5a94d50dc71a4f3c6e0834dc1f","observation_id":"ff3f2b53-ae9a-48c1-b8e7-9bed397afdce","resolution":{"observed_at":"2026-08-15T18:15:02.072441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.050321Z","title":"and Eaton, E","venue":null,"work_id":"aab9493b-6fbc-4156-87f6-a1ef97fc5e0c","year":2013},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.255702Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:f4bd287ba5623a04c8765cdf43dba10a9b1044dfbad9b980646a388ff69ab341","observation_id":"d658a76d-e9c5-48a9-9f32-588a6241eba0","resolution":{"observed_at":"2026-08-15T18:15:02.054155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.036994Z","title":"Ill-conditioning in neural network training problems","venue":null,"work_id":"d6038ef9-45d7-47a3-b269-7bcd7a6befc3","year":1993},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.259822Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a8994d4d306dddccbfc535556554e6e0aed6bfaef3e99018c3177747cb981afa","observation_id":"9b90a211-697b-4b57-b096-c75d0a6eabc4","resolution":{"observed_at":"2026-08-15T18:15:02.041229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.263228Z","title":"M., Schneider, F., and Hennig, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.263228Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a2f23eff083babe4e06833954804658a0c2275d3be0fa128cb03c92f1e746a55","observation_id":"a42457b9-f4b0-49ab-8b76-a868f4b69369","resolution":{"observed_at":"2026-08-15T18:15:01.263228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17641","last_updated":"2024-06-06T04:31:43Z","snapshot_observed_at":"2026-08-16T14:14:50.451531Z","submitted_at":"2024-02-27T16:11:05Z","title":"Variational Learning is Effective for Large Deep Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17641","snapshot_observed_at":"2026-08-15T18:15:01.267241Z","title":"M., Bazan, C., Yokota, R., Gurevych, I., Cremers, D., Khan, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.267241Z"},"links":{"cited_paper":"/paper/2402.17641","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:334d4465fca26f8aa569a8e3ad2d487f246bb8a99bd20d98e45315bf89eb0bf2","observation_id":"1320f3d7-689f-4b8d-ab9e-d3dedeb1db39","resolution":{"observed_at":"2026-08-15T18:15:01.267241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.014477Z","title":"K., Kim, J., and Kim, J","venue":null,"work_id":"588cd48a-0621-4081-9eec-3984d26b8356","year":2017},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.275958Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:64f1a69181a8c5c4fca438d56c8e7fa049de29a654dc413fb4f7987bc32d52cb","observation_id":"69dff48b-b46b-4507-9c8e-8b1e1bfd0a22","resolution":{"observed_at":"2026-08-15T18:15:02.018772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-15T18:15:01.280027Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.280027Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:3828fe44e5c38e85bea0ef7f0b3dee306437c0455385da99ea99d4aebaf3f88b","observation_id":"8fdfd145-c500-46ca-8425-5f88634d9783","resolution":{"observed_at":"2026-08-15T18:15:01.280027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:02.000660Z","title":null,"venue":null,"work_id":"3bfdb6bf-5357-4d05-95c2-a215bfe46285","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.285423Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:d372b58d9080ddad8589bc519d025ce714d83d03d08f04649f2a47c221935579","observation_id":"a90678be-569b-4c74-9358-ad7461e859ea","resolution":{"observed_at":"2026-08-15T18:15:02.005055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.987670Z","title":"Training neural networks with fixed sparse masks","venue":null,"work_id":"927112dc-47c7-49c4-a335-2b72f9aaa8b4","year":2021},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.294756Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:27fbb9ce8a88556fffb45b3570bd7b35fdcd168332aeed1a0a6079ad95c74af0","observation_id":"d2ee8911-2166-4fb0-ab23-237b03c79883","resolution":{"observed_at":"2026-08-15T18:15:01.991378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.971834Z","title":"Merging by matching models in task parameter subspaces","venue":null,"work_id":"6f56ef13-c497-4c85-8973-043bbc09f02b","year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.300416Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:c3c9253005273867b6d9ef0c0afdfe4c5843235bcb9c4b35a05665373cbd67d1","observation_id":"c864ead3-8e0b-4118-9f31-1d00e6b118ab","resolution":{"observed_at":"2026-08-15T18:15:01.977045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.05787","last_updated":"2018-07-09T10:38:35Z","snapshot_observed_at":"2026-08-14T19:54:18.311129Z","submitted_at":"2018-01-17T18:34:33Z","title":"Faster gaze prediction with dense networks and Fisher pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.05787","snapshot_observed_at":"2026-08-15T18:15:01.306327Z","title":"Faster gaze prediction with dense networks and fisher pruning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.306327Z"},"links":{"cited_paper":"/paper/1801.05787","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:2a7b086e5c921d86ae234f86999a4a4b1dfdf5482ec574421bbdde2f783f1bc7","observation_id":"57029780-8e15-4db1-bff7-db6f016826bb","resolution":{"observed_at":"2026-08-15T18:15:01.306327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.948741Z","title":null,"venue":null,"work_id":"c0876b59-6186-4750-8e53-3ae77a71298d","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.315297Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:bb310ce2b692c75c641c477f671f945ef6ef06063ec4e6c83cc7f9ad96f58aa2","observation_id":"72246857-7503-4ac4-bba2-2a42d2074ba3","resolution":{"observed_at":"2026-08-15T18:15:01.960584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.934187Z","title":"and Hinton, G","venue":null,"work_id":"8d9ddad6-eee5-4f92-8448-4bb522b85f91","year":2012},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.320547Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:e736ff42e79c3586efa131ef768efbaaabc5dfb9258bc2660e90b716bfa42874","observation_id":"d7f5c985-6cb8-4038-bc55-03f36ec0e433","resolution":{"observed_at":"2026-08-15T18:15:01.938665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.919293Z","title":"Weight averaging for neural networks and local resampling schemes","venue":null,"work_id":"e09f2178-8a46-4248-8db2-25eaae520e0e","year":1996},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.325876Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:1253bf15bfc3375b689cdca9e112442a4c085cf42d68b1832ef608167119b281","observation_id":"442be175-733f-4794-b451-bc5ade074d21","resolution":{"observed_at":"2026-08-15T18:15:01.924359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.904654Z","title":null,"venue":null,"work_id":"3ae89f97-c583-4ea9-a2ab-bfcd30e44a1b","year":2019},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.330598Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:f543a917b9bf1dd1d2270c7c8d389336f3047f1460ecfc135760e52cd36ddf64","observation_id":"0d51ba92-f1d7-4a2f-8f5d-4cbb5ea8136a","resolution":{"observed_at":"2026-08-15T18:15:01.909797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.884345Z","title":"M., Tice, D","venue":null,"work_id":"ed8f5070-b32c-4659-9877-d4512a20c034","year":1999},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.336701Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:0ecc1ff55240bd661e01d2a5776a5ba4c35ac28676299283c68db26f1f40e21b","observation_id":"d5d71e76-1071-4cfb-8189-d5f55c900443","resolution":{"observed_at":"2026-08-15T18:15:01.896456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00770","last_updated":"2020-10-06T18:49:48Z","snapshot_observed_at":"2026-08-19T09:42:00.260628Z","submitted_at":"2020-05-02T09:39:36Z","title":"Exploring and Predicting Transferability across NLP Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00770","snapshot_observed_at":"2026-08-15T18:15:01.341209Z","title":"Exploring and predicting transferability across nlp tasks","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.341209Z"},"links":{"cited_paper":"/paper/2005.00770","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:d7d3de06158e4e3e5003f3592dcd72b286627be6217cd18fe817f258407e3b7d","observation_id":"d32d9398-e6ca-4968-b39f-3a3ee4cc404e","resolution":{"observed_at":"2026-08-15T18:15:01.341209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.858784Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"685982a1-1617-46a5-a812-1e3253e48977","year":2018},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.347053Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:5e6eebe49a726775f5fbffc5a127991ead13704a645a537b3be245a6b6fec1de","observation_id":"151ce0ef-7bf9-4b81-abed-b58b0df72946","resolution":{"observed_at":"2026-08-15T18:15:01.865744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.841466Z","title":"Y., Roelofs, R., Gontijo-Lopes, R., Morcos, A","venue":null,"work_id":"5c4d81cf-a73a-44a8-8ad5-e803a26062ce","year":2022},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.351741Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a67482d17af4ea5984e7501194eecc4660493aca96a42081b14be8a6e0b711e1","observation_id":"1bb09116-491b-4c42-8b65-b5032fa9b113","resolution":{"observed_at":"2026-08-15T18:15:01.845384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.826951Z","title":"Ties-merging: Resolving interference when merging models","venue":null,"work_id":"c17d5b55-777d-498e-af8d-83a1afb7d700","year":2024},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.357162Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:87511f3fd9c6cb80b18656c6d5b580c956f5c2b0faa0afe2d0df77420e492151","observation_id":"0b1a66e5-15ee-4dc9-8565-2f1562865dbe","resolution":{"observed_at":"2026-08-15T18:15:01.831345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.807946Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":"08768557-afa5-48e9-a530-1c155ffa3e37","year":2020},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.362431Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:3951a8fa0fc033ca64ae2b7c123d6e6da073ffe664a9fd32b657c0084341ddec","observation_id":"9862cb8d-59fd-4dbf-aa89-3763b69b7ff4","resolution":{"observed_at":"2026-08-15T18:15:01.813931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-19T05:19:50.480481Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-15T18:15:01.368247Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.368247Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:a14fbb780bac828fa33f15e79332777687ca3bed5544fccbbbe5785877e68be7","observation_id":"d188d783-b950-4f7d-9fcb-13f78f41b557","resolution":{"observed_at":"2026-08-15T18:15:01.368247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.791390Z","title":"Continual learning through synaptic intelligence, 2017","venue":null,"work_id":"575e56b0-dfeb-46b3-999e-6617e3a3ebb8","year":2017},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.373125Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:82bd0668bd4a8b0c8667ada44065308e0f9d6992105be411cadc964268c26a7a","observation_id":"0b7ebcac-9c74-4ab4-b19f-2628793a4ef2","resolution":{"observed_at":"2026-08-15T18:15:01.796004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.775116Z","title":"Not all tasks are born equal: Understanding zero-shot generalization","venue":null,"work_id":"cfdef220-d8a7-459a-a1d0-3abbec0a8469","year":2022},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.377966Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:61e8823c466a499df6121a82fe857043afd26473f40e541ee49f3da5217a4a73","observation_id":"0702a1a8-8d9a-499f-b4f8-85b291558182","resolution":{"observed_at":"2026-08-15T18:15:01.780772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:15:01.382444Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T18:15:01.382444Z"},"links":{"citing_paper":"/paper/2507.18807"},"observation_digest":"sha256:4a40fb270d545bdab024f7d8ab04586f1d9889696ac61054d1de341516f1f06a","observation_id":"6bc1d7e3-9edb-4b91-9711-20bd59661832","resolution":{"observed_at":"2026-08-15T18:15:01.382444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.18807","last_updated":"2025-07-24T21:10:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T13:54:43.107876Z","submitted_at":"2025-07-24T21:10:37Z","title":"Fishers for Free? Approximating the Fisher Information Matrix by Recycling the Squared Gradient Accumulator"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2507.18807."}