{"as_of":"2026-08-07T07:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c1ce6ff7b5ab3b8e9f16cc652a0ab5befe0a2d4de7a656012f264a9cebd2044","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:42:45.817678Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02433/citation-record","integrity":"/paper/2509.02433/integrity","json":"/paper/2509.02433/citation-record.json","paper":"/paper/2509.02433"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T11:42:45.564078Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.564078Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:ec79234138cec4b678c5f1fd4587f5fee4308cada776795bf8284d7665ef71a1","observation_id":"a460f3b7-a83c-41e3-b77b-71ac4347a4a1","resolution":{"observed_at":"2026-08-05T11:42:45.564078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.781382Z","title":"Language models are few-shot learners,","venue":null,"work_id":"372007bd-00cf-4eac-8800-755f9e4eb89e","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.568781Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:9d89e01f0f5e5d2eb5b57b41c82fde2c4ac62fcb891275f51ce28701728c36a1","observation_id":"12ecec1b-0cb4-4e8a-bdd9-2f157cb63a26","resolution":{"observed_at":"2026-08-05T11:42:46.785848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.767489Z","title":"Understanding deep learning (still) requires rethinking gen- eralization,","venue":null,"work_id":"cf8d07db-7c49-47a4-b7db-02b234e34feb","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.573010Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:19c5a424b59a16c1cfc2966a61427a9e56e326acabfacc118ca5511a2e5a07eb","observation_id":"4768d4b7-1af5-4e92-884a-f0cf14d0f273","resolution":{"observed_at":"2026-08-05T11:42:46.772090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.753218Z","title":"Dropout: a simple way to prevent neural networks from overfitting,","venue":null,"work_id":"245d9be3-5bad-4726-a1d6-65cdf572d4ee","year":1929},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.577189Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:cca39220a4f61c5709de1d9b096433d9e010afa12b6f010231427bde1f46b5cd","observation_id":"602dbaed-a0b7-4c17-8ba2-d82e668d42cb","resolution":{"observed_at":"2026-08-05T11:42:46.757778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.739020Z","title":"When vision transform- ers outperform resnets without pre-training or strong data augmentations,","venue":null,"work_id":"8c14dbc6-1bec-4c8e-806f-eff294eaa34e","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.581017Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:dd60a5e881651e752acf7a8885ec3e2e897850bff1caf51bac426b76c8d8c3e9","observation_id":"7496c36b-fa19-4399-9246-bd3f5ff0d3ac","resolution":{"observed_at":"2026-08-05T11:42:46.743595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.724290Z","title":"The marginal value of adaptive gradient methods in machine learning","venue":null,"work_id":"99c84fec-78d5-4f1c-ab89-32cd5e2e1b0f","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.584790Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:faa38722ea315f45596e9187a7d552b267ea4486483d6f5d24ebe7306bebfc4f","observation_id":"850f9b30-5027-4876-8336-bfbc1465b156","resolution":{"observed_at":"2026-08-05T11:42:46.728925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.710287Z","title":"Decoupled weight decay regu- larization,","venue":null,"work_id":"65a0a162-8186-4d3d-a943-fe6a08293d4e","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.589180Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:f721d439c992390968d6dfa5f849a491a4079b098ab36b01a4e55575a91fac7b","observation_id":"b254df6f-5f55-4ad0-83c7-77ed92f0fb42","resolution":{"observed_at":"2026-08-05T11:42:46.715001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.695722Z","title":"Sharpness-aware minimization for efficiently improving generalization,","venue":null,"work_id":"3203c886-cd41-44d7-bf55-f3020df6243d","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.592738Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:c214ae9af0b6083396ba802c24d1c8da837f4158406bfbc64b475d8e7f3ac02c","observation_id":"cebe1e5d-b94b-4b13-b3c8-1e16460f229e","resolution":{"observed_at":"2026-08-05T11:42:46.700527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02178","last_updated":"2019-12-04T18:58:26Z","snapshot_observed_at":"2026-07-06T08:42:06.688732Z","submitted_at":"2019-12-04T18:58:26Z","title":"Fantastic Generalization Measures and Where to Find Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02178","snapshot_observed_at":"2026-08-05T11:42:45.596553Z","title":"Fantastic generalization measures and where to find them,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.596553Z"},"links":{"cited_paper":"/paper/1912.02178","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:4180cf3873d25dff7ada19341fe33b6702f46bae510d28822e6d1f5fc7c08912","observation_id":"d0ea386a-4a3c-4969-97d9-c9ea1bd56077","resolution":{"observed_at":"2026-08-05T11:42:45.596553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.681463Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":"382a9bba-f418-4875-a372-b4ac97e8dda4","year":2016},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.600584Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:63367448fbbb070f3f02e6cb4417dc143b6f1cf0b02d45e2ce58672a053adf9f","observation_id":"770fe60c-2359-46ff-a2cf-7a2eef5b2e14","resolution":{"observed_at":"2026-08-05T11:42:46.685970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.667873Z","title":"Entropy-SGD: Biasing gradient descent into wide valleys,","venue":null,"work_id":"bc3483ef-5eb3-4341-a2ce-fd5d77802ad1","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.604406Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:f25d1dff29b1a0463b50e51a62dadc462174705c3cd865e750fae394c5c6a248","observation_id":"2fe58c53-a319-4d06-b316-d95983fb3d9d","resolution":{"observed_at":"2026-08-05T11:42:46.672251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.654232Z","title":"GA-SAM: Gradient- strength based adaptive sharpness-aware minimization for improved generalization,","venue":null,"work_id":"1da45772-46dd-4f94-abb5-ebac7e114662","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.608179Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:3dfdc12f66fd0d5da0fb5b5fa5a35867c01036f60a2458347190236a95843fdd","observation_id":"ff2427d2-0bcc-4242-98bf-6c8ce7d580d3","resolution":{"observed_at":"2026-08-05T11:42:46.658730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.639941Z","title":"Towards under- standing sharpness-aware minimization","venue":null,"work_id":"8c3f816b-6927-4607-a852-5dfdd315b0f5","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.611833Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:bdb09e25f8127655931fcf65c76a5a39b82ac19a9d2f2a64feb70e8559c81f94","observation_id":"0701bf15-1187-44a9-b18f-940215fe5624","resolution":{"observed_at":"2026-08-05T11:42:46.644437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.626680Z","title":"How does sharpness- aware minimization minimizes sharpness,","venue":null,"work_id":"31fe1b56-cf89-4744-9262-1fa6bf778a72","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.615405Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:d9e15c07de925d93cb093948cce7b9dab8928a2ff717178917a15c9802cdcd9d","observation_id":"0a50c249-7204-46e6-88ef-f0148cdb93d6","resolution":{"observed_at":"2026-08-05T11:42:46.630909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01513","last_updated":"2023-04-11T17:50:58Z","snapshot_observed_at":"2026-07-06T13:59:27.098801Z","submitted_at":"2022-10-04T10:34:37Z","title":"The Dynamics of Sharpness-Aware Minimization: Bouncing Across Ravines and Drifting Towards Wide Minima","version":2},"cited_work":{"arxiv_id":"2210.01513","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.01513","snapshot_observed_at":"2026-08-05T11:42:45.946818Z","title":"The Dynamics of Sharpness-Aware Minimization: Bouncing Across Ravines and Drifting Towards Wide Minima","venue":"cs.LG","work_id":"755b340b-2ac3-4103-84a3-4668b0a73ef9","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.619020Z"},"links":{"cited_paper":"/paper/2210.01513","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:08cd9b9ae1f66c73a72f71a3cd0a23b70be3c0eff71a98c588660dfc3dd4c485","observation_id":"0fc079bd-72ad-41f3-85eb-d70debb8b506","resolution":{"observed_at":"2026-08-05T11:42:45.951093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.613061Z","title":"Surrogate gap min- imization improves sharpness-aware training","venue":null,"work_id":"6ea6ea16-dd73-48d3-96c4-7d1f488dfd29","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.622897Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:21501d793498825e2056a543350b4905bef15ba624e45bc46b56e1d2b2ad328d","observation_id":"f93bef96-a768-4836-9400-f213674460a9","resolution":{"observed_at":"2026-08-05T11:42:46.617840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.599580Z","title":"Fisher SAM: Information geometry and sharpness aware minimi- sation","venue":null,"work_id":"301ca200-c4e9-41f9-b9e0-72fe40a5d9ac","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.626666Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:bbc4c48ef1fb0a9a93d7bdc7995a716d102c03b6d5f5601d382fbb13f36a2d54","observation_id":"ffc1e574-068e-4716-bba3-83686863b116","resolution":{"observed_at":"2026-08-05T11:42:46.603968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.586343Z","title":"To- wards efficient and scalable sharpness-aware minimization,","venue":null,"work_id":"b2a261e1-ec7d-4b92-a875-41db828d7dd4","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.630443Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:6e3c5279abb3828f4c85bdf9c213aab535ca28e92990336565e6f004067fe953","observation_id":"c9f17886-59cb-4021-bbfb-f583c3d0bc55","resolution":{"observed_at":"2026-08-05T11:42:46.590667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.572490Z","title":"Efficient sharpness-aware minimization for improved training of neural networks,","venue":null,"work_id":"f2416d5c-72da-419f-b35b-a83482175832","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.634294Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:018e9f9c1c4ee09a18f3faa6469fd253dcfef32514c73b119756b0ba1acc7935","observation_id":"a5c2c410-5b52-40ce-a267-6fdf06e88a43","resolution":{"observed_at":"2026-08-05T11:42:46.576907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09962","last_updated":"2023-04-10T06:43:15Z","snapshot_observed_at":"2026-07-06T12:49:36.698431Z","submitted_at":"2022-03-18T13:57:17Z","title":"Randomized Sharpness-Aware Training for Boosting Computational Efficiency in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09962","snapshot_observed_at":"2026-08-05T11:42:45.638002Z","title":"SS-SAM: Stochastic sched- uled sharpness-aware minimization for efficiently training deep neural networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.638002Z"},"links":{"cited_paper":"/paper/2203.09962","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:7e763b75fb1edba71c8b2cf629a49d40fc61da94f9a17396819a0aeae6335ec5","observation_id":"b4e98eb7-c6e7-4774-864d-dfac9735c9ea","resolution":{"observed_at":"2026-08-05T11:42:45.638002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14647","last_updated":"2023-04-28T06:23:32Z","snapshot_observed_at":"2026-07-06T15:21:04.733820Z","submitted_at":"2023-04-28T06:23:32Z","title":"An Adaptive Policy to Employ Sharpness-Aware Minimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14647","snapshot_observed_at":"2026-08-05T11:42:45.641956Z","title":"An adap- tive policy to employ sharpness-aware minimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.641956Z"},"links":{"cited_paper":"/paper/2304.14647","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:3456096f49f3048cbbd8af20b7384a01b15c39d49e05aa99fc5d4c1ae7aad4ac","observation_id":"8fb74f03-1411-4f2d-9a80-3e84606b1b73","resolution":{"observed_at":"2026-08-05T11:42:45.641956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.559180Z","title":"Sharpness-aware training for free,","venue":null,"work_id":"4e906adc-a2af-4a04-8daa-498d0f0f8f14","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.646089Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:84a5e0a007c92cf8096479801908e1803d5b9600a86a17a79e5effb38b9f69b2","observation_id":"dd6243d2-5f39-4a9b-aa0b-ab6b4b75eb2d","resolution":{"observed_at":"2026-08-05T11:42:46.563468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.545135Z","title":"Enhancing sharpness-aware optimization through variance suppression,","venue":null,"work_id":"c097bdf7-f247-447e-8931-02b59d489d03","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.649761Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:a5da133971b694e4ff45c0244ad50c67cac2767053ba5c3e1eb6882e5e6da84d","observation_id":"552c8fcd-bc82-4fd7-9ebc-9e8533b06db8","resolution":{"observed_at":"2026-08-05T11:42:46.549660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.529452Z","title":"Stochastic first-and zeroth-order methods for nonconvex stochastic programming,","venue":null,"work_id":"9c0cdf51-7c13-40a5-8a53-a7e47a6610f5","year":2013},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.653603Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:d9f995528577cb822535759522923c6d2f0547c3d9964411441ebc3f6565a734","observation_id":"c1c96856-9417-4404-a1a4-134d21e6c0df","resolution":{"observed_at":"2026-08-05T11:42:46.534505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.04838","last_updated":"2018-02-08T20:40:22Z","snapshot_observed_at":"2026-07-06T05:00:05.796040Z","submitted_at":"2016-06-15T16:15:53Z","title":"Optimization Methods for Large-Scale Machine Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.04838","snapshot_observed_at":"2026-08-05T11:42:45.657290Z","title":"Optimization methods for large-scale machine learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.657290Z"},"links":{"cited_paper":"/paper/1606.04838","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:d92bfbf4970997480c44c7194ec435f20435e3e61a245da5389739ae36b32ffa","observation_id":"6530d78d-3d9e-407f-8ef0-ba9e538eb5ed","resolution":{"observed_at":"2026-08-05T11:42:45.657290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.515341Z","title":"Make sharpness-aware minimization stronger: A sparsified perturbation approach,","venue":null,"work_id":"1b0f7f7d-23bb-47f5-88ff-9a316b9e31f8","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.661299Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:4119e16eb7866a538abd8a606e993cb1874555f7b800416d21689d67372f1761","observation_id":"4c1590c5-2cb5-4741-877e-f5721e141916","resolution":{"observed_at":"2026-08-05T11:42:46.520035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.501355Z","title":"Stochastic Frank-Wolfe methods for nonconvex optimization,","venue":null,"work_id":"d42a7da6-cae4-4a98-ba14-6fa6932eb435","year":2016},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.665502Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:664d64a2ed65a2910041116982c74f23b98c058275565b0bbcb2eee35d761cf0","observation_id":"b1e4bdab-8374-4ccb-9ec0-143dbe4ae392","resolution":{"observed_at":"2026-08-05T11:42:46.505869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.487825Z","title":"Attention is all you need,","venue":null,"work_id":"578ea23c-cf42-4d9d-9e8c-9c227bd6e993","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.669422Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:f1afee3d43a7509f4c4d7a0bb02a7844fefd8ef4488265f1b56f409e17e086ac","observation_id":"731896f6-2d85-4f0f-bb76-f03fd5ed6691","resolution":{"observed_at":"2026-08-05T11:42:46.492259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.474198Z","title":"Accelerating stochastic gradient descent using predictive variance reduction,","venue":null,"work_id":"a1780faf-d6a6-4468-8bac-c3bbda03f051","year":2013},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.673191Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:dcdf30813d494893b8a3d60d9bd5788b59d4d22cd2fd729045f68101b15fe256","observation_id":"90f80038-8edc-456f-832d-ec7c922b39de","resolution":{"observed_at":"2026-08-05T11:42:46.478673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.460364Z","title":"SARAH: A novel method for machine learning problems using stochastic recursive gradient,","venue":null,"work_id":"a7bc29e5-e55d-448c-bfd9-46b5d0986d92","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.677234Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:8bc76cbc737c474ba6c25479f5246079b113fc04593fa1934d400307d28080f1","observation_id":"5d4482f1-76e4-4426-b5b2-333ee8f9ba0e","resolution":{"observed_at":"2026-08-05T11:42:46.464688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.447141Z","title":"Almost tune-free vari- ance reduction,","venue":null,"work_id":"da3b170d-05a3-4762-9a7c-bbe55fb81d22","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.681045Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:956170d73adb2f6f010c353babc86fcbd699140f13e0beeac64a120a92a3ef88","observation_id":"b3a3b948-d670-4cb6-9cbc-c439fda101ce","resolution":{"observed_at":"2026-08-05T11:42:46.451306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.433688Z","title":"On the convergence of SARAH and beyond,","venue":null,"work_id":"6f6a5d42-4af2-447d-8c01-0e2d89ab26db","year":2019},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.684743Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:317d6efa0f6b9e7afc710d3a0af3b10c30c84ae88f69605da5da8dd4b6919bc7","observation_id":"24c6bdfe-a4bd-4d0f-bbc9-c52199e19d35","resolution":{"observed_at":"2026-08-05T11:42:46.438046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.419576Z","title":null,"venue":null,"work_id":"a1d0a312-9afc-4b58-a324-7859fa2db9ae","year":2000},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.688428Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:6b9bae5a2a27991527063c2fe387f451f8efda6f230d782dc24f4dda909d03d5","observation_id":"66f36c2a-8670-42a7-8419-809c2a29b686","resolution":{"observed_at":"2026-08-05T11:42:46.423707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.406269Z","title":"ASAM: Adaptive sharpness-aware minimization for scale-invariant learning of deep neural networks,","venue":null,"work_id":"6bb9f4ad-3856-4dc2-8706-944d341cefa4","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.692156Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:8ae6929f12d4cfa485900c5c8b652d6303125b62c918ea88748d68b3ea295a3e","observation_id":"a57f5ec8-73ec-4e52-87d5-52b25a3509a7","resolution":{"observed_at":"2026-08-05T11:42:46.410706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04552","last_updated":"2017-11-29T14:51:40Z","snapshot_observed_at":"2026-07-06T05:55:22.966528Z","submitted_at":"2017-08-15T15:21:53Z","title":"Improved Regularization of Convolutional Neural Networks with Cutout","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.04552","snapshot_observed_at":"2026-08-05T11:42:45.695948Z","title":"Improved regulariza- tion of convolutional neural networks with cutout","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.695948Z"},"links":{"cited_paper":"/paper/1708.04552","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:37d3fb92db1523dce143991a7a15b57bfb02e95afb2936766645a58bfd4360b7","observation_id":"85f035cf-0cd0-4c6e-87ed-ed844c9b3fe1","resolution":{"observed_at":"2026-08-05T11:42:45.695948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.391411Z","title":"ImageNet: A large-scale hierarchical image database,","venue":null,"work_id":"43329e2b-76ab-4cbb-8803-f6486e0c664a","year":2009},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.700126Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:8ad027029d673247fdb7e63fe667c01bc77fb8d020e93add6144576d90fda4ba","observation_id":"1a977cdc-94ea-4cf7-b92a-cb78536e53d9","resolution":{"observed_at":"2026-08-05T11:42:46.397045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.377075Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"f6ea3390-689e-47b9-89ac-ea657b7ce5cd","year":2014},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.703679Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:f616fa4b57abb8403572a010ffe8f67ef68920f280594e574a9e3299045c23eb","observation_id":"e72aa39c-7231-4e5a-a5c4-8131b50ecf53","resolution":{"observed_at":"2026-08-05T11:42:46.381919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.363763Z","title":"Domain generalization: A survey,","venue":null,"work_id":"0595451f-368e-4843-b43e-32c53bc1dacd","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.707437Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:3f18f8a67eea90180cbc200472303e1d5444dfdf1959fbc041bb88796b25d1be","observation_id":"53b76dd9-3b80-400c-95df-98943471a61b","resolution":{"observed_at":"2026-08-05T11:42:46.368051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.349792Z","title":"Unsupervised domain adaptation of object detectors: A survey,","venue":null,"work_id":"c4b00ac0-89af-4f8f-92ca-f2b91036ca53","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.711018Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:4c17fa3e6b1bd535f41403d9b4223695e2bd3ff8b966c59a121701daaa6da050","observation_id":"273e0725-0693-47aa-8192-97ad6d6f4474","resolution":{"observed_at":"2026-08-05T11:42:46.354053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.336493Z","title":"Sharpness-aware gradient matching for domain generalization,","venue":null,"work_id":"41a90999-7e67-408a-b525-270cd9439292","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.714571Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:fac6244440ba84d0386f845780aeaef33dbf9513847a5b28513239ca8e52a5f2","observation_id":"43e343cb-27be-4c82-b0b3-196035a69680","resolution":{"observed_at":"2026-08-05T11:42:46.340737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.323197Z","title":"In search of lost domain generalization,","venue":null,"work_id":"2dc49360-6dbb-40a5-8233-ff76a62bbff6","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.718149Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:5148ffe65be7ab5045be2302b7cd1f7075bbb51c9ca7a91793a8a7dfb45eb4c8","observation_id":"ddf485ac-bff1-4511-821a-eab2b5c2ff3c","resolution":{"observed_at":"2026-08-05T11:42:46.327609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.309267Z","title":"Deeper, broader and artier domain generalization,","venue":null,"work_id":"3caa51fc-2e17-4f72-b80a-131c3f74b60e","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.721769Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:111f50146f6c9c3c092e9824fe7ae31419330944e6522c5fa93b70308f6ac77f","observation_id":"eb41a3a1-f0ec-448b-9c1a-614829754e1f","resolution":{"observed_at":"2026-08-05T11:42:46.313540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.295370Z","title":"Unbiased metric learning: On the utilization of multiple datasets and web images for softening bias,","venue":null,"work_id":"a79b140f-323d-4823-8bca-4c4191e54a93","year":2013},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.725282Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:eb8544f92ac90dc32d03a25e64139764176d4f2d0f94a5e198ecd9fda44068f7","observation_id":"1cee2645-f7a8-4568-af6e-e230a77056b8","resolution":{"observed_at":"2026-08-05T11:42:46.300384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.281676Z","title":"Deep hashing network for unsupervised domain adaptation,","venue":null,"work_id":"6ea48211-5d6f-4ea0-a672-00b965e470d8","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.729393Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:80f60d27e8940ee558d9885f814fdeb5ad44df8bd977d69b9637431a0cc47bad","observation_id":"5b665f3c-0a2e-4405-93db-209befb51a65","resolution":{"observed_at":"2026-08-05T11:42:46.286389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.267984Z","title":"Recognition in terra incognita,","venue":null,"work_id":"fded1d54-800e-4c4d-a1ef-3117e1f2161e","year":2018},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.733012Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:bdea451be529f89630b95a8a7743c9e50684cbcad5323820e228929c05ab7d4d","observation_id":"2d7c53cd-fb69-4bf7-8542-b967c6aeae24","resolution":{"observed_at":"2026-08-05T11:42:46.272189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.254600Z","title":"Sharpness-aware gradient matching for domain generalization,","venue":null,"work_id":"d2611a64-ff7c-43a6-93ac-f9349e00c430","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.736786Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:82270574229c1b84d835b1cd63e1851fd4379ce9ff4366ca0dfb5d724b118bbd","observation_id":"330fc483-4b76-4ad1-9a3f-eaeb394414af","resolution":{"observed_at":"2026-08-05T11:42:46.258831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.240514Z","title":"Dynamic loss for robust learning,","venue":null,"work_id":"2da6a1fb-4a4e-40a9-97cc-0ce7110e13af","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.740358Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:ac10246ebe332bb39e84b8ea75755aefa07e03f7c60f638f87d4cfd4ab87719f","observation_id":"2e60600f-ae72-47d5-a62c-f844f9cfa537","resolution":{"observed_at":"2026-08-05T11:42:46.244978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.227618Z","title":"Report on the 11th iwslt evaluation campaign, iwslt 2014,","venue":null,"work_id":"021f8afb-35bd-4efd-b74b-0eca4a50a42d","year":2014},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.744078Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:4e0259fe747fa74f8412b75f2f04f26e0a77abf2f2d6a4992a9ed0e4520ecf7a","observation_id":"78c8534a-12eb-4739-ac0e-56ef0bb261ab","resolution":{"observed_at":"2026-08-05T11:42:46.231865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.214838Z","title":"The break-even point on optimiza- tion trajectories of deep neural networks","venue":null,"work_id":"ba234254-d5e0-40a4-b2f8-dccbf69c40b4","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.747726Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:d8f182f0b1ec062dbee0622a5eae5a934cc5642092d01bb99d97c8ec82aa41fb","observation_id":"450e2462-34fe-4d5c-8f37-5a92f1ab48d8","resolution":{"observed_at":"2026-08-05T11:42:46.218819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.201895Z","title":"An investigation into neural net optimization via hessian eigenvalue density","venue":null,"work_id":"43b645ea-2aeb-4bbc-8a4e-ea096d5cbf00","year":2019},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.751596Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:98cfddd579dcef192bd331fe418e4c881f0b0405aa17de390e48b87806abbcf0","observation_id":"1773e90d-85b4-4699-9b0b-4bce5b3c494e","resolution":{"observed_at":"2026-08-05T11:42:46.205887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.188617Z","title":"Visu- alizing the loss landscape of neural nets,","venue":null,"work_id":"3727c4cf-c343-44f2-a768-1e10566d7e7d","year":2018},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.755131Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:919bcd756b0ab9b4ff290ca98445a7b69e59c96bd5d7f0640d94ade3f72ec289","observation_id":"74dc1ef3-68d1-4414-a43e-a99330c75458","resolution":{"observed_at":"2026-08-05T11:42:46.192825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.04623","last_updated":"2018-09-13T09:29:55Z","snapshot_observed_at":"2026-07-06T06:09:11.794595Z","submitted_at":"2017-11-13T15:11:56Z","title":"Three Factors Influencing Minima in SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.04623","snapshot_observed_at":"2026-08-05T11:42:45.758848Z","title":"Three factors influencing min- ima in sgd,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.758848Z"},"links":{"cited_paper":"/paper/1711.04623","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:5622e3d292e8297ece8c04e9437f2ebbb9e038589ae360a999b953e237fb3194","observation_id":"f3b02148-0758-4b4e-8f06-dcb62fd97084","resolution":{"observed_at":"2026-08-05T11:42:45.758848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.175321Z","title":"Computing nonvacuous generalization bounds for deep (stochastic) neural networks with many more parameters than training data,","venue":null,"work_id":"237c4344-bb21-4052-bd30-4a37b8b4808b","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.762856Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:c7947344788fe96ac2b6e4ec529e62a9115419302a99cba2705c812332c52c45","observation_id":"ac7c04a6-4f66-419e-989b-f123b4dce0b9","resolution":{"observed_at":"2026-08-05T11:42:46.180109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.162960Z","title":"Exploring generalization in deep learning","venue":null,"work_id":"2962921f-4a8a-45e3-96ec-8b3b7bc0af83","year":2017},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.766336Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:ada567a8ac58b5ceceffd6a77c0164b88976a0342b2502d5d26891027e6bdc65","observation_id":"9b72f950-743e-4882-8a76-61b7b540803e","resolution":{"observed_at":"2026-08-05T11:42:46.166748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.150695Z","title":"On the generalization of models trained with sgd: Information-theoretic bounds and impli- cations,","venue":null,"work_id":"965250db-bf1f-4413-9410-789d33f1fa3e","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.770142Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:d09b1567496e1011d98b1db228e534c42766e8a97069e22790c512b7fd8f27ff","observation_id":"f8c66afc-1fcf-40ce-b4e7-93d9673c6b27","resolution":{"observed_at":"2026-08-05T11:42:46.154610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.137384Z","title":"Averaging weights leads to wider optima and better generalization,","venue":null,"work_id":"49ebbdb0-f69a-4e9f-960d-f8d941945642","year":2018},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.773723Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:1481a3179a47ec0f78357b8a7b32007851cb8009b29955ccab98ddefb966e504","observation_id":"ed41777a-ab79-4631-8b5d-08a4cc9bd2ab","resolution":{"observed_at":"2026-08-05T11:42:46.141358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.124489Z","title":"Adversarial weight per- turbation helps robust generalization,","venue":null,"work_id":"644011e3-50d1-481a-b6f7-8bf5d163eb4e","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.777449Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:47dcd4bf73a5d20bd366fa00d7f0aa6d0c92c4ca4bafe30f1f4d2130ab2238cc","observation_id":"1b515a27-19ee-4e4b-b0f6-6251435989c5","resolution":{"observed_at":"2026-08-05T11:42:46.128622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.111386Z","title":"Penalizing gradient norm for efficiently improving generalization in deep learning,","venue":null,"work_id":"5f9b38ab-741c-4bb8-857b-95ce57141af7","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.781057Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:6783fc2813d68656d1e7176af1e5651ebadc0f8e561dbf90698d83e43ee11265","observation_id":"36fa7176-81e5-4862-9448-4d7df5200040","resolution":{"observed_at":"2026-08-05T11:42:46.115477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.098233Z","title":"Implicit gradient regulariza- tion,","venue":null,"work_id":"426b6b12-d48f-4127-91aa-e83cf17cf56b","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.784613Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:3c1ea133318699b87a2d783489e46ef3a46c9e4f2745157389c661b88fb3b122","observation_id":"b3774b03-1c10-4b82-9bb5-dedb5d441123","resolution":{"observed_at":"2026-08-05T11:42:46.102295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10181","last_updated":"2023-01-27T06:16:31Z","snapshot_observed_at":"2026-08-05T16:54:13.587791Z","submitted_at":"2023-01-27T06:16:31Z","title":"Exploring the Effect of Multi-step Ascent in Sharpness-Aware Minimization","version":1},"cited_work":{"arxiv_id":"2302.10181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.10181","snapshot_observed_at":"2026-08-05T11:42:45.854480Z","title":"Exploring the Effect of Multi-step Ascent in Sharpness-Aware Minimization","venue":"cs.LG","work_id":"04d7ab10-897c-4bc0-8334-7bb91e5900d4","year":2023},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.788548Z"},"links":{"cited_paper":"/paper/2302.10181","citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:4fdcb29d8921e0bfab13581e851717beb14f45d7721ea9eeb213cf74374a61f7","observation_id":"73f34713-0f92-471b-9806-d29fea42005a","resolution":{"observed_at":"2026-08-05T11:42:45.860340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.085456Z","title":"Stochastic con- ditional gradient methods: From convex minimization to submodular maximization,","venue":null,"work_id":"20285c3e-15bd-4b82-b154-0409a2887a14","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.792347Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:83b7176aeb41c6e580ced4ab91b472de88a3a2b676247965e3d82dd1cd1a8ba9","observation_id":"9929a0b2-4f8b-4f8e-b1bd-111ee4b8a846","resolution":{"observed_at":"2026-08-05T11:42:46.089473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.071862Z","title":"Accelerating Frank- Wolfe with weighted average gradients,","venue":null,"work_id":"ecf8db88-cde9-415f-889b-bf2d691f5d27","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.796134Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:8ccaec1afc42be633a86ffcaf10fcc1b19426ca8bfc750c4d0ca83e7eda27ed0","observation_id":"b41addae-29d3-45c0-a469-802e78c5e4f3","resolution":{"observed_at":"2026-08-05T11:42:46.076486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.058195Z","title":"Heavy ball momentum for conditional gradient,","venue":null,"work_id":"00244bbb-f440-42c0-a0e4-412bffdc7585","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.799627Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:921ed4749df2397038770a1fdceb8c77520ed95a6a55a204b049a21c707270e1","observation_id":"226e8cd7-45cd-42a2-960d-8d6585639715","resolution":{"observed_at":"2026-08-05T11:42:46.062355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.044206Z","title":"Understanding and increas- ing efficiency of Frank-Wolfe adversarial training,","venue":null,"work_id":"cc653837-384f-4a3b-97bd-1f8c4e17600e","year":2022},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.803186Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:8e09c4d272451acc7f53a1d8e0e344db4eba520463b0a4b7161facfc5b5ba704","observation_id":"0e48023d-d671-4661-87de-237c418d2d27","resolution":{"observed_at":"2026-08-05T11:42:46.048190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.030485Z","title":"A momentum-guided Frank-Wolfe algorithm,","venue":null,"work_id":"53a95021-e061-4ed4-b127-ac6d0d0a18d0","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.806873Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:16b0645fccb842f4d6f743a753964000ed1ad39acdb7d16f68d60d9d14a7a98a","observation_id":"38209de2-c405-41e1-bd09-714c173accff","resolution":{"observed_at":"2026-08-05T11:42:46.034426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.016843Z","title":"Enhancing Frank-Wolfe with an extra subproblem,","venue":null,"work_id":"ba14efca-0896-4a6f-ac69-48118839cc09","year":2021},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.810456Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:45618b790b9cdf9f7b0558beee57d8ce387a69b4c750f8a3e41179d65df7a996","observation_id":"15d876f0-746e-4c75-8edd-c134de922df8","resolution":{"observed_at":"2026-08-05T11:42:46.020959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:46.003091Z","title":"Accelerated stochastic gradient-free and projection-free methods,","venue":null,"work_id":"80772024-6eb6-4f37-b3b8-357648769d7a","year":2020},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.813963Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:5c9ccadff4f456ce08d906af4210f530f9623085f0eb9b2dbe0bad98ca9e5cdf","observation_id":"6e40ece2-246b-4b7c-9e01-7838826f6521","resolution":{"observed_at":"2026-08-05T11:42:46.007513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:42:45.989933Z","title":"Scaling is used to vary the SNR","venue":null,"work_id":"6e1ed2bc-147d-49e4-9eb3-6684a9533e5a","year":null},"citing_paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T11:42:45.817678Z"},"links":{"citing_paper":"/paper/2509.02433"},"observation_digest":"sha256:ebe348b8c271e76ac876b3bba7bd779819f251320584c520432e576167d04661","observation_id":"8cedb89a-5796-473b-94a5-19dfb807e53e","resolution":{"observed_at":"2026-08-05T11:42:45.993670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02433","last_updated":"2025-09-02T15:35:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:28:56.904458Z","submitted_at":"2025-09-02T15:35:46Z","title":"VASSO: Variance Suppression for Sharpness-Aware Minimization"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":58},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2509.02433."}