{"as_of":"2026-08-09T02:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a74e65e8deb7c69cc887067f355f0b220f84f247ecea055afefe3d7ad25dabb2","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:23:52.037279Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:36:46.924135Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:58.438161Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"cited_work":{"arxiv_id":"2508.00180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00180","snapshot_observed_at":"2026-07-04T16:49:58.438161Z","title":"Ema without the lag: Bias-corrected iterate averaging schemes","venue":null,"work_id":"fdf3d55b-fa1b-4f7c-ab8b-101c3c658747","year":2025},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-07T14:30:24.863446Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T00:09:54.353782Z"},"links":{"cited_paper":"/paper/2508.00180","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:a6bd44d45cb12273f0446f8f6bf24373d64d762744a61093c24afa195f9e1006","observation_id":"374ef32c-908d-4e31-9576-f1af93cdc24d","resolution":{"observed_at":"2026-07-04T16:49:58.439604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"cited_work":{"arxiv_id":"2508.00180","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00180","snapshot_observed_at":"2026-07-04T16:49:58.438161Z","title":"Ema without the lag: Bias-corrected iterate averaging schemes","venue":null,"work_id":"fdf3d55b-fa1b-4f7c-ab8b-101c3c658747","year":2025},"citing_paper":{"arxiv_id":"2606.25086","last_updated":"2026-06-30T16:49:44Z","snapshot_observed_at":"2026-08-07T14:30:24.863446Z","submitted_at":"2026-06-23T18:47:40Z","title":"Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T06:36:46.924135Z"},"links":{"cited_paper":"/paper/2508.00180","citing_paper":"/paper/2606.25086"},"observation_digest":"sha256:5bd7b4d12bef84cdf65b55985a7a66e2ad08c390544e92cf9e3f31e10acbead3","observation_id":"a0734cca-aa0f-4edd-a9cf-aafd1e765fd1","resolution":{"observed_at":"2026-07-01T09:25:41.338906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.00180/citation-record","integrity":"/paper/2508.00180/integrity","json":"/paper/2508.00180/citation-record.json","paper":"/paper/2508.00180"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T10:23:45.651809Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.651809Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5dc434ffe743de1c1425c760601e15b38aae87a427d013bb481d4f94df1c1241","observation_id":"77d65f5c-2ad6-45b1-8128-7fa0df78b51b","resolution":{"observed_at":"2026-08-06T10:23:45.651809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.744826Z","title":"High-dimensional limit theorems for sgd: Effective dynamics and critical scaling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.744826Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:2608ff6cd320729aaa73e621d2b6775eef92b1eeeefb4dc87fd60f951f85a556","observation_id":"2fd7dd10-ca30-4ebc-995a-d843395cfb1d","resolution":{"observed_at":"2026-08-06T10:23:45.744826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.821133Z","title":"Provable guarantees for generative behavior cloning: Bridging low-level stability and high-level behavior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.821133Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:05678ce98cb4ea1cf6051f703bf8a9c869ebec990369003409b37ecac3e5174b","observation_id":"896df6f7-d37c-412f-96ea-fef7358e4f68","resolution":{"observed_at":"2026-08-06T10:23:45.821133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:45.847970Z","title":"Butterfly effects of sgd noise: Error amplification in behavior cloning and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.847970Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d666c7b5033b35ac6cb7fc251a0cd0d8f86159062cfb20071ac381a146f7c62a","observation_id":"93c7e947-9878-47dd-9ea3-2962ab80e862","resolution":{"observed_at":"2026-08-06T10:23:45.847970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.710547Z","title":"Approximation methods which converge with probability one","venue":null,"work_id":"c98aee12-98e0-466a-a182-c0dfbb03f937","year":1954},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:45.891086Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:491c569bdaf672d430252b5ce8f26124adda596db1e7e9c06b9a8d8f033d502d","observation_id":"4f3e6366-e1a1-40cf-96b8-f73a2e26bc03","resolution":{"observed_at":"2026-08-06T10:23:52.713434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.701591Z","title":"How to scale your ema","venue":null,"work_id":"e79b72d7-060c-4765-9f3e-d399c6763f83","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.086657Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5a0c52d40f0d9f34b9483290756b714cd6fba6588d229a4bd1c1614a580535af","observation_id":"71712a5f-ec88-4c23-b972-f6cb2bfc0284","resolution":{"observed_at":"2026-08-06T10:23:52.704441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02559","last_updated":"2020-10-06T09:06:07Z","snapshot_observed_at":"2026-08-09T00:26:34.313498Z","submitted_at":"2020-10-06T09:06:07Z","title":"LEGAL-BERT: The Muppets straight out of Law School","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02559","snapshot_observed_at":"2026-08-06T10:23:46.241953Z","title":"Legal-bert: The muppets straight out of law school","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.241953Z"},"links":{"cited_paper":"/paper/2010.02559","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:382483877e3f72206fd6b6d6e950bf63c6f024bb665e32a9382ea07783d7005f","observation_id":"739fa8a4-4a7e-4faf-9323-205d53801095","resolution":{"observed_at":"2026-08-06T10:23:46.241953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.691658Z","title":"Incorrect baseline evaluations call into question recent llm-rl claims, 2025","venue":null,"work_id":"14d4cf45-55df-4301-87d8-68b5b30bbd3d","year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.351256Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:13e12667fbc79368191533a63940e8a1ac1137f4df1a5dea84bc0cc2fd0f166f","observation_id":"658e397c-b1a2-46e6-a480-ba086aed9129","resolution":{"observed_at":"2026-08-06T10:23:52.694876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11816","last_updated":"2023-11-13T18:51:42Z","snapshot_observed_at":"2026-08-05T05:51:39.603424Z","submitted_at":"2023-06-20T18:19:17Z","title":"Learning to Generate Better Than Your LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11816","snapshot_observed_at":"2026-08-06T10:23:46.465760Z","title":"Learning to generate better than your llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.465760Z"},"links":{"cited_paper":"/paper/2306.11816","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5fae935f084b9dc4f50152667939c21373c4b45a7404b383e39f56830771ca65","observation_id":"1693cfb4-1984-47db-a98a-c47900d5666c","resolution":{"observed_at":"2026-08-06T10:23:46.465760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.682301Z","title":"Bidirectional looking with a novel double exponential moving average to adaptive and non-adaptive momentum optimizers","venue":null,"work_id":"025aaa82-da52-48db-8aa6-e2d5733c23f1","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.525397Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e8ddfd1149e17202f64ebd9bf13cfce387b1e3cc1d28b022839736c99af7c667","observation_id":"e92d7ade-133c-4a6c-a0a6-5c32c8cc73db","resolution":{"observed_at":"2026-08-06T10:23:52.685663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:46.595345Z","title":"Double/debiased machine learning for treatment and structural parameters, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.595345Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d1b02ffb30df3a74cf6b2132eb7d6ce733935844b1202c79698b96f69e0b3711","observation_id":"62db7694-fe61-409d-9657-a56932319d04","resolution":{"observed_at":"2026-08-06T10:23:46.595345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:46.712637Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.712637Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d5706912e04f4f2e12cc3bf2ca91ca96e788c15dd8303126b264f56c4a3f31c3","observation_id":"8083e651-f737-47e3-8a4c-7f1cb04ceaeb","resolution":{"observed_at":"2026-08-06T10:23:46.712637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T10:23:46.829935Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.829935Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:65939d1dcbb4a4234d73d9155b43aecbf9b78712e97365b9ca018b8d8e3bf0bc","observation_id":"e6e0a726-cff1-4a2a-b042-9c8d44377b3c","resolution":{"observed_at":"2026-08-06T10:23:46.829935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T10:23:46.868383Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.868383Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:deabbf74f6b5f27a0968d2a102555e348cb46c850079fc31f22a2232f83a6db5","observation_id":"cfa83e9a-5329-42f5-a3fc-6079bdc55943","resolution":{"observed_at":"2026-08-06T10:23:46.868383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-06T02:48:08.712124Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-06T10:23:46.940838Z","title":"Gradient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:46.940838Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:956bbb20b2dc0c7ab33e7e3d70bdbdf27c9b59fb62743ee0cf1c1d779416c080","observation_id":"9d96bd46-3797-412d-a50d-1b9585d41287","resolution":{"observed_at":"2026-08-06T10:23:46.940838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.049340Z","title":"Saga: A fast incremental gradient method with support for non-strongly convex composite objectives","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.049340Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5982cd5e69a0d9d243949e8265cfb6679e17cb81a91ed0aec6eefb2ffdfc50e0","observation_id":"39618f0a-9a58-4c81-92e1-093b7557d8d4","resolution":{"observed_at":"2026-08-06T10:23:47.049340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.656873Z","title":"Averaged least-mean-squares: Bias-variance trade-offs and optimal sampling distributions","venue":null,"work_id":"cf829f7f-7908-4377-9f7e-b6ac1257bf27","year":2015},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.109317Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:e4c631f9b4f5c0e125d1f5fa9c6e5845e98cbb4d41c14ff6e526d5f10c9fe48a","observation_id":"289142f1-3423-4b30-9061-e1b4c64b5796","resolution":{"observed_at":"2026-08-06T10:23:52.660256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.648142Z","title":"Harder, better, faster, stronger convergence rates for least-squares regression","venue":null,"work_id":"6bd6dc0e-7b6e-4176-a1e0-dd9d1946e9a4","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.232493Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:428546b2816b171c13db8c0ab946e8a71183e69a42b8f6275656ecedf1240f4b","observation_id":"ccb16d40-0472-4d07-b715-80d9f10420f0","resolution":{"observed_at":"2026-08-06T10:23:52.650886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.286455Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.286455Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1c20d85a1264c0a27013013cde127892d4356a9f296437e611729cfb96b3d158","observation_id":"13b7bb9e-5939-40de-b10a-ca467174d357","resolution":{"observed_at":"2026-08-06T10:23:47.286455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.633625Z","title":"Is behavior cloning all you need? understanding horizon in imitation learning","venue":null,"work_id":"3a0dba16-196d-44d4-a59a-dbe940d90d9e","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.382502Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ee065d76ee50c31875db85a885c3bf5232194e4eb25fcde261a27c7b604318d2","observation_id":"5dfb3620-86a9-4642-8b03-f979ba971b2f","resolution":{"observed_at":"2026-08-06T10:23:52.636518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T10:23:47.454252Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.454252Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:97ef998aa17301f372554477a4155e598c48973c85836a4ab49b0013cc89aa5c","observation_id":"98952c78-f52a-43a7-8762-b8befb25b1ea","resolution":{"observed_at":"2026-08-06T10:23:47.454252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.625436Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"2a1ad12d-500a-489b-8b3b-df47c685782c","year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.588289Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:dde2ae18d4d356a38ca2c65e3df83267d237dca8c000a2b519b48205bd0a2a3a","observation_id":"2d917c7c-1e02-4cba-b043-0fc3e628a464","resolution":{"observed_at":"2026-08-06T10:23:52.628324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.675863Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.675863Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:880fcb822adf78b435fc9a03ae5e6514f0f0445bb29b232793cd76f20c722f09","observation_id":"c7d64f01-90ce-482c-9e60-ac4c9f22bc6d","resolution":{"observed_at":"2026-08-06T10:23:47.675863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.715586Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.715586Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:58579c879235c1cb024e5c56b2fb2c24dbf28878113168423f1c524df789cb5e","observation_id":"b5a3b82a-2d64-46fe-9b46-5323414f16b9","resolution":{"observed_at":"2026-08-06T10:23:47.715586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-06T10:23:47.788636Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.788636Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f9f9b070f79fad6c57250a556d92dfead550ae64cb310261896322e67477b3c9","observation_id":"25f37361-a597-4e58-b341-fbe7cadf4fe0","resolution":{"observed_at":"2026-08-06T10:23:47.788636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:47.969468Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:47.969468Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:df319343d566b3174745b502a37e719313e9e3ec7d39c60dc4dd49f0c26a526d","observation_id":"2b320dce-cf3e-4c70-ac64-2d6cafb1a769","resolution":{"observed_at":"2026-08-06T10:23:47.969468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:48.111032Z","title":"Accelerating stochastic gradient descent using predictive variance reduction","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.111032Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a1b904a8ca3f8e2831dec9cdbbe85323f5d632594c2d3d4c53cafeef0833d4c2","observation_id":"1896506d-1216-420a-8999-dadc4a973a61","resolution":{"observed_at":"2026-08-06T10:23:48.111032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14981","last_updated":"2022-10-06T17:57:36Z","snapshot_observed_at":"2026-08-07T10:12:16.147632Z","submitted_at":"2022-09-29T17:46:13Z","title":"Stop Wasting My Time! Saving Days of ImageNet and BERT Training with Latest Weight Averaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14981","snapshot_observed_at":"2026-08-06T10:23:48.286379Z","title":"Stop wasting my time! saving days of imagenet and bert training with latest weight averaging","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.286379Z"},"links":{"cited_paper":"/paper/2209.14981","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:0d44a58dd67b6722d06548ded858953282e7562648fcd4cfb3d1a851925e6dea","observation_id":"96672192-4172-4668-8c19-b26010b8810b","resolution":{"observed_at":"2026-08-06T10:23:48.286379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.591396Z","title":"No train no gain: Revisiting efficient training algorithms for transformer-based language models","venue":null,"work_id":"945966d7-0f94-4064-97b3-8cf64997d40d","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.404641Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:8c42475cf02ff9568791306ce33a0dd5ab89fa8331b5adedfc313622b9d642b5","observation_id":"09d638c1-2edc-4312-bfa7-39834e488387","resolution":{"observed_at":"2026-08-06T10:23:52.594443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T10:23:48.550625Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.550625Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d2aacff03b879ca7837ba16ce584c871ca05f63b84a50976339977dfa6edf767","observation_id":"27489973-0d4f-4fca-bbb8-1ddfbc324af7","resolution":{"observed_at":"2026-08-06T10:23:48.550625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02696","last_updated":"2024-03-20T12:58:14Z","snapshot_observed_at":"2026-07-06T16:57:09.664139Z","submitted_at":"2023-12-05T11:55:47Z","title":"Analyzing and Improving the Training Dynamics of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02696","snapshot_observed_at":"2026-08-06T10:23:48.659364Z","title":"Analyzing and improving the training dynamics of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.659364Z"},"links":{"cited_paper":"/paper/2312.02696","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a3a213e84e2ced53108f7301c8b1edfdbb881cc3d7490ae7e3b672806f83dd14","observation_id":"edf4b9f7-060b-40ef-b8ac-f239fde50a20","resolution":{"observed_at":"2026-08-06T10:23:48.659364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T10:23:48.814561Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.814561Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:91fb696e366f3d199f7e0c5347d58ee24e080bee46bfdb0442aae026e4bf417e","observation_id":"32dc7719-8ef9-4931-9a68-79d2831431ec","resolution":{"observed_at":"2026-08-06T10:23:48.814561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.582047Z","title":null,"venue":null,"work_id":"f9ce70c2-4a33-4bff-b501-5e8da4fd8835","year":2012},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.845871Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5ed185ff503948996e29e9eba16262e0465ccecf41f68138c5834ab7c2c5e448","observation_id":"8798bd86-4e58-4e5f-b18c-fc4f255e4fee","resolution":{"observed_at":"2026-08-06T10:23:52.585249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.573304Z","title":"Statistical inference for ergodic diffusion processes","venue":null,"work_id":"684d4fd2-09f8-4674-bb45-23bbe5c731e0","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:48.958790Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b861e93a82d826ad2803d4993166004bd0fed77183a470cc8532e65be89c58b0","observation_id":"a4e38958-5226-4474-ad47-caaca1076791","resolution":{"observed_at":"2026-08-06T10:23:52.576321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:49.190251Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.190251Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:d89e30ed65ff6b65498089cd9cdd3e7f8ddf76e95b70104924acd76e06a79df0","observation_id":"c6e724a6-2d50-4fcb-8afe-e57fca99404a","resolution":{"observed_at":"2026-08-06T10:23:49.190251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T10:23:49.237889Z","title":"Tulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.237889Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:51ea4568fa06b2a14b2d2ef2c450f6653a85d98c233c4191faf0752668a6888a","observation_id":"a0a7993c-f5cd-4937-9f93-9d7ed7c6069b","resolution":{"observed_at":"2026-08-06T10:23:49.237889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.559079Z","title":"Brownian motion, martingales, and stochastic calculus","venue":null,"work_id":"d96c7ca7-a1b8-46e1-8daa-1bb6f3b60380","year":2016},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.371231Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a0c86dd0bbe521460e2dfbd5ebcce9ab0fdd43428130ad5b7246de4b0eae3890","observation_id":"66afda0a-b3f5-4f90-ae01-639a92707c1b","resolution":{"observed_at":"2026-08-06T10:23:52.561802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02596","last_updated":"2025-02-04T09:13:43Z","snapshot_observed_at":"2026-08-04T16:00:11.504753Z","submitted_at":"2024-06-01T05:55:15Z","title":"Slow and Steady Wins the Race: Maintaining Plasticity with Hare and Tortoise Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02596","snapshot_observed_at":"2026-08-06T10:23:49.456993Z","title":"Slow and steady wins the race: Maintaining plasticity with hare and tortoise networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.456993Z"},"links":{"cited_paper":"/paper/2406.02596","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f4aad04d0a2d0a303368e84628e56a00707354c7ee056e55c5d9c45d467fdc68","observation_id":"f31e223d-ed04-4978-b17c-ea41dc475b74","resolution":{"observed_at":"2026-08-06T10:23:49.456993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:49.577990Z","title":"Biobert: a pre-trained biomedical language representation model for biomedical text mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.577990Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ec2ac921d34f03764395420502e8a85e6eb5fc303222b1e6e7d1f54e7f5b3aae","observation_id":"9bf4a260-eafb-4224-a215-816eb2051fb1","resolution":{"observed_at":"2026-08-06T10:23:49.577990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.545470Z","title":"Theory of point estimation","venue":null,"work_id":"27830917-432b-4238-a38c-b02cc3105d9d","year":2006},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.729624Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:18c38c897efc8f38c697f9fe63fd1cf6252fcb244c1a01f39b158c30f60c9600","observation_id":"02ffbe8d-dd24-4b18-a2f7-d2fa7f8dec37","resolution":{"observed_at":"2026-08-06T10:23:52.548229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.535362Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":"bb56f596-d9fc-4995-99f1-041fa4c8c4d5","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.847926Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:11023479e44c8b7f02c4c54163d9df5a1807fda3b291cb0e3ed6a024807b9eca","observation_id":"00607ca9-db1b-4724-b9f2-5151132513de","resolution":{"observed_at":"2026-08-06T10:23:52.539762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09240","last_updated":"2024-10-06T17:44:46Z","snapshot_observed_at":"2026-07-06T17:30:03.953345Z","submitted_at":"2024-02-14T15:28:42Z","title":"Switch EMA: A Free Lunch for Better Flatness and Sharpness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09240","snapshot_observed_at":"2026-08-06T10:23:49.973613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:49.973613Z"},"links":{"cited_paper":"/paper/2402.09240","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:6560c4786f6c5ded064b7d18fb3fe110e1c5527d6ee02403b7e2bb05a93c16dd","observation_id":"314f98bd-a0a5-47c9-86d3-210482100d3b","resolution":{"observed_at":"2026-08-06T10:23:49.973613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.526618Z","title":"Statistics of random processes: I","venue":null,"work_id":"8f7d6f1c-dd60-4109-b2c6-b1f1115d7fc2","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.040897Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:4f5b8725bb3cae9e5b407c4f6e7a3a7ad8b146a528b5a0ba84b88e363e551487","observation_id":"6715869e-a04f-4124-85bc-61f40ef76e69","resolution":{"observed_at":"2026-08-06T10:23:52.529338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.516702Z","title":"Statistics of random processes II: Applications, volume 6","venue":null,"work_id":"73a1d6bc-8e4a-4b66-a245-1f80405f0fef","year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.182736Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:41bb13f6a55d6bb64923f78868540a4b1fef54a76ccbc601b430d1baa4f81e3e","observation_id":"eb64e063-3c2a-47b7-b32f-7ce796c46572","resolution":{"observed_at":"2026-08-06T10:23:52.520280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10047","last_updated":"2023-10-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:33:30.170449Z","submitted_at":"2023-10-16T04:11:19Z","title":"Improving Large Language Model Fine-tuning for Solving Math Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10047","snapshot_observed_at":"2026-08-06T10:23:50.334485Z","title":"Improving large language model fine-tuning for solving math problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.334485Z"},"links":{"cited_paper":"/paper/2310.10047","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f16eb12c72a04afc4923f0aded9c36a339aff0f8026d499f837efe30ee946994","observation_id":"3ae028ca-7d4f-4477-91b8-157b9104151d","resolution":{"observed_at":"2026-08-06T10:23:50.334485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T10:23:50.449308Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.449308Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:71b569eff46ac78872f8a473faf52ade9e7b3a9923e7fc5465a2d1762186173b","observation_id":"3531bf4d-9dac-43e8-9824-003672414d38","resolution":{"observed_at":"2026-08-06T10:23:50.449308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.507330Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":"28e0c25f-5a48-4918-849a-5eb2226dbdc4","year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.592820Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a2aa8dd3ab674b6e472933df1e4a482f66e658e77a26260ad2edb694f71f4486","observation_id":"9354b131-9533-4e5d-b039-e6df4926a553","resolution":{"observed_at":"2026-08-06T10:23:52.510379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.497489Z","title":"On the sdes and scaling rules for adaptive gradient algorithms","venue":null,"work_id":"e54183b2-5da5-4ba8-b2b5-ec9c4e9b3a6b","year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.740473Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:236ad10cbcc40dd114be7fa024b16168482680f4728b81586402956ada960f24","observation_id":"4c731e40-810a-4bef-a614-2d93dff90ae5","resolution":{"observed_at":"2026-08-06T10:23:52.500602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.487340Z","title":"A kernel-based view of language model fine-tuning","venue":null,"work_id":"5f4d1a15-ba76-40e8-8703-952ec1a80ba0","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:50.856525Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:fdea3039815b80158864e70d6a89035b0db80f5bd8275fc75dc21b6b821f3e2b","observation_id":"8218bda6-13f4-49a8-b80a-f68c516c1237","resolution":{"observed_at":"2026-08-06T10:23:52.490518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.477696Z","title":"Continuous-time limit of stochastic gradient descent revisited","venue":null,"work_id":"36f6cf4f-b280-4b63-8546-5a22870ad3e9","year":2015},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.026324Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b5a12620872a5dbb3d0301f74c6c4b76a1b515e8fe54c9dd594b91cb00211e8b","observation_id":"003eaaf9-a0fc-42a3-bf0e-6e5dfb9aa8d6","resolution":{"observed_at":"2026-08-06T10:23:52.480815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07612","last_updated":"2018-04-20T13:44:12Z","snapshot_observed_at":"2026-07-06T06:34:31.443070Z","submitted_at":"2018-04-20T13:44:12Z","title":"Revisiting Small Batch Training for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07612","snapshot_observed_at":"2026-08-06T10:23:51.098062Z","title":"Revisiting small batch training for deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.098062Z"},"links":{"cited_paper":"/paper/1804.07612","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:0b0013a6cee32cc04fba607737368b44b0087c48d11e29490abce6b1efd4c9eb","observation_id":"6d91ba18-c107-4815-8ff2-1f4b5fa364c7","resolution":{"observed_at":"2026-08-06T10:23:51.098062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.467721Z","title":"Scaling data-constrained language models","venue":null,"work_id":"07a09b87-4782-4812-819d-dc7345434ecb","year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.144262Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b9222225bf3ebc806d719f25317f5cfd1f88c1c9960db1ff6840faa07b85249e","observation_id":"0c8c19e7-d57e-4c68-b2db-ed8c2d61560a","resolution":{"observed_at":"2026-08-06T10:23:52.471882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.458830Z","title":"Smoothing data with faster moving averages","venue":null,"work_id":"ae8470f1-d2e7-42fa-b7f5-7dcdf1e76fff","year":1994},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.198764Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:514303f499f03d54421ade62dbbd9190c6044c9d38993063927ee91b32437b4d","observation_id":"20f73c62-3c1d-4e41-b91a-35c3b02ad8bf","resolution":{"observed_at":"2026-08-06T10:23:52.461579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.248593Z","title":"Introductory lectures on convex optimization: A basic course, volume 87","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.248593Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f4334831873be2ab5b755c04690be85356c25422fb57c109cdc0a9f2a8e833e8","observation_id":"bc56b3ed-8cf8-43b1-a2bb-ef7d4ee063bc","resolution":{"observed_at":"2026-08-06T10:23:51.248593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03137","last_updated":"2024-09-27T18:31:02Z","snapshot_observed_at":"2026-07-06T19:10:43.721644Z","submitted_at":"2024-09-05T00:13:16Z","title":"The AdEMAMix Optimizer: Better, Faster, Older","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03137","snapshot_observed_at":"2026-08-06T10:23:51.290978Z","title":"The ademamix optimizer: Better, faster, older","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.290978Z"},"links":{"cited_paper":"/paper/2409.03137","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:44d286ce6d6cccdd460dd24743c64be10ad5ebf61881ea0980ab499250a7b231","observation_id":"2c4a8d23-c44c-4622-a190-d8c2f52971b7","resolution":{"observed_at":"2026-08-06T10:23:51.290978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.355993Z","title":"Acceleration of stochastic approximation by averaging","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.355993Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1b9e3495574ff5fd97970d75a2d2856fb66b21d9ea7c63d7c0dbe71b357c828d","observation_id":"903ef485-a89c-4c09-a73f-5d0fed6b6d38","resolution":{"observed_at":"2026-08-06T10:23:51.355993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.439265Z","title":"Early stopping-but when? In Neural Networks: Tricks of the trade, pages 55--69","venue":null,"work_id":"2a7de958-8d4b-4ec1-bbdb-f908ee499c80","year":2002},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.405126Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:bb8a824d023c972ce682130f523cd55ecd0ef40c5e5e5a6d3b018781ff0eebc5","observation_id":"f677e7bf-abe4-4933-aff1-388584f22d12","resolution":{"observed_at":"2026-08-06T10:23:52.442277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.430578Z","title":"Non-convex learning via stochastic gradient langevin dynamics: a nonasymptotic analysis","venue":null,"work_id":"a81594b4-6b1c-4b9a-af8b-9e0e586314e8","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.485496Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3c569022418d504071e19a1a32d548d409dc96c05ff05ce97fd0dd5e162bbb19","observation_id":"2be369ba-6019-4b73-b08c-5dbffc90b2f0","resolution":{"observed_at":"2026-08-06T10:23:52.433596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.421178Z","title":"Breaking the data barrier: a review of deep learning techniques for democratizing ai with small datasets","venue":null,"work_id":"c4dd6502-4de6-45f4-bbee-aea07bd4ce42","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.560773Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:f52bce0bc9c0bab310a5bb7b4f2b295a16029e522ce22dd28886a4447d7cb277","observation_id":"0701a113-76b3-454d-b5fa-9eb10308df36","resolution":{"observed_at":"2026-08-06T10:23:52.424548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.615896Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.615896Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:22b13281ef1cca84821a8c5adaec9ea01fe406df3e8e71906441fa8aeda75a2e","observation_id":"2992878c-c911-417e-820b-29eedb5144d3","resolution":{"observed_at":"2026-08-06T10:23:51.615896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12465","last_updated":"2025-02-18T02:52:00Z","snapshot_observed_at":"2026-08-07T18:10:26.698188Z","submitted_at":"2025-02-18T02:52:00Z","title":"Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12465","snapshot_observed_at":"2026-08-06T10:23:51.683656Z","title":"Computational-statistical tradeoffs at the next-token prediction barrier: Autoregressive and imitation learning under misspecification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.683656Z"},"links":{"cited_paper":"/paper/2502.12465","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:032591c1ef76fbed906b32e9b6ce66c361f8c881b45d4184d46e60ba8f537d09","observation_id":"78351fb6-0bc2-4d51-b568-5f4c6915fac4","resolution":{"observed_at":"2026-08-06T10:23:51.683656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.748205Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.748205Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:532a4365de79c37a916cacd3ebb7b3b37155bced0e415ea26d1cd1fd8a6a8ffb","observation_id":"aa313c8a-d8d0-4e06-a8a6-aee62b6b93d6","resolution":{"observed_at":"2026-08-06T10:23:51.748205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.794840Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.794840Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:4a9e5a1cf5f9c357ce3f7d23974e14d0808f74f574d94de5602252a83a641c9e","observation_id":"b6c21b4a-dfc1-47d9-af30-0012d76567e7","resolution":{"observed_at":"2026-08-06T10:23:51.794840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:51.859645Z","title":"Efficient estimations from a slowly convergent robbins-monro process","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.859645Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c23b60bde08b733e740cfe99e6f64432a4bbc2ab5e2c3d61a55b16d7556ae668","observation_id":"c787143b-5a90-431d-8842-6c8a82b87ebf","resolution":{"observed_at":"2026-08-06T10:23:51.859645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02312","last_updated":"2023-02-01T07:08:58Z","snapshot_observed_at":"2026-07-06T14:37:56.945127Z","submitted_at":"2023-01-05T21:58:46Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02312","snapshot_observed_at":"2026-08-06T10:23:51.923341Z","title":"Training trajectories, mini-batch losses and the curious role of the learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.923341Z"},"links":{"cited_paper":"/paper/2301.02312","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:3c8ace6eff1cb08499bebee3acda9e6603524cec3612452b851758d91869ac10","observation_id":"8a87a096-54f8-4fa8-9708-00f1012e76a9","resolution":{"observed_at":"2026-08-06T10:23:51.923341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.390136Z","title":"Minimizing finite sums with the stochastic average gradient","venue":null,"work_id":"7ed90fd9-fbee-435b-b6e8-4a07ed75f01b","year":2017},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.987485Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:fd0a7a4cc9bc5aab956f1589dd7d33bb03de142d83377cbf85e0ab106ba96f0d","observation_id":"cbe8cf81-2aef-45e3-8691-11425c434cd4","resolution":{"observed_at":"2026-08-06T10:23:52.393897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T10:23:51.990831Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.990831Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:6ff8eebfd019ee85a1da81b92d62ec41c3515b6a837ef95b7e768bd366fd8819","observation_id":"f8128de6-fac8-49a3-8b6f-0d8fac1217cd","resolution":{"observed_at":"2026-08-06T10:23:51.990831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.381930Z","title":"Super-convergence: Very fast training of neural networks using large learning rates","venue":null,"work_id":"d0e90021-dc0f-4869-a6b9-5f677488cd50","year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.993904Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:5733375b299c8e1a29e012e946365914e6f548ab77dfe33ba8ee6246271ee05b","observation_id":"0aba7616-5249-4866-8dd2-021dbb866380","resolution":{"observed_at":"2026-08-06T10:23:52.384775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T10:23:51.996778Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:51.996778Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:54a97b83618d1361919a112534d69b45efaf510a7d5ca2d6c7cd23de7be15ce3","observation_id":"543628a2-0b7b-4f9d-9b0b-1d21292efd3a","resolution":{"observed_at":"2026-08-06T10:23:51.996778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.373221Z","title":"The calculus of variations","venue":null,"work_id":"ef9dee4c-e54f-4d0d-9d8b-bb90c26cedf4","year":2004},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.000058Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:40cf81a2904f9bb5f0f13fbde0b39f1a1945ca13fe866f6ca90dd083fa28bcd5","observation_id":"38f0b125-781e-485d-97f1-451cb290f238","resolution":{"observed_at":"2026-08-06T10:23:52.376386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.363818Z","title":"Position: Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":"ad6fbd5f-5a7d-41d8-9384-243b5d92e2ef","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.002693Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:12fdee029e5d92b44e2317e6ab1c97f21ed4336a9721fbf732b4255bed2ed064","observation_id":"49c508b4-ce11-4e0d-991f-627df44efe78","resolution":{"observed_at":"2026-08-06T10:23:52.367049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.005485Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.005485Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:1300ff6ff9a36f5247e2495d7614b9937b868e2260ff0e88901f4d933583e354","observation_id":"06956e02-6b0b-4a44-a0a3-53510cf559dd","resolution":{"observed_at":"2026-08-06T10:23:52.005485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-06T10:23:52.008343Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.008343Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:b68b835aae00bd302eb1d96189059543a0259c5eec749bd584957cb08f37b930","observation_id":"5546061b-d571-40d7-bca1-0c66a26c29b5","resolution":{"observed_at":"2026-08-06T10:23:52.008343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.011334Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.011334Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:bc7d7a3c43a768faa37282782cd80b28ac38354da792a1c4dbda497c611db3ff","observation_id":"49120fe7-4a2a-405e-88dd-11a465f3e2d1","resolution":{"observed_at":"2026-08-06T10:23:52.011334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.344590Z","title":"ema-pytorch: A simple way to keep track of an exponential moving average (ema) version of your pytorch model","venue":null,"work_id":"d785352d-b3ed-4baa-8fcd-c1ccb060f572","year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.014564Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:360f1e5834552cdbbe7c286d1503d379b0114e56cc8b2bcf2b10c7f0a576dea9","observation_id":"58e3edb6-777e-47a0-b3a9-3d29950c1ede","resolution":{"observed_at":"2026-08-06T10:23:52.347595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.017038Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.017038Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:c1599319d8ed0886136393e6baac8ebd7c49dac93acf06f266afa9ebaa97d74e","observation_id":"62e13964-feeb-487e-83ed-eef21cfeb3f8","resolution":{"observed_at":"2026-08-06T10:23:52.017038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.329438Z","title":"The large-sample distribution of the likelihood ratio for testing composite hypotheses","venue":null,"work_id":"3eda07d0-76e0-4b11-b625-8013e1a7863c","year":1938},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.019789Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:cda6a6ebc368ea2aa815f74bdb970155b15f688a4ce35330027f2cf11a846af5","observation_id":"f8442a29-4453-4dc7-8b4c-e7fde02af4a7","resolution":{"observed_at":"2026-08-06T10:23:52.332725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T10:23:52.022460Z","title":"Huggingface's transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.022460Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:15c5886ad6f5bea5f61dbdd87519c3bac8ec47e682a00a1df4b61eda183edb87","observation_id":"be69d861-2136-41e0-9408-812959c91b77","resolution":{"observed_at":"2026-08-06T10:23:52.022460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.320462Z","title":"On early stopping in gradient descent learning","venue":null,"work_id":"64401181-a62d-4366-b577-679b2095417f","year":2007},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.025357Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:81b9aee1685b3f4a3ca1d9391c98f6725799bcdc4231e8c5af896f2195810726","observation_id":"a1d1c380-9e97-4495-84a3-df5afbb5e8af","resolution":{"observed_at":"2026-08-06T10:23:52.323689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.311131Z","title":"Which algorithmic choices matter at which batch sizes? insights from a noisy quadratic model","venue":null,"work_id":"f2caf806-0912-4e0b-99c7-22c4d5e8109f","year":2019},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.028226Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:a9c21353c867743ee8caf1e4243b5d74ab40ea040044f0939b5f0184355a68fd","observation_id":"cef1f308-1976-48a3-8571-c6680040d92a","resolution":{"observed_at":"2026-08-06T10:23:52.314284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21676","last_updated":"2025-04-21T04:19:56Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:54:06Z","title":"How Does Critical Batch Size Scale in Pre-training?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21676","snapshot_observed_at":"2026-08-06T10:23:52.031002Z","title":"How does critical batch size scale in pre-training? arXiv preprint arXiv:2410.21676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.031002Z"},"links":{"cited_paper":"/paper/2410.21676","citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:9981586faa10ebaeea5e0b1a337c2d5abc637e68d00ceba35b2df66821b6613b","observation_id":"31cb124b-8863-4e1e-92e1-f0b93d1a78dd","resolution":{"observed_at":"2026-08-06T10:23:52.031002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.299052Z","title":"Parameter identification for fractional ornstein--uhlenbeck processes based on discrete observation","venue":null,"work_id":"b6297df8-c8ee-4da3-aa79-a758e6dea00f","year":2014},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.034082Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:ab72e4e70b338f79923853efc9bf3cc6215dc656ef204e3736f96d06bedd62d7","observation_id":"18f89d3e-88e6-4ce6-b4be-7b8479fc860d","resolution":{"observed_at":"2026-08-06T10:23:52.304477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:23:52.037279Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T10:23:52.037279Z"},"links":{"citing_paper":"/paper/2508.00180"},"observation_digest":"sha256:83906a236fc5913152e3c29a1344d5bc5971c6efe97757e0dd58a693863092c7","observation_id":"203f65ac-9dcb-4883-b707-fd0aed7e2406","resolution":{"observed_at":"2026-08-06T10:23:52.037279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.00180","last_updated":"2025-07-31T21:49:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:27:39.697134Z","submitted_at":"2025-07-31T21:49:20Z","title":"EMA Without the Lag: Bias-Corrected Iterate Averaging Schemes"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 2 inbound Pith citation observations for arXiv:2508.00180."}