{"as_of":"2026-08-22T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bf908966781debcb2a008413cc3f0f3d81dc088ddf175087c674fde1cd0d515","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:28:36.683733Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10537/citation-record","integrity":"/paper/2509.10537/integrity","json":"/paper/2509.10537/citation-record.json","paper":"/paper/2509.10537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.610862Z","title":"Communication-Efficient Learning of Deep Net- works from Decentralized Data","venue":null,"work_id":"44965d69-8db3-4266-853f-e5279eb059ee","year":2016},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.062162Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:1299fb72527b41fe979f2a1f6dcc1f56ca6b6e6eb820ec93db5b00f290461612","observation_id":"9f27a6d7-05cc-4d71-ba0b-be2e110f3445","resolution":{"observed_at":"2026-08-15T16:28:38.696466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.591415Z","title":"Accelerating Distributed ML Training via Selective Synchronization","venue":null,"work_id":"0d3629a8-bf46-4bbc-b933-22aa199313ba","year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.068260Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:e77df51269881ad64784149383983363c1dd2027466d655a6c892daf1da92bbc","observation_id":"4d62f2b5-3648-41ff-b8f8-1c207f806482","resolution":{"observed_at":"2026-08-15T16:28:38.596771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.573068Z","title":"Flexible Communication for Optimal Distributed Learning over Unpredictable Networks","venue":null,"work_id":"528311f6-7593-4e15-a528-9cab887fcb5a","year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.074325Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:817f668c170a0684c83b3164c4d0f6c6967a19793c8299fbbe2c8518f135bfc3","observation_id":"6b1a2d1c-c697-4223-af37-2aa2a83b4211","resolution":{"observed_at":"2026-08-15T16:28:38.578322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.352187Z","title":"ImageNet Training in Minutes","venue":null,"work_id":"0cbe5b89-508f-4877-a6da-ee63573e356a","year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.112319Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:c2729721141dac644ed213af4569af0345c210f5baf3b3ba96a91fa3d529b704","observation_id":"b42dcd2d-8447-48ad-b7f7-bb18817aea60","resolution":{"observed_at":"2026-08-15T16:28:38.445898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-20T11:22:33.275550Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-15T16:28:36.151443Z","title":"An Empirical Model of Large-Batch Training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.151443Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:ae8fa2d4f33f97db4f43f7309908e0950c080b07fa0d417f417e97a83f5d86af","observation_id":"5edee915-7d9f-4b99-abad-36a499dfcbb9","resolution":{"observed_at":"2026-08-15T16:28:36.151443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-15T16:28:36.157184Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.157184Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:deef6f4b1a54402279d7cf9a4e0bb2b83e7380888f49430d9190e340771b06bf","observation_id":"275a8132-7b47-43dd-ab6c-c9f93e50574f","resolution":{"observed_at":"2026-08-15T16:28:36.157184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.332264Z","title":"An Empirical Study of Large-Batch Stochastic Gradient Descent with Structured Covariance Noise","venue":null,"work_id":"d8fbee21-4fda-4236-937c-a9c17c385a1d","year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.163540Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:c7bbe0087090c4e47b306cafde4cd332fbcd4b8b8c72f453f7c62a6fe6531f96","observation_id":"640cda5d-3331-4b28-a398-f766c6b59931","resolution":{"observed_at":"2026-08-15T16:28:38.337995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06709","last_updated":"2016-02-22T10:31:24Z","snapshot_observed_at":"2026-08-15T20:47:21.533972Z","submitted_at":"2016-02-22T10:31:24Z","title":"Distributed Deep Learning Using Synchronous Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06709","snapshot_observed_at":"2026-08-15T16:28:36.169263Z","title":"Distributed Deep Learning Using Synchronous Stochastic Gradient Descent","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.169263Z"},"links":{"cited_paper":"/paper/1602.06709","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:591896472c029224dc23e4c58f954c34d8fbc3509e3b1ea5299396459caa173a","observation_id":"185ca81c-8dca-4d49-9b4c-17c60d67b6fe","resolution":{"observed_at":"2026-08-15T16:28:36.169263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.315940Z","title":"Train longer, generalize better: closing the general- ization gap in large batch training of neural networks","venue":null,"work_id":"d698bf66-2b77-4d0c-8a27-1a607ebd58e3","year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.174947Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:019228c9b89410105a3fd0102f662fbc13c5b422a4e30849b9958b771fbb3a14","observation_id":"1f0aea62-e19d-40db-997c-d6f46aa0ab7a","resolution":{"observed_at":"2026-08-15T16:28:38.321400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.144938Z","title":"Extrapolation for Large-batch Training in Deep Learn- ing","venue":null,"work_id":"1395fa14-433a-493c-a01e-fe9f818f0978","year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.266989Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:80feb0ba38d735c2b27449af0089d65d173661867ba1c99b3027c60c754a9f63","observation_id":"8be5ec3d-90ab-4949-a129-4408c4d63867","resolution":{"observed_at":"2026-08-15T16:28:38.225175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.125096Z","title":"On Large-Batch Training for Deep Learn- ing: Generalization Gap and Sharp Minima","venue":null,"work_id":"f58e9639-18bf-4753-8eff-4a3bb6061135","year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.362930Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:66fee838832dba9401ee953795eb1aaade8830f2934d395c3f7ef6b7984972e5","observation_id":"85961323-d0dd-433d-83a9-c4b42cb9ae18","resolution":{"observed_at":"2026-08-15T16:28:38.131169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.106280Z","title":"Hessian-based Analysis of Large Batch Training and Robustness to Adversaries","venue":null,"work_id":"bf90d9fb-4e74-46ff-a661-2fae055c1a17","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.414047Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:a109bcb1650724bc4955d1fbd934e2745c23754a26ebcad90fed7ced96d69590","observation_id":"a6f9ef5a-f9fe-48c9-9833-9beda05a4679","resolution":{"observed_at":"2026-08-15T16:28:38.111921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.023333Z","title":"Learned Gradient Compression for Dis- tributed Deep Learning","venue":null,"work_id":"7ce800df-232f-43ba-ae59-390d93866c57","year":2021},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.419959Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:498dfa9240e5c5e74ab5013aa420daa1b032c3db9e6fce3a93ea054438d1d4b0","observation_id":"b5f9dea6-a373-4803-ba41-11fba6331565","resolution":{"observed_at":"2026-08-15T16:28:38.043127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:38.003738Z","title":"Learned Parameter Compression for Efficient and Privacy-Preserving Federated Learning","venue":null,"work_id":"bd3d3115-76b2-4059-8559-9983013f73a5","year":2024},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.425447Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:f8fbf9d9e83e1ef5c56d44ac0397979767638b32d7ab1373ed7cea53746b1da7","observation_id":"48193964-1477-4a44-918f-f6ed2bb0a738","resolution":{"observed_at":"2026-08-15T16:28:38.009784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.906439Z","title":"Scavenger: A Cloud Service For Optimizing Cost and Performance of ML Training","venue":null,"work_id":"0a587f43-a34c-48b5-b7ee-718e59399df8","year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.430308Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:5acce856a8a8da18755157086daf16f109278b5a229a74a4573c4eef5d55155e","observation_id":"ee55593e-340b-4fd1-b666-1e8927c9296d","resolution":{"observed_at":"2026-08-15T16:28:37.991430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01021","last_updated":"2020-01-03T00:16:36Z","snapshot_observed_at":"2026-08-14T18:20:49.953808Z","submitted_at":"2018-10-02T00:31:46Z","title":"Large batch size training of neural networks with adversarial training and second-order information","version":3},"cited_work":{"arxiv_id":"1810.01021","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.01021","snapshot_observed_at":"2026-08-15T16:28:36.941499Z","title":"Large batch size training of neural networks with adversarial training and second-order information","venue":"cs.LG","work_id":"98f5f1bb-7831-4c51-946e-48944ddbd145","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.436580Z"},"links":{"cited_paper":"/paper/1810.01021","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:365fcb09517697585ded5a4e991abcaa345ad683432f87557fdfa09eca3c8dfc","observation_id":"bca7c446-f135-4fe6-a45b-42c9bb57de6e","resolution":{"observed_at":"2026-08-15T16:28:36.997147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.886861Z","title":"Large Batch Training of Convolutional Networks","venue":null,"work_id":"a11de601-aaea-41b7-8eeb-95c21dac4d1c","year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.443437Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:233028789ea615b212e00a1f3c7937e4837d3837fe99234c44032614695f5c14","observation_id":"d81b6bd9-0c89-48db-8b13-a6dde72b1c73","resolution":{"observed_at":"2026-08-15T16:28:37.893080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.864890Z","title":"Highly Scalable Deep Learning Training System with Mixed-Precision: Training ImageNet in Four Minutes","venue":null,"work_id":"5283828b-e83e-4d97-97ed-d106e2b5c2a2","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.449911Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:c5d93f9a275b54bcfbe68a4a40a979a2f8a7ca92a007c9b8de366232850868e6","observation_id":"b3a51d98-4d6b-4c89-845c-35e2d36d3786","resolution":{"observed_at":"2026-08-15T16:28:37.872705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.757540Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":null,"work_id":"c3622268-a86e-481b-8dff-f8b8a688de4a","year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.455344Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:1f88307b4b90b41d7fd0ee45591b06141ea1f968a44c0946f8b5d82d42816357","observation_id":"a3e0ad30-1be6-4e15-a511-e588415a647f","resolution":{"observed_at":"2026-08-15T16:28:37.805641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.657084Z","title":"Don’t Decay the Learning Rate, Increase the Batch Size","venue":null,"work_id":"fbc473d6-d152-4fb3-9191-1d5505218c63","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.460740Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:c751bb69c2fdf692fcf98f53918b881f916ab584722a0670953106d8ac37845f","observation_id":"7982ab7e-7e38-4fcd-9db9-b7ec549097f0","resolution":{"observed_at":"2026-08-15T16:28:37.693266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.637736Z","title":"Don’t Use Large Mini-Batches, Use Local SGD","venue":null,"work_id":"f2ab33bc-6c58-431b-8959-38d6fd6453f7","year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.466296Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:dac31518b46417bf1d73227e8fba5e98d6f64ff36c46534fde7ee2a08509d9e2","observation_id":"8a1e5646-92bc-42f9-885a-628d95540735","resolution":{"observed_at":"2026-08-15T16:28:37.643351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.619943Z","title":"ScaDLES: Scalable Deep Learning over Streaming data at the Edge","venue":null,"work_id":"23453f5a-23c4-4ae0-adc3-2504058e1f27","year":2022},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.471109Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:3848ccbe2ccba9afed549b4a4fe7b23459f59501645a73a4aed388e6ea8132ea","observation_id":"c3810584-278d-4296-9100-d3aaeea5f0c0","resolution":{"observed_at":"2026-08-15T16:28:37.625424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.587533Z","title":"Adaptive Federated Learning in Resource Con- strained Edge Computing Systems","venue":null,"work_id":"ba22b24a-6e31-4dc7-9709-945560299a34","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.476552Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:38ff0abdae6e72f999856f3795f2ac7c01e1efda6c1c09d01cdc6e8a3595e069","observation_id":"33a8c8a2-1e3e-40d8-bec4-792a4829a5ca","resolution":{"observed_at":"2026-08-15T16:28:37.607384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.514769Z","title":"Federated Learning: Challenges, Methods, and Future Directions","venue":null,"work_id":"2d506573-8f6c-42d2-94f5-1d29233c2daf","year":2019},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.481909Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:5d6c56871e82658af497b5d6b5cadf2477a8fef362fe0c54d27e59fb43a9c3d3","observation_id":"b12cf58e-36ef-4662-a0f9-d2b271f8315c","resolution":{"observed_at":"2026-08-15T16:28:37.520974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.477061Z","title":"Apple Intelligence Foundation Language Models","venue":null,"work_id":"9d729aa7-f9ee-4db4-b8c3-664e0ad3465b","year":null},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.486985Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:65b541605353804f79b0fe8af1c2a6e3b6be705a4bb1560376bee2e87549ac5c","observation_id":"2b445caa-19ff-42f1-99d2-550517628170","resolution":{"observed_at":"2026-08-15T16:28:37.502072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01603","last_updated":"2024-05-04T12:03:28Z","snapshot_observed_at":"2026-08-19T15:53:24.534757Z","submitted_at":"2023-06-02T15:12:58Z","title":"Decentralized Federated Learning: A Survey and Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01603","snapshot_observed_at":"2026-08-15T16:28:36.492191Z","title":"Decentralized Federated Learning: A Survey and Perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.492191Z"},"links":{"cited_paper":"/paper/2306.01603","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:96c7deca13b6aca27f4288cdc714c73f8802b59544bd696422b92884b0bc2f29","observation_id":"efc13c71-1dc5-4d17-9667-098e403c8ca8","resolution":{"observed_at":"2026-08-15T16:28:36.492191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.315315Z","title":"GraV AC: Adaptive Compression for Communication-Efficient Distributed DL Training","venue":null,"work_id":"d1ab7426-b9d7-46be-953e-0c47dd667c5a","year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.498378Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:a97795dbfab7bbedbd354acde611233cb96b74e89e22810880c385af6d44363b","observation_id":"faf29043-9b79-4917-a56c-0935c741276c","resolution":{"observed_at":"2026-08-15T16:28:37.359964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-15T16:28:36.526931Z","title":"ZeRO: Memory Optimization Towards Training A Trillion Parameter Models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.526931Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:27667e9b6af0de1fb4508d5b075bae50c5eb8a0134fedfbc77c1849a6f679daf","observation_id":"75eececc-1506-4abb-b6ad-1af5a3702794","resolution":{"observed_at":"2026-08-15T16:28:36.526931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12941","last_updated":"2018-11-30T18:58:59Z","snapshot_observed_at":"2026-08-19T21:51:15.949669Z","submitted_at":"2018-11-30T18:58:59Z","title":"On the Computational Inefficiency of Large Batch Sizes for Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12941","snapshot_observed_at":"2026-08-15T16:28:36.569894Z","title":"On the Computational Inefficiency of Large Batch Sizes for Stochastic Gradient Descent","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.569894Z"},"links":{"cited_paper":"/paper/1811.12941","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:95ea75d996ff6a48c3a22c5897078811a32004d2585064624eeece4634bf1efa","observation_id":"b98b97b6-af9b-4deb-ab9f-b452dcb2d33b","resolution":{"observed_at":"2026-08-15T16:28:36.569894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14053","last_updated":"2024-08-27T17:03:12Z","snapshot_observed_at":"2026-08-18T22:20:31.204993Z","submitted_at":"2023-09-25T11:35:10Z","title":"Revisiting LARS for Large Batch Training Generalization of Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14053","snapshot_observed_at":"2026-08-15T16:28:36.602800Z","title":"Revisiting LARS for Large Batch Training Generalization of Neural Networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.602800Z"},"links":{"cited_paper":"/paper/2309.14053","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:8b666e3457548fcb9d4f55f10355380718f547e64d8c2263621b0e60436fe44e","observation_id":"8e767a81-26a8-4688-90d7-0f79ba617c67","resolution":{"observed_at":"2026-08-15T16:28:36.602800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.298338Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","venue":null,"work_id":"af065cb7-abe3-4607-85c5-11ac282588f3","year":2018},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.652055Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:6c8ce2e637f75711e1a0e5b21f1cde104e26243f9a1d51bff097632ca86d3134","observation_id":"b92b35ac-d121-403a-b57b-da7671d807d2","resolution":{"observed_at":"2026-08-15T16:28:37.303116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08856","last_updated":"2019-02-25T11:08:56Z","snapshot_observed_at":"2026-08-17T03:04:27.775014Z","submitted_at":"2017-11-24T01:58:54Z","title":"Critical Learning Periods in Deep Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08856","snapshot_observed_at":"2026-08-15T16:28:36.657740Z","title":"Critical Learning Periods in Deep Neural Networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.657740Z"},"links":{"cited_paper":"/paper/1711.08856","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:31eee58970b45a9bfc880acfc3c9faaa40c5f75859fad84ae61d7ef13db772af","observation_id":"f6a63d98-c016-422e-b4b1-b64b093384e7","resolution":{"observed_at":"2026-08-15T16:28:36.657740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10365","last_updated":"2020-02-24T16:51:01Z","snapshot_observed_at":"2026-08-15T19:01:56.386776Z","submitted_at":"2020-02-24T16:51:01Z","title":"The Early Phase of Neural Network Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10365","snapshot_observed_at":"2026-08-15T16:28:36.663277Z","title":"The Early Phase of Neural Network Training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.663277Z"},"links":{"cited_paper":"/paper/2002.10365","citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:89d1bd90157f103a92c78e1157c9aa3498f1ee898168c9fee60f4e8fbb899a15","observation_id":"a33b35a4-2a5f-49af-805e-c2a700dc33d5","resolution":{"observed_at":"2026-08-15T16:28:36.663277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.279685Z","title":"Accordion: Adaptive Gradient Communication via Critical Learning Regime Identification","venue":null,"work_id":"5dc23e0f-ef25-4d0f-9b2a-255e42e29292","year":2021},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.668647Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:87d126d8772b332945911451f702000f99466ffd87464dcf66e4951806e567f1","observation_id":"57f876fc-8282-440e-b518-78e7e78b6ed9","resolution":{"observed_at":"2026-08-15T16:28:37.285590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.223890Z","title":"Taming Resource Heterogeneity In Distributed ML Training With Dynamic Batching","venue":null,"work_id":"d713da91-4a8a-4b02-8406-a2dd14dd2625","year":2020},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.673734Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:de2c98becf33397c3e379612e25013f727a62617b97613f2936ecdb6d8bf7d6e","observation_id":"63299074-01be-4dce-9ed8-da56ecfc5487","resolution":{"observed_at":"2026-08-15T16:28:37.266524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:37.093808Z","title":"OmniLearn: A Framework for Distributed Deep Learning Over Heterogeneous Clusters","venue":null,"work_id":"47562a04-c10b-4176-8d81-57cb68871f94","year":2025},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.678883Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:517d693554729e3b3d0d6eaf4fd930e8444da5b0a88537c50b4656cc9ec9aaa7","observation_id":"1d789dd7-09a5-423b-9c05-39d6c73f8728","resolution":{"observed_at":"2026-08-15T16:28:37.147826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1481.61283","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:28:36.784946Z","title":"”An Overview of Computational and Communica- tion Mechanisms for Scalable AI Systems”","venue":null,"work_id":"2f2ad6cf-11ea-4ecf-a2dc-14d0e2113f11","year":2025},"citing_paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:28:36.683733Z"},"links":{"citing_paper":"/paper/2509.10537"},"observation_digest":"sha256:297db36ff7c79128f29b7080acb045f374c002b94530a1ce20549446486e5d3e","observation_id":"293e9be2-60c5-4d74-ae4c-a33a8495ee39","resolution":{"observed_at":"2026-08-15T16:28:36.797315Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.10537","last_updated":"2025-09-05T17:31:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:48:02.040893Z","submitted_at":"2025-09-05T17:31:50Z","title":"On Using Large-Batches in Federated Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2509.10537."}