{"as_of":"2026-08-18T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddaf99d4851217b34d9f37ace3eeed3027479119d523a82064d8ef9d0a79ae7b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:01:50.972685Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.07210/citation-record","integrity":"/paper/2412.07210/integrity","json":"/paper/2412.07210/citation-record.json","paper":"/paper/2412.07210"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-16T14:15:11.706978Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-11T19:01:50.697707Z","title":"A survey on data selection for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.697707Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:cb87d334a21144988b7d5e3ea7d9d9e7c23648dd6bb1a6b9e39727c4d832bdaa","observation_id":"02128430-a0c8-433c-b6c1-e08388b5d020","resolution":{"observed_at":"2026-08-11T19:01:50.697707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T19:01:50.704928Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.704928Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:3b41f9a5808a3aba3d250a4f38c033e380f7832fa72b343d2a8772adb184ce4e","observation_id":"bf4bf485-785d-4396-ba82-b1bf31081284","resolution":{"observed_at":"2026-08-11T19:01:50.704928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.248975Z","title":"On the choice of learning rate for local sgd","venue":null,"work_id":"b58302c1-3e44-41a6-bd0b-43af27e3fddd","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.711299Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:01f0f7d5f38ecd4297e0bddb673e52aec7ea5d1c5ba36870c926b76b4c177f12","observation_id":"6d98eb2e-c506-4273-925a-d7fe5ab15716","resolution":{"observed_at":"2026-08-11T19:02:17.255885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.227327Z","title":"Multi-level local sgd: Distributed sgd for heterogeneous hierarchical networks","venue":null,"work_id":"d7b9579d-6ed6-4f12-acee-0fdf849bdf23","year":2020},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.718130Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:721f027258a8767649bc603e0df5b6153f2c33b8e1b3205eef89662fda57788e","observation_id":"14d78ca3-c140-47f1-a970-16db4580e558","resolution":{"observed_at":"2026-08-11T19:02:17.234512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.206908Z","title":"Accelerating gossip sgd with periodic global averaging","venue":null,"work_id":"90436020-2d47-482d-a71c-7db31c208503","year":2021},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.725557Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:d7b15f3812131fbb2db6e6b386a50e6c215b63b0e7308a4ec08550a67d87aff1","observation_id":"46dcee5e-64ac-49b9-b133-795e94cc48d0","resolution":{"observed_at":"2026-08-11T19:02:17.212707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.731733Z","title":"Large scale distributed deep networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.731733Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:d54f1fe92d24fa8449269eb3fe923a40a605bc50b7a220ce9cedc9c418a0e85d","observation_id":"fcfce43c-30ce-47b1-b3e4-3757cb80497e","resolution":{"observed_at":"2026-08-11T19:01:50.731733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.157864Z","title":"Local sgd optimizes overparameterized neural networks in polynomial time","venue":null,"work_id":"7658a764-1b7a-4efa-9c94-74e0897f32df","year":2022},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.741566Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:78df05e95e12ba53d97d9d749f6fbd3449672cf352953861b6ce5a5193437a86","observation_id":"f5c81e9e-f3a7-4fe7-b8b9-3873153fb9b1","resolution":{"observed_at":"2026-08-11T19:02:17.170440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-16T14:43:27.914181Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-11T19:01:50.746824Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.746824Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:e5200120963d887bd7e50a204349857f00e143585b116a5cf4dad521ac11fd1e","observation_id":"aa79819e-02f6-440b-a216-0172499fa719","resolution":{"observed_at":"2026-08-11T19:01:50.746824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.754095Z","title":"Lighteval: A lightweight framework for llm evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.754095Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:e8e53845db8dd385f9a1366d98500411d73bdca2438a2999a3a71ddd2e731610","observation_id":"c9394a52-6502-4d38-ba64-9fc2be638d8c","resolution":{"observed_at":"2026-08-11T19:01:50.754095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.117102Z","title":"Why (and when) does local sgd generalize better than sgd? In The Eleventh International Conference on Learning Representations, 2022","venue":null,"work_id":"e09c8c0b-3dc8-4008-b4d5-6fb51f486de3","year":2022},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.759345Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:2b99ba1c394c6a16b9de44283cf0bad1091f806edea9c97c8168c31bfc53c784","observation_id":"1a1c683a-31d5-4702-951f-bbc5fccf2fe6","resolution":{"observed_at":"2026-08-11T19:02:17.122929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.768713Z","title":"Tighter theory for local sgd on identical and heterogeneous data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.768713Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:3090a7adcd0b4374f17e21986aba8db2163de5979b8ca03753910596af7361e4","observation_id":"0b8eb900-25d4-4c18-8814-707fb99df4cf","resolution":{"observed_at":"2026-08-11T19:01:50.768713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.066021Z","title":"Lyra: Elastic scheduling for deep learning clusters","venue":null,"work_id":"247ccf41-a79a-45ee-9e91-afe38dd29a1c","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.775914Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:d472d3b03a6748b65538ab139ab336d8f443b81e9d54f7fc06f93cc81ec98926","observation_id":"718a2e4c-9738-408c-9825-981da2d171bb","resolution":{"observed_at":"2026-08-11T19:02:17.075927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.781092Z","title":"Can decentralized algorithms outperform centralized algorithms? a case study for decentralized parallel stochastic gradient descent","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.781092Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:d6e30be5462fa694e7dbef7e2a2fd635abd6e2663418888dfd1d976d5a4a0777","observation_id":"b91b25c0-4ad3-4c4f-bbbd-506c791394f9","resolution":{"observed_at":"2026-08-11T19:01:50.781092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:17.017144Z","title":"Asynchronous decentralized parallel stochastic gradient descent","venue":null,"work_id":"29ce0fb9-43d5-48ec-93cf-1fa32082b75e","year":2018},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.787834Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:58c0cfd0d274f4117f94a8d5b1d999b85f7129866ea6fb2e2b74815d0459d4c4","observation_id":"cb03af3c-12d8-4f80-9530-fbae14c399d8","resolution":{"observed_at":"2026-08-11T19:02:17.024482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.998109Z","title":"Don't use large mini-batches, use local sgd","venue":null,"work_id":"4d6ffe1c-8013-40a2-b9dc-a1ee8f983158","year":2019},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.795388Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:ea5d29b01abbb5b747aedf276d914620d3d1a39800c0105c77b1bc679f55cd80","observation_id":"3aaeea4a-5341-4ff0-97ea-e73c94af78b4","resolution":{"observed_at":"2026-08-11T19:02:17.004193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09135","last_updated":"2024-09-23T10:49:33Z","snapshot_observed_at":"2026-08-16T14:26:49.611065Z","submitted_at":"2024-01-17T11:17:04Z","title":"Asynchronous Local-SGD Training for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09135","snapshot_observed_at":"2026-08-11T19:01:50.802686Z","title":"Asynchronous local-sgd training for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.802686Z"},"links":{"cited_paper":"/paper/2401.09135","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:f73682613e132f73d8aa758f95daaa7dbab6e3ce50cbfa63cf6e41ef9e6c7236","observation_id":"d7f7e6da-14fb-424c-9952-4a4bb991f624","resolution":{"observed_at":"2026-08-11T19:01:50.802686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.809059Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.809059Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:1c8877d696c250932858e3516945924967d22a9386726fab5a635ab9c4911817","observation_id":"cfb954cd-310c-4ff0-a903-4f7fd6b02e9b","resolution":{"observed_at":"2026-08-11T19:01:50.809059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.814182Z","title":"Fineweb-edu, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.814182Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:45d7787ae0514ff2b126c23adea098ede79536b2096ec188ae07e82a0ebd8f94","observation_id":"98c03838-4df0-43db-b82b-baf48a5eeb8f","resolution":{"observed_at":"2026-08-11T19:01:50.814182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.819444Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.819444Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:ed72c90f3333875ec417f521dfa95290ca25f4bfe11ce93523c5df1a36cf3c21","observation_id":"33cf37c2-dd16-4a7b-9155-9c0e52e045e9","resolution":{"observed_at":"2026-08-11T19:01:50.819444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.825187Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.825187Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:24bd83a5fd575bb7fc42c1f8991b3afa3ef21754372399985298c080c8d52c40","observation_id":"c134f586-12a4-4025-8745-71529614a710","resolution":{"observed_at":"2026-08-11T19:01:50.825187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.916709Z","title":"Federated learning with buffered asynchronous aggregation","venue":null,"work_id":"b2393378-5cbb-41f9-aa6c-21a97ed40a09","year":2022},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.830487Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:d6bc66fd8612ede9ca531e52eb0ee7e5f3b83d21f49c896b06c43e0db2dae630","observation_id":"ee196b0d-9be9-4519-b27e-151060818add","resolution":{"observed_at":"2026-08-11T19:02:16.922045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.896206Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":"0559c8de-87d3-46e2-b07b-422f63cf8a3e","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.838036Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:f49481013af477a671b814493182df514b0626aea5cda33fe4c645b233cecf68","observation_id":"402b8a00-7355-4d75-8cd8-3bc4b70e84a0","resolution":{"observed_at":"2026-08-11T19:02:16.901960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15013","last_updated":"2023-05-26T05:18:28Z","snapshot_observed_at":"2026-08-16T15:30:13.370023Z","submitted_at":"2023-05-24T10:54:45Z","title":"Local SGD Accelerates Convergence by Exploiting Second Order Information of the Loss Function","version":2},"cited_work":{"arxiv_id":"2305.15013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15013","snapshot_observed_at":"2026-08-11T19:02:06.227910Z","title":"Local SGD Accelerates Convergence by Exploiting Second Order Information of the Loss Function","venue":"cs.LG","work_id":"9e30c07d-6975-4912-a2e8-1a4f90f74b17","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.842956Z"},"links":{"cited_paper":"/paper/2305.15013","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:57c2cdcb70f35a8dd3b85b80a8dc837accf31a0c83f5bf7b7d6f4749bcea27ee","observation_id":"dcca39fd-0815-409d-b51c-a1f84329abd5","resolution":{"observed_at":"2026-08-11T19:02:06.233883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-11T19:01:50.849060Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.849060Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:44b8fe50e066b2688af0013dfe6a388130afe66309851e4223f9aed656ebf8cb","observation_id":"0fba23ee-ceb2-4089-acd0-0f544e2fe9ec","resolution":{"observed_at":"2026-08-11T19:01:50.849060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.857149Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.857149Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:ef8413b2e3e86427ac9efda955955e6724b63c180cdcbd1feb35c95eb7272ad9","observation_id":"d2ba9c49-fe2a-45ca-876b-0007b2bac3e2","resolution":{"observed_at":"2026-08-11T19:01:50.857149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.863773Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.863773Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:b7620395168c9a76f7bd38d2be9ed922f23b68470121bec005c1b2a6298b8c09","observation_id":"650c8030-1a74-4be4-bcca-5a2cb55d060d","resolution":{"observed_at":"2026-08-11T19:01:50.863773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.848528Z","title":"Stl-sgd: Speeding up local sgd with stagewise communication period","venue":null,"work_id":"e062f046-8471-4e92-9ddc-9e57295808d4","year":2021},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.869547Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:67139aa9d7e2207e56504aaf3e6765b5f893d7162c3bcd58841385c24b5e0543","observation_id":"a56d8a16-03b5-4e22-865b-c6b256ddb323","resolution":{"observed_at":"2026-08-11T19:02:16.855473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T19:01:50.875908Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.875908Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:fa0ad40ebf577e2b6fcb3eb66dccf6b4005c32a1a0d55c5da680925d1e722eab","observation_id":"3f737601-00b6-433f-854b-036adf1f6f44","resolution":{"observed_at":"2026-08-11T19:01:50.875908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.02582","last_updated":"2020-06-03T23:33:02Z","snapshot_observed_at":"2026-08-16T21:42:47.622288Z","submitted_at":"2020-06-03T23:33:02Z","title":"Local SGD With a Communication Overhead Depending Only on the Number of Workers","version":1},"cited_work":{"arxiv_id":"2006.02582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.02582","snapshot_observed_at":"2026-08-11T19:02:06.168882Z","title":"Local SGD With a Communication Overhead Depending Only on the Number of Workers","venue":"math.OC","work_id":"18d392a0-6ecf-4035-a3c3-927f1b935761","year":2020},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.881039Z"},"links":{"cited_paper":"/paper/2006.02582","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:50685207b7764e66b0b933f03abbd73642b320b78f5d9725c21ed5d51557f189","observation_id":"8f2f3474-5f05-467f-acce-516eac130318","resolution":{"observed_at":"2026-08-11T19:02:06.175013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.823402Z","title":"Efficient distributed training with full communication-computation overlap","venue":null,"work_id":"433e1a15-d245-4d19-be27-ac6216caf1f6","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.886713Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:1c04fdf9850de769ffd90e11efc78b9fe2c4ce235e4c2880242bc01c3ecfa118","observation_id":"f599164a-05f3-402b-b91e-2fec05b75b4b","resolution":{"observed_at":"2026-08-11T19:02:16.830375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.892264Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.892264Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:c9e2c1d09bd46c342d27c273e946451bc5e7494b2dfa4a67454f98fd21ecaa48","observation_id":"e9e18d58-e543-435e-85d7-c2ef250c48aa","resolution":{"observed_at":"2026-08-11T19:01:50.892264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00913","last_updated":"2023-11-02T01:00:46Z","snapshot_observed_at":"2026-08-16T14:46:42.189817Z","submitted_at":"2023-11-02T01:00:46Z","title":"Self-Influence Guided Data Reweighting for Language Model Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00913","snapshot_observed_at":"2026-08-11T19:01:50.897363Z","title":"Self-influence guided data reweighting for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.897363Z"},"links":{"cited_paper":"/paper/2311.00913","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:83337a0a20f453eff18fa57430359c70347f9ee001814f4d237ca9694d2d492f","observation_id":"78c1516d-2e87-443a-bcfb-3f6f0513f9a8","resolution":{"observed_at":"2026-08-11T19:01:50.897363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T19:01:50.902814Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.902814Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:698349f619721c069240a82dc829cc4019d6a760ecf11795a295b6b3ff96363f","observation_id":"fb8b5939-9f9a-468c-a7ac-5d23561428aa","resolution":{"observed_at":"2026-08-11T19:01:50.902814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.788734Z","title":"Adaptive communication strategies to achieve the best error-runtime trade-off in local-update sgd","venue":null,"work_id":"3e558286-f319-456e-8cd2-86e89b9fe75a","year":2019},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.908682Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:c479b3b58a290e05a47a27034349914309716263fdb7a40d92ef10aef8b39104","observation_id":"2727d3e7-8285-4ff4-8eb5-5ac8833701cf","resolution":{"observed_at":"2026-08-11T19:02:16.794055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.772245Z","title":"Slowmo: Improving communication-efficient distributed sgd with slow momentum","venue":null,"work_id":"63756a13-4bd6-48f6-a1fa-431c652b096c","year":2019},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.915047Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:cc64a481e1a64990b7282b473f8d1cd5b13230ac434827f4b54dcea1377023eb","observation_id":"a7ceaba7-f6dd-4e7c-9f38-9d177a0db455","resolution":{"observed_at":"2026-08-11T19:02:16.777749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03934","last_updated":"2020-12-05T01:33:57Z","snapshot_observed_at":"2026-08-14T17:04:44.463504Z","submitted_at":"2019-03-10T06:19:38Z","title":"Asynchronous Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03934","snapshot_observed_at":"2026-08-11T19:01:50.921207Z","title":"Asynchronous federated optimization","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.921207Z"},"links":{"cited_paper":"/paper/1903.03934","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:0bcf6393f2966774de68dac594d884e4b6919ba52a729c33cdce3bc7fb0120e8","observation_id":"9f8e5596-19d1-4b43-924b-38750029f303","resolution":{"observed_at":"2026-08-11T19:01:50.921207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.753494Z","title":"Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":"882d6051-a525-4ddc-9ad4-d3a7fdafb9ba","year":2021},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.927403Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:273f38175e14e792bf0e8fdd128dd1b742bd1a0523888cc5cfa770fd0d02ff55","observation_id":"6da53f5d-c929-4cc7-8635-f020e0f7f443","resolution":{"observed_at":"2026-08-11T19:02:16.759690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.732463Z","title":"Parallel restarted sgd with faster convergence and less communication: Demystifying why model averaging works for deep learning","venue":null,"work_id":"33720b5e-6203-4468-9004-7411ddaf6365","year":2019},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.932676Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:0399ff60b1ca38a5d124fe37fd419d72a2c3f622ed1e75fbffb138cb17766cf9","observation_id":"aaddf191-10df-4f23-be96-55fec23447dd","resolution":{"observed_at":"2026-08-11T19:02:16.739467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.07365","last_updated":"2016-06-23T16:23:35Z","snapshot_observed_at":"2026-08-14T21:51:26.145769Z","submitted_at":"2016-06-23T16:23:35Z","title":"Parallel SGD: When does averaging help?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.07365","snapshot_observed_at":"2026-08-11T19:01:50.937643Z","title":"Parallel sgd: When does averaging help? arXiv preprint arXiv:1606.07365, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.937643Z"},"links":{"cited_paper":"/paper/1606.07365","citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:07fa9b94b80d0f1fa67325c088ece2e9de405da9ae6b5bbacc3aa486318d3932","observation_id":"9161b451-eb35-4362-bbfe-755d63b54514","resolution":{"observed_at":"2026-08-11T19:01:50.937643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:16.706676Z","title":"Timelyfl: Heterogeneity-aware asynchronous federated learning with adaptive partial training","venue":null,"work_id":"dd24c2f9-08a3-43a9-b030-6021dc474a56","year":2023},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.942747Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:fc7c798ecdc5735b0076eebcbaf43319a85b9fdbad3724c6790cd7ba48fa342e","observation_id":"bf03a536-3ad2-4452-a072-bb519bfe0223","resolution":{"observed_at":"2026-08-11T19:02:16.713224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.949594Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.949594Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:82eae466a85b7afac46adb38b95567b4c37124b7ae1ed9a783b7e8e8cac8dee7","observation_id":"b42961bd-82ab-416f-b6b9-55078b33ae54","resolution":{"observed_at":"2026-08-11T19:01:50.949594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.960059Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.960059Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:e241b6a548b8a15ca964cb079a3c8135e8677ae01893ee31c85f4cbc040f5f99","observation_id":"cd775047-53a3-401a-8f8d-c9018ae64769","resolution":{"observed_at":"2026-08-11T19:01:50.960059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:01:50.965732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.965732Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:bff7c2d3ba22886f3ccdaed5819874f8113e1e71f8ef053e24ef42ff3b787abb","observation_id":"4366e7aa-4907-4662-9ac9-b97745479cf6","resolution":{"observed_at":"2026-08-11T19:01:50.965732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"tmp/0000775","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:02:06.062995Z","title":null,"venue":null,"work_id":"44d6cf5d-a899-40a9-b63d-a1077dd076c3","year":null},"citing_paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T19:01:50.972685Z"},"links":{"citing_paper":"/paper/2412.07210"},"observation_digest":"sha256:0f0edd1dea8f252195c77200f837416b6f439e48fa881ca538d80e38590dbdb4","observation_id":"9090612e-c3c9-442c-925c-a00bb6bf3263","resolution":{"observed_at":"2026-08-11T19:02:06.074504Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.07210","last_updated":"2025-02-17T02:57:12Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-18T04:12:10.467377Z","submitted_at":"2024-12-10T06:08:24Z","title":"EDiT: A Local-SGD-Based Efficient Distributed Training Method for Large Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":17},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2412.07210."}