{"as_of":"2026-08-08T05:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8dd6985ea175fdb0485f70a786496c2b650bb7a67336f24ba4245a0ccefa991","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:46:06.685339Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04531/citation-record","integrity":"/paper/2506.04531/integrity","json":"/paper/2506.04531/citation-record.json","paper":"/paper/2506.04531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.420751Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.420751Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:5d9de58b294f3cb319756dde47df5e629d241543ca58ec520767426d0d99ebfd","observation_id":"2ac87bf3-fe11-4f5d-8145-440dab3a0dab","resolution":{"observed_at":"2026-08-07T10:46:06.420751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:46:06.426612Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.426612Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e0f64d68f46766e10f0293410d576e99de547baad464dbd93513ce2304b639d5","observation_id":"f8f47d13-e59b-45e4-afae-347526e25eb3","resolution":{"observed_at":"2026-08-07T10:46:06.426612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.555712Z","title":"On the choice of learning rate for local sgd","venue":null,"work_id":"9b7f30cb-96d7-46bb-aadd-11e8c2b609bd","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.432013Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9542bb920bb1c05e41da4e3f9ad0a9b1033e6e60f6407263362ce77a018bbcb2","observation_id":"00f16575-a363-4033-aff5-1b339f2a1de0","resolution":{"observed_at":"2026-08-07T10:46:07.560463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.436385Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.436385Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:de9e9239d9d537df9510088bf7b66bb7a752731685f974980c70ab0b987307bb","observation_id":"26ecb27f-ed11-4482-816d-2a24f0bbebf8","resolution":{"observed_at":"2026-08-07T10:46:06.436385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.441028Z","title":"L., Gao, J., and Choi, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.441028Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e6dba655c4be5ba34a9885e4a1bc74ba8fcf947975ccff41da17b78f279d853a","observation_id":"ec89d5cc-1f69-444d-ab7e-2d9f9a34faf3","resolution":{"observed_at":"2026-08-07T10:46:06.441028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01097","last_updated":"2019-12-09T20:02:37Z","snapshot_observed_at":"2026-08-06T00:22:10.318064Z","submitted_at":"2018-12-03T21:59:41Z","title":"LEAF: A Benchmark for Federated Settings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01097","snapshot_observed_at":"2026-08-07T10:46:06.445477Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.445477Z"},"links":{"cited_paper":"/paper/1812.01097","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d0fdc8d60de629a9d45da8893eb3ed4200a4cbe63bb7e19d797c40c2b5bf6201","observation_id":"68dc5e3c-4d4b-48ce-9f99-9ee51f8cd146","resolution":{"observed_at":"2026-08-07T10:46:06.445477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.524933Z","title":"Multi-level local sgd: Distributed sgd for heterogeneous hierarchical networks","venue":null,"work_id":"8590e5de-8fb8-4a38-b0c7-9bbf0a1ff0fa","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.450151Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:c66e91ff0d83f483bb872c37bdbce2cc21763c2c262f6783517dff023429afdd","observation_id":"90e05d00-5118-4e00-914e-ad30f66d0988","resolution":{"observed_at":"2026-08-07T10:46:07.529418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.511524Z","title":"Asynchronous online federated learning for edge devices with non-iid data","venue":null,"work_id":"4038764c-cc5d-4a62-9c3b-97981e1ca5b1","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.454938Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:7de545284fbbe9fcbbed27073f30dc40033a76b632051afc81ec462be9d75e25","observation_id":"d9442a6c-000d-48d4-b524-fa4aa748ada1","resolution":{"observed_at":"2026-08-07T10:46:07.515918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T10:46:06.459202Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.459202Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:da964a96a6b228ebcd640f531a4215bf8b3929b796dfb7b4d519ad6e46168a0a","observation_id":"e39444a7-3c0f-43aa-ac33-9e6a5203e745","resolution":{"observed_at":"2026-08-07T10:46:06.459202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.496887Z","title":"Large scale distributed deep networks","venue":null,"work_id":"8add0219-4602-4e80-9add-fb61288007c7","year":2012},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.463751Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:dc4d437d4e318661ac49250f7d453600b2d9184ddda3f7d39aff8a07e6044dce","observation_id":"dad22139-1e59-466c-b8e4-2e8b4ae64195","resolution":{"observed_at":"2026-08-07T10:46:07.502116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T10:46:06.468296Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.468296Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:3e049c2f116b90227e058b47e2601365fa6806022cd01011bd40ef39d6c12246","observation_id":"416f7470-76d8-4077-8710-3ab49683b68f","resolution":{"observed_at":"2026-08-07T10:46:06.468296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:46:06.472885Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.472885Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:955d1a56134616f10c2ddcce0fc2afa02f0d0623bf06f937397947ef6bcd65ae","observation_id":"b3e578e4-b346-4654-964f-47b0319965b9","resolution":{"observed_at":"2026-08-07T10:46:06.472885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.477265Z","title":"N., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.477265Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:5277bd6c508a6009b861034f7b1c568f440e3eb557dbc4f4fb1db2128b21d03d","observation_id":"2ecc8cc8-b082-43c9-858f-98285f36c311","resolution":{"observed_at":"2026-08-07T10:46:06.477265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T10:46:06.481712Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.481712Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:39633a156538060b5dc8e855630d825d0039fe1fdf1ba5dce26617fedb8dcd80","observation_id":"1926c09d-f5c9-4036-86f2-f3f270ee961d","resolution":{"observed_at":"2026-08-07T10:46:06.481712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.483866Z","title":"M., B a doiu, V.-A., Agache, A., Dumitru, M.-V., Vasilescu, I., Mantu, R., and Raiciu, C","venue":null,"work_id":"77745869-9b42-431c-8153-89eef04e2dc9","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.486456Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:fc7d84e521ce4365ee9847f81ff1d54f8b5686c552259e19e9ff12109ef2c216","observation_id":"2d5fd34e-e590-48dd-950d-11b5d29c8612","resolution":{"observed_at":"2026-08-07T10:46:07.488168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T10:46:06.490714Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.490714Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:bcdb45cd671e490e45434e9fcb8ef395b3c41c974855182828f97fc5e396b871","observation_id":"e6995cb0-cce3-45e5-98c2-1169e9dbcbe0","resolution":{"observed_at":"2026-08-07T10:46:06.490714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07852","last_updated":"2024-07-10T17:13:17Z","snapshot_observed_at":"2026-08-03T21:39:52.555111Z","submitted_at":"2024-07-10T17:13:17Z","title":"OpenDiLoCo: An Open-Source Framework for Globally Distributed Low-Communication Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07852","snapshot_observed_at":"2026-08-07T10:46:06.495371Z","title":"M., and Hagemann, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.495371Z"},"links":{"cited_paper":"/paper/2407.07852","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:a7e70f250695e7e469cd1ed64de7da4d53fe4d62d3b2a8cb6f889613ea332987","observation_id":"3eb051e4-c1d3-4861-8b23-c97c2cf39f00","resolution":{"observed_at":"2026-08-07T10:46:06.495371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.469957Z","title":"MegaScale : Scaling large language model training to more than 10,000 gpus","venue":null,"work_id":"86b261b8-8fb1-42a8-b02b-f8ce5fb08a71","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.500093Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9c97af37db77843541f3abe8182cd611464ad732a758816c35eeefbdd6c59a7a","observation_id":"43874f70-0f92-41e3-b5b0-df147ae4cf6e","resolution":{"observed_at":"2026-08-07T10:46:07.474677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.455051Z","title":"Tighter theory for local sgd on identical and heterogeneous data","venue":null,"work_id":"4f1c3325-23b5-42bb-9a8d-e355cede5a21","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.505985Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:25ae4b306d9de08fa4b165ca59f6cda45d835c7a10f764ee8832df40f73af6dc","observation_id":"1a84a432-08b5-4fb5-be17-de251fa0e80f","resolution":{"observed_at":"2026-08-07T10:46:07.459720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.441552Z","title":"A unified theory of decentralized sgd with changing topology and local updates","venue":null,"work_id":"8e3d2705-426d-40eb-8dbb-6790397c3e01","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.510534Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:34964ebbd10a28d4707222cb896e96f195db7d33954438540a78fab7941c0a64","observation_id":"53416eec-8621-40a5-ab27-02d4213d8aac","resolution":{"observed_at":"2026-08-07T10:46:07.445958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0911.0491","last_updated":"2009-11-03T05:25:51Z","snapshot_observed_at":"2026-07-06T02:03:36.168517Z","submitted_at":"2009-11-03T05:25:51Z","title":"Slow Learners are Fast","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0911.0491","snapshot_observed_at":"2026-08-07T10:46:06.514940Z","title":"Slow learners are fast","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.514940Z"},"links":{"cited_paper":"/paper/0911.0491","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e6baa1ee800d0de1a3ea07052d4272fe9fd73880cd3f5b74b1935aa25f875552","observation_id":"26c6b3de-4ba5-4167-8a9d-527cc36910f3","resolution":{"observed_at":"2026-08-07T10:46:06.514940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.427196Z","title":"Amp: Automatically finding model parallel strategies with heterogeneity awareness","venue":null,"work_id":"f2e8606b-119a-41cc-82e5-a71d079df407","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.519385Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d1748a028627f14b03204c2d1b032b8f5e86bff631113014b305eafd29a9bfd6","observation_id":"1b8d4b9e-3e89-4994-974a-f694be776ac0","resolution":{"observed_at":"2026-08-07T10:46:07.432174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.412490Z","title":"Fednar: Federated optimization with normalized annealing regularization","venue":null,"work_id":"4b8aa86e-15cd-41d3-a0d8-26d6bd8ef917","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.523654Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ec7ec32dd246f9715ad227b7a8e8e980f55fb0dc5a52c7093fabd156427720fe","observation_id":"3f21350b-6d89-4e14-80f5-df3d8bdeeb2b","resolution":{"observed_at":"2026-08-07T10:46:07.417124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.399323Z","title":"G., Park, J","venue":null,"work_id":"93001441-b14d-47c5-948a-2b0f95058a96","year":2014},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.527727Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:6bc12c643dac742014bc0e3c0045824be340cc40411e6a086fa44752bdb7ee77","observation_id":"6bffd1a3-e126-4dcb-bd21-007970d65797","resolution":{"observed_at":"2026-08-07T10:46:07.403430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.531887Z","title":"K., Zaheer, M., Sanjabi, M., Talwalkar, A., and Smith, V","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.531887Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ff672ed6fa4da08667998ad9137fc96cd321722dbf399ac09ae4c224097c4f14","observation_id":"e7736bb6-3255-42e5-9752-152aeb9e5858","resolution":{"observed_at":"2026-08-07T10:46:06.531887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.377931Z","title":null,"venue":null,"work_id":"757861d7-b386-496e-bc6c-6cfdeeea84e8","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.536204Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:5a459435d56281e5f5c7db770a3e0e4e936c23517c5ee477f9c83e35a4969e09","observation_id":"3261fdbd-1c8c-41cb-a03c-dd1e27ebf29f","resolution":{"observed_at":"2026-08-07T10:46:07.382058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07217","last_updated":"2020-02-17T11:42:10Z","snapshot_observed_at":"2026-07-06T06:56:49.530908Z","submitted_at":"2018-08-22T04:50:55Z","title":"Don't Use Large Mini-Batches, Use Local SGD","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07217","snapshot_observed_at":"2026-08-07T10:46:06.540979Z","title":"U., Patel, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.540979Z"},"links":{"cited_paper":"/paper/1808.07217","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:4b6bef8d5946b557fa515c49e95a785cf5927761f878a3f740fdec1840edddf2","observation_id":"02ff7cc4-9a31-4000-89e0-e1cd70153de6","resolution":{"observed_at":"2026-08-07T10:46:06.540979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09135","last_updated":"2024-09-23T10:49:33Z","snapshot_observed_at":"2026-07-06T17:16:47.315706Z","submitted_at":"2024-01-17T11:17:04Z","title":"Asynchronous Local-SGD Training for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09135","snapshot_observed_at":"2026-08-07T10:46:06.545546Z","title":"A., Shen, J., Szlam, A., and Ranzato, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.545546Z"},"links":{"cited_paper":"/paper/2401.09135","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d3fe095d4cdf0913c22eb6581295fad94135d7a30af7d3a4b2eed8250c8b7c01","observation_id":"44a85517-bbc4-4de7-9cac-fd334735de04","resolution":{"observed_at":"2026-08-07T10:46:06.545546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.364659Z","title":"An improved analysis of stochastic gradient descent with momentum","venue":null,"work_id":"1366d123-85ab-4454-9643-4cdec99a799b","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.549864Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9705b2db0ed28093116e9e66ba93803ca3e58c7a466c61d00412a804f068dee3","observation_id":"35639ddb-bc58-40b0-8655-f200645a9705","resolution":{"observed_at":"2026-08-07T10:46:07.368999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:46:06.554007Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.554007Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ef89d213c8e59cdd8d0be835d5d0cf2b87b8e05ea491b79bfed796df2af8e766","observation_id":"537bb3ed-9ee9-432f-a11c-abc5475b7593","resolution":{"observed_at":"2026-08-07T10:46:06.554007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.558982Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.558982Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d8ff4d40ae82e26d5e96a548775700c84330156a783e1249137270741f8d5b68","observation_id":"b36412e9-5d56-4c00-a1cc-e0215694c667","resolution":{"observed_at":"2026-08-07T10:46:06.558982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01566","last_updated":"2025-03-05T20:00:57Z","snapshot_observed_at":"2026-08-01T21:33:05.315458Z","submitted_at":"2024-06-03T17:47:53Z","title":"Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01566","snapshot_observed_at":"2026-08-07T10:46:06.563160Z","title":"Helix: Distributed serving of large language models via max-flow on heterogeneous gpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.563160Z"},"links":{"cited_paper":"/paper/2406.01566","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:da14ca5486e0bfd3ca7fd083d7a1063bd02995e42cbb4b0258733c8f0a84fcfc","observation_id":"273bddff-6fb4-44da-a491-669bb0f35e2a","resolution":{"observed_at":"2026-08-07T10:46:06.563160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-07T10:46:06.567529Z","title":"Mixed precision training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.567529Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:27430984f4ccd205e855a09bfaf3076ba9e9d23c5c6e17ca4d622ed7edb822e5","observation_id":"79540e1c-29d9-4026-9a6a-a3c7909ab5ca","resolution":{"observed_at":"2026-08-07T10:46:06.567529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.340394Z","title":"and Ulukus, S","venue":null,"work_id":"d3a801cc-ce83-48c1-93b0-3d68c77a5d13","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.571738Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:248a5193dd459fe06df1d9217c69abd832db1d092844eb489e770b6436a8fc18","observation_id":"d2ec98a8-9bfd-44e3-8968-4096fd4687da","resolution":{"observed_at":"2026-08-07T10:46:07.345128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.327277Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"ce69db99-4596-4984-89a2-02d390900c6f","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.575872Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:94abe3e56760e743e2e5a1a30c0834749e7b71fea0f41ac6a35957058171906a","observation_id":"84bc9a37-a73c-41db-9144-c95d768817b3","resolution":{"observed_at":"2026-08-07T10:46:07.331632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.313918Z","title":"Federated learning with buffered asynchronous aggregation","venue":null,"work_id":"3faa43d7-3cad-439b-8af8-613a94707b59","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.579826Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:fdde86feec2bbcd8e3824481b714684e73cb68bae79df58b096a2d4e6d0678a4","observation_id":"49d1d773-396d-4101-9f74-a60169bd6857","resolution":{"observed_at":"2026-08-07T10:46:07.318396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08133","last_updated":"2021-10-15T15:00:42Z","snapshot_observed_at":"2026-08-03T14:49:06.740593Z","submitted_at":"2021-10-15T15:00:42Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08133","snapshot_observed_at":"2026-08-07T10:46:06.583881Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.583881Z"},"links":{"cited_paper":"/paper/2110.08133","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:464f1ea66e226d600fa21c1ea7b258cab0153dcc26b3433c1a5e0ddd149d8265","observation_id":"2525ef75-a894-4941-8cea-9381966464f1","resolution":{"observed_at":"2026-08-07T10:46:06.583881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.300424Z","title":"Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern \\'a ndez, R","venue":null,"work_id":"0c2481ad-b5bb-4050-bb4e-bd0e19aa079b","year":2016},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.587959Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:37a6fd794e4e569705287c51b40f3c8d21fdf97c6041160ea01c50720e67d8c8","observation_id":"afba612f-fdf6-4ea3-8656-6e2eafb7ea23","resolution":{"observed_at":"2026-08-07T10:46:07.304917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.286820Z","title":"Automatic mixed precision package - torch.amp","venue":null,"work_id":"69f4f522-7c18-4619-9728-e1e629660f32","year":2025},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.591966Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:1c3811616c9bc8fdc0b54f11e2d721f83927566299918b610f0a778b650b59eb","observation_id":"6a58490a-c2da-4670-98af-7904d1a49ff1","resolution":{"observed_at":"2026-08-07T10:46:07.291281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.596049Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.596049Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:0700429744f761a4ca3c1c635ca1bc837f09af005c14f95338357cd877c8b339","observation_id":"a2717fc3-ac89-4364-9715-7f3359dee362","resolution":{"observed_at":"2026-08-07T10:46:06.596049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-07-06T06:41:03.009337Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-07T10:46:06.600071Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.600071Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:eeda04bf41ebbe3c5d1155fe2f8b609828c3dc41e037fb4c815171699c90ada9","observation_id":"699cca50-5590-4211-bf8c-18eb009170d8","resolution":{"observed_at":"2026-08-07T10:46:06.600071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.264750Z","title":"Ml training with cloud gpu shortages: Is cross-region the answer? In Proceedings of the 4th Workshop on Machine Learning and Systems, pp.\\ 107--116, 2024","venue":null,"work_id":"15699845-09d9-42a8-a22a-148ff08718fc","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.604480Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:ff93095c214a4467255fe64b1574f4a47623ea8cc4d4d9e87dc44746b88b09f0","observation_id":"88cfd329-67ed-4856-943e-98279e748666","resolution":{"observed_at":"2026-08-07T10:46:07.269324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16265","last_updated":"2024-01-29T16:12:31Z","snapshot_observed_at":"2026-07-06T17:21:55.097821Z","submitted_at":"2024-01-29T16:12:31Z","title":"CO2: Efficient Distributed Training with Full Communication-Computation Overlap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16265","snapshot_observed_at":"2026-08-07T10:46:06.608870Z","title":"Co2: Efficient distributed training with full communication-computation overlap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.608870Z"},"links":{"cited_paper":"/paper/2401.16265","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:9c33c14b1f3bfb0f03746c660bce91309008a3b7bab1ee3060382819ce2cb2c7","observation_id":"95238f27-483a-4835-9220-b84b38a96561","resolution":{"observed_at":"2026-08-07T10:46:06.608870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.251730Z","title":"H., and Zhang, J","venue":null,"work_id":"3edf82e5-f121-4ec1-9e9e-d02868d543b2","year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.613266Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:7b60443644d68f8aa5c8e09905a1e2713cc7c7a91115c8d7f62ac83c289b07bc","observation_id":"a6656838-2a7a-4416-998a-f1a277d48c5e","resolution":{"observed_at":"2026-08-07T10:46:07.255841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.238653Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"7638ab39-1852-4ff2-bd94-46c310a0c324","year":2013},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.617316Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:b4e38a6eed81b7838de2985bd99f67978505b6289c895074b510ebb3329d700a","observation_id":"6189058a-67ed-433a-a0d6-478ce4200ebc","resolution":{"observed_at":"2026-08-07T10:46:07.243135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12707","last_updated":"2024-10-16T16:13:19Z","snapshot_observed_at":"2026-07-06T19:34:41.712266Z","submitted_at":"2024-10-16T16:13:19Z","title":"FusionLLM: A Decentralized LLM Training System on Geo-distributed GPUs with Adaptive Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12707","snapshot_observed_at":"2026-08-07T10:46:06.621574Z","title":"Fusionllm: A decentralized llm training system on geo-distributed gpus with adaptive compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.621574Z"},"links":{"cited_paper":"/paper/2410.12707","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2ecafff57d1671db37f47bfa280b212392a4f2b5c74ae759741c744448c2630d","observation_id":"6ccdea98-c0bf-4551-ad60-9bbd5aeea7c6","resolution":{"observed_at":"2026-08-07T10:46:06.621574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.223923Z","title":"Optimization of collective communication operations in mpich","venue":null,"work_id":"89b558ec-6f82-4eaa-be0b-1512350ebadf","year":2005},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.626213Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:c937999685ff0028abe9989c818a4c9925cc1ec31a4b8d94c8eff07d76c01f27","observation_id":"c22ac7c7-f870-4664-a531-3e146bf76c3f","resolution":{"observed_at":"2026-08-07T10:46:07.229093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.209056Z","title":null,"venue":null,"work_id":"fbea90e7-cc00-4e4c-a724-a3c867566df1","year":1990},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.630309Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:f22d61401415841739fe0298f10ca037e87aa8f3233f394fa9b8657772b0fdbb","observation_id":"24384d89-4a6b-40bc-aa21-14b8d738190d","resolution":{"observed_at":"2026-08-07T10:46:07.214357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.194044Z","title":"and Joshi, G","venue":null,"work_id":"86e8fd08-4285-48f8-86f2-9c9a60fe52f6","year":2021},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.634425Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:29e52df95d5404624bd041141c898a6c87ad7515709ff07bd3382daa24ef2e9c","observation_id":"737e0187-f050-438d-a86b-f7fd9d35a8e6","resolution":{"observed_at":"2026-08-07T10:46:07.198660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00643","last_updated":"2020-02-19T20:00:02Z","snapshot_observed_at":"2026-08-06T13:30:13.145140Z","submitted_at":"2019-10-01T20:06:48Z","title":"SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00643","snapshot_observed_at":"2026-08-07T10:46:06.638357Z","title":"Slowmo: Improving communication-efficient distributed sgd with slow momentum","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.638357Z"},"links":{"cited_paper":"/paper/1910.00643","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:4e27aa9bac376a9b6b20d7bcdf3eeb60c4a9b3a68ab545dccd06a7bbbca5448f","observation_id":"c79c6f55-67ad-49b6-9528-6e98935ee3bf","resolution":{"observed_at":"2026-08-07T10:46:06.638357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.179352Z","title":null,"venue":null,"work_id":"f30f9080-10d8-443d-93eb-90b3e3c1ef61","year":2020},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.642753Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2c773ef2751156438bdf8b77382ebe69e24cb9b5f6800d34d453811e17ad2b37","observation_id":"bf7e4ae6-c427-4c87-8d7c-af088e0b397e","resolution":{"observed_at":"2026-08-07T10:46:07.184384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00054","last_updated":"2022-05-31T18:42:29Z","snapshot_observed_at":"2026-07-06T13:16:05.426540Z","submitted_at":"2022-05-31T18:42:29Z","title":"Asynchronous Hierarchical Federated Learning","version":1},"cited_work":{"arxiv_id":"2206.00054","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00054","snapshot_observed_at":"2026-08-07T10:46:06.779803Z","title":"Asynchronous Hierarchical Federated Learning","venue":"cs.LG","work_id":"2174e31e-794e-4c12-a027-6d0f7177b1c1","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.646548Z"},"links":{"cited_paper":"/paper/2206.00054","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:5a1697c390121c4c092d60a2c05dd2d3d9dffe2fb8ab22a34843da1592cfbce6","observation_id":"59b52d04-4e0f-4d3d-8a33-4274223034e0","resolution":{"observed_at":"2026-08-07T10:46:06.784740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.650844Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.650844Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:d83495bae7a0c73a9926e9a15705441ad5d77da3928b964f83dd8802f198b939","observation_id":"2f18f26b-a863-4fdb-9cf0-fe13ed98c8f8","resolution":{"observed_at":"2026-08-07T10:46:06.650844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03934","last_updated":"2020-12-05T01:33:57Z","snapshot_observed_at":"2026-08-06T09:53:05.342074Z","submitted_at":"2019-03-10T06:19:38Z","title":"Asynchronous Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03934","snapshot_observed_at":"2026-08-07T10:46:06.655253Z","title":"Asynchronous federated optimization","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.655253Z"},"links":{"cited_paper":"/paper/1903.03934","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:48e20f02884e96e6d9e50d0d00218a1c51c5d9023e3812eacfd7da8b68064f27","observation_id":"1ad8ad91-94f0-43e9-802b-acff48e72d75","resolution":{"observed_at":"2026-08-07T10:46:06.655253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.165547Z","title":"Hierarchical global asynchronous federated learning across multi-center","venue":null,"work_id":"b7f7b8e1-4465-4072-a57c-417e67f09ff9","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.659681Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:fb6928bc05dc26139f8fb62b62b3010e57b7b8d6cbe15848374e8f096a616fdd","observation_id":"a8e3185b-aaa5-463f-8da3-8abff6b47b04","resolution":{"observed_at":"2026-08-07T10:46:07.169945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T10:46:06.663683Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.663683Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:e41f428d17a596112ef04a29bb6b83c5985b902cebab88de3b2412fbd5d541b6","observation_id":"b7610af2-5f14-43a9-ae0e-398ceb3d562f","resolution":{"observed_at":"2026-08-07T10:46:06.663683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.151953Z","title":"Parallel restarted sgd with faster convergence and less communication: Demystifying why model averaging works for deep learning","venue":null,"work_id":"2904a4e3-ca7d-41fc-9fff-604e0976cc32","year":2019},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.668243Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:168da16b83755315dacfd577bfc4682159fa87761f723e5d9e8041987af6ab3f","observation_id":"51191fdb-9d3e-460c-99eb-0685035090ab","resolution":{"observed_at":"2026-08-07T10:46:07.156426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.138770Z","title":"S., Re, C., and Zhang, C","venue":null,"work_id":"4d88781b-51f8-45df-a36e-7fddce6581d2","year":2022},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.672356Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:f8ecb50c3e327716bbc9444a93c3f532a2c056f49c01af49758407c61885319f","observation_id":"d57a8550-0e7a-48d4-85a1-fdb19a209639","resolution":{"observed_at":"2026-08-07T10:46:07.143017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:06.676676Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.676676Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:8664c12367019cda827d47358c1b2079dc10eb9dd7af3ae468e8a6706b7236e0","observation_id":"dd7386b0-8461-44c1-9b2e-23a322d8f8aa","resolution":{"observed_at":"2026-08-07T10:46:06.676676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:46:07.116037Z","title":"E., and LeCun, Y","venue":null,"work_id":"672d37b1-37d2-49dc-b05b-e218b86a73c0","year":2015},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.681158Z"},"links":{"citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:2b58ebebc5774f793aefefeadd08d64451d9e6d538cff239bcc65df4f9022788","observation_id":"f73681d9-649b-4e63-b675-484757c415c5","resolution":{"observed_at":"2026-08-07T10:46:07.120749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01439","last_updated":"2024-06-20T12:04:28Z","snapshot_observed_at":"2026-07-06T18:24:30.706727Z","submitted_at":"2024-06-03T15:29:46Z","title":"Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients","version":2},"cited_work":{"arxiv_id":"2406.01439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01439","snapshot_observed_at":"2026-08-07T10:46:06.730996Z","title":"Asynchronous Multi-Server Federated Learning for Geo-Distributed Clients","venue":"cs.LG","work_id":"41cfa36a-41c2-4c06-862a-d8dd1e0c0519","year":2024},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.685339Z"},"links":{"cited_paper":"/paper/2406.01439","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:f6957aac91c6395a2cd0705338b64cb8095528a2d4eac51b31a82d6d6036b794","observation_id":"549790fa-ed03-41d3-b02c-60da6f815395","resolution":{"observed_at":"2026-08-07T10:46:06.737552Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2506.04531."}