{"as_of":"2026-08-12T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ea81d906053a6b644bc65f8a5896f0386995f05a708a08b13d6400a4fb6701f","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:42:38.233849Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.04266/citation-record","integrity":"/paper/2501.04266/integrity","json":"/paper/2501.04266/citation-record.json","paper":"/paper/2501.04266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.661881Z","title":"Introducing the next generation of Claude — anthropic.com,","venue":null,"work_id":"b0471487-d5c4-4771-9c79-6c271df29f5b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.092503Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:049006b3443c350bf3d093720ed7f266efa3e482c88c0c51a7c4b0bdb3c75743","observation_id":"556f303e-7734-4b11-b9d8-2844dd8417d2","resolution":{"observed_at":"2026-08-10T21:42:38.665918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T21:42:38.097420Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.097420Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:242c62169d413724e4af564b62e1b8499e29c116d88b0fde582cf285ea763bae","observation_id":"d4e413ca-aabc-45e0-92b2-55fb4cbdfb9e","resolution":{"observed_at":"2026-08-10T21:42:38.097420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.102113Z","title":"Llama 3 model card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.102113Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:bbd0c921ee6270c5bed83d18145be4f22810b2bace770cf7836dce46df7e15d3","observation_id":"b15f156a-3aac-4470-a570-fb3a0d78245b","resolution":{"observed_at":"2026-08-10T21:42:38.102113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T21:42:38.106390Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.106390Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:1a1e68d33a99db18047ea24a512764dffe091d3b48514b8dbe0e50afb88f52ab","observation_id":"9dbe729f-675d-4788-ba68-023caeb7369a","resolution":{"observed_at":"2026-08-10T21:42:38.106390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T21:42:38.110991Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.110991Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:583c2a4f6f9bb17f9c6b4ae860f0c378d7c79f7ab88536e9ecff74a5410f4840","observation_id":"0d7b9409-785c-44b4-912a-902f96bb8725","resolution":{"observed_at":"2026-08-10T21:42:38.110991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.115345Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.115345Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:8499f8e9e120621cec164b995701924df22936c6848a130b1955888488688c6b","observation_id":"3b8c2180-fd1c-459e-9437-ea320f8ebbd7","resolution":{"observed_at":"2026-08-10T21:42:38.115345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T21:42:38.123613Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.123613Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:5ba694ecf69f43bbfc76a3bc00f22c045d54ee59b6198dd678993a2690bfc980","observation_id":"bcbdff8a-f26d-4bc1-b441-fb0214fe0104","resolution":{"observed_at":"2026-08-10T21:42:38.123613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.636104Z","title":"The mvapich project: Transforming research into high-performance mpi library for hpc community,","venue":null,"work_id":"ef8aa22f-0421-4f0c-bf7a-7cdf2ca9f360","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.127811Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:227c2cdbb34d01901045ba3397f190581ff94a06180a47b0d9e3ecf7c8a2eca7","observation_id":"b3fe7a0d-a675-4545-a842-7d5c137f3e71","resolution":{"observed_at":"2026-08-10T21:42:38.640073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.623174Z","title":"Scalable Distributed DNN Training using TensorFlow and CUDA-Aware MPI: Characterization, Designs, and Performance Evaluation,","venue":null,"work_id":"490f3eb9-e840-49cf-bf05-cdb69ee4eaf2","year":2019},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.132220Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:94b27fd1ccda5b11ada255cdfa777035fb458332260c75fbbfc0f18f27302561","observation_id":"064a4e3b-3562-49de-9495-bfe45d86a64f","resolution":{"observed_at":"2026-08-10T21:42:38.627707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.610923Z","title":"NVIDIA Collective Communications Library (NCCL),","venue":null,"work_id":"c132b5bf-2126-4d1e-b1c4-04b2a64c5524","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.135902Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:70bb1926b501a32f5d68f3fb33a8ab734926685f4ad30aefca09c02662bd7503","observation_id":"954b19cf-6e28-4fac-b409-9ff30e210e7b","resolution":{"observed_at":"2026-08-10T21:42:38.614921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00257","last_updated":"2024-03-13T14:28:03Z","snapshot_observed_at":"2026-07-06T16:41:31.021679Z","submitted_at":"2023-11-01T03:14:48Z","title":"AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training","version":2},"cited_work":{"arxiv_id":"2311.00257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00257","snapshot_observed_at":"2026-08-10T21:42:38.395210Z","title":"AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training","venue":"cs.DC","work_id":"442f5533-0b91-491a-acfd-28827515222d","year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.139962Z"},"links":{"cited_paper":"/paper/2311.00257","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:6b229d6634e6af6a387277db3d7e4c538453006bc1ffbd9c31c2b3b025249a41","observation_id":"02bcaf6a-9e55-4078-a489-a98d61c9662c","resolution":{"observed_at":"2026-08-10T21:42:38.400265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-10T21:42:38.144213Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.144213Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:935065fcc87a8df072e51cbf38f1476ace968ba6ca4ce4b19ecf90fb0d0c6b2a","observation_id":"3da99280-6328-4b4c-a270-735321a48d59","resolution":{"observed_at":"2026-08-10T21:42:38.144213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.591074Z","title":"Fairscale: A general purpose modular pytorch li- brary for high performance and large scale training,","venue":null,"work_id":"99033d6c-3b28-4fed-b659-ae69a047d646","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.157012Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:e89ba600f8a5f5f6952731767d297767c9a39b27aee66fdb9a7991025ebe31c4","observation_id":"a9c65893-895e-43d9-84ff-ba1a9ebdca58","resolution":{"observed_at":"2026-08-10T21:42:38.595578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.579121Z","title":"Megatron-LM: Ongoing research training transformer models at scale,","venue":null,"work_id":"b3997667-ec64-4f11-a7f9-c08b6a7fa0b7","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.160347Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:996fac388bdabf2f03fb623c397dc779e92c194d520a5d0bfd572fd74b262118","observation_id":"7d60d192-106f-499a-bdca-3fb29ecc7704","resolution":{"observed_at":"2026-08-10T21:42:38.583069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.566946Z","title":"Frontier - HPE Cray EX235a, AMD Optimized 3rd Generation EPYC 64C 2GHz, AMD Instinct MI250X, Slingshot-11 | TOP500 — top500.org,","venue":null,"work_id":"520c94c3-69b3-48a4-9864-d05fdddcb738","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.164101Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:812a442cdfc238fff1a96d717f964f5947b3d0b5b2b5ca769e7b9964a9e87ac8","observation_id":"29ad6087-e169-4d2c-85c3-f1d09dcbbedc","resolution":{"observed_at":"2026-08-10T21:42:38.571146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.554237Z","title":"An in-depth analysis of the slingshot interconnect,","venue":null,"work_id":"b1606bfb-d122-4070-ad7f-cf6416f215ce","year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.167716Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:72f3e7dab02d31a031da7b67c3f311f3b9adf0b686ce5b90f42e7d264ccd9058","observation_id":"f524f000-a4fe-4496-a184-36f228f07747","resolution":{"observed_at":"2026-08-10T21:42:38.558817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10209","last_updated":"2023-06-16T23:26:19Z","snapshot_observed_at":"2026-07-06T15:43:42.968496Z","submitted_at":"2023-06-16T23:26:19Z","title":"ZeRO++: Extremely Efficient Collective Communication for Giant Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10209","snapshot_observed_at":"2026-08-10T21:42:38.171907Z","title":"Zero++: Extremely efficient collective communication for giant model training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.171907Z"},"links":{"cited_paper":"/paper/2306.10209","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:9ec00d0bdc8a02370b55304074a544c6166f758e1d98e08de71e002c29645544","observation_id":"e6cee94d-9069-47d4-9335-4375fccf66f0","resolution":{"observed_at":"2026-08-10T21:42:38.171907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09941","last_updated":"2018-09-15T08:36:28Z","snapshot_observed_at":"2026-07-06T06:25:38.365833Z","submitted_at":"2018-02-26T08:47:34Z","title":"Demystifying Parallel and Distributed Deep Learning: An In-Depth Concurrency Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09941","snapshot_observed_at":"2026-08-10T21:42:38.175813Z","title":"Demystifying parallel and distributed deep learning: An in-depth concurrency analysis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.175813Z"},"links":{"cited_paper":"/paper/1802.09941","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:7ec05ef6f818c9e053da1110cfedd8053f668944f14cf148cc679e886162c59f","observation_id":"18d3800b-6188-415e-b7f8-9f91ee29305c","resolution":{"observed_at":"2026-08-10T21:42:38.175813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.541533Z","title":"Scaling single- image super-resolution training on modern hpc clusters: Early experi- ences,","venue":null,"work_id":"0abe7406-6f77-41d6-94f3-ba33ab05310d","year":2021},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.179854Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:42d8166e4764d64f0002952514b0bf819c91f8d17a4d9ce919d4e77de2482117","observation_id":"9b89cf4b-5e8f-44d7-9ef6-76c09e6094e6","resolution":{"observed_at":"2026-08-10T21:42:38.545770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.183548Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.183548Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:d0171bf88122c751f8e01b880a11b412799ebcfbb8a840647d2ddb10540c00c5","observation_id":"660dbb0d-91ae-41fb-bdd4-68fbb0370391","resolution":{"observed_at":"2026-08-10T21:42:38.183548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-10T21:42:38.187634Z","title":"8-bit optimizers via block-wise quantization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.187634Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:8edfd71b3063243e7dd695342592db87c39981285d4067e8b34396fbb45b678c","observation_id":"a4623ac3-e50c-431e-8457-f0b7523e542d","resolution":{"observed_at":"2026-08-10T21:42:38.187634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.191520Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.191520Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:7f843ff036504c3dd8cce4a6b2f265613c4b6d1667f98baaf4d16764f8d3c0cc","observation_id":"e42ab56d-3118-4ed5-8023-88c78fc161a3","resolution":{"observed_at":"2026-08-10T21:42:38.191520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.509125Z","title":"GPT-NeoX-20B: An open-source autoregressive language model,","venue":null,"work_id":"1b6f1d72-f18f-4273-9432-c85f99e380b9","year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.195131Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:96c021b96c8e4669a1fe9d9a0d54ea0dd8fd1a6397c8586b79383f96a8074192","observation_id":"b26f6e6b-5293-47ed-8b43-ed9f35407131","resolution":{"observed_at":"2026-08-10T21:42:38.515169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.198731Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.198731Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:dad9b7206879fd44e21a4e4f0cdc67a07dbf47ff2785dd2bc051a99f42eeed9b","observation_id":"bfdced74-66cc-4749-82cc-914fa6cd931a","resolution":{"observed_at":"2026-08-10T21:42:38.198731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-10T21:42:38.202557Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.202557Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:95a3fbca71685c6a5a4b8b50967bc5dc7849ea1cbb8a07ea8e5fd663e05ed0a3","observation_id":"fa9efb2b-2a5e-4b36-a55e-8d563f5b3058","resolution":{"observed_at":"2026-08-10T21:42:38.202557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.206521Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.206521Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:6fbcaa1f798094841eeeb42432595c75ee2a09be4e75e8956a23ee8692bab930","observation_id":"71fdde9f-5416-476f-9f80-77c0ee2a3147","resolution":{"observed_at":"2026-08-10T21:42:38.206521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.482541Z","title":"Mics: Near-linear scaling for training gigantic model on public cloud,","venue":null,"work_id":"e5f9ef75-7904-49ea-82a4-51f1d528e32f","year":2022},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.214329Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:dc0c73fabac01257312374ed8d43f3597fd65a970a38ca94ad97290e1d077a94","observation_id":"960dfec8-e83b-4ee4-8161-11a0675d1929","resolution":{"observed_at":"2026-08-10T21:42:38.487222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15627","last_updated":"2024-02-23T22:10:59Z","snapshot_observed_at":"2026-08-11T16:08:43.077895Z","submitted_at":"2024-02-23T22:10:59Z","title":"MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15627","snapshot_observed_at":"2026-08-10T21:42:38.218267Z","title":"Megascale: Scaling large language model training to more than 10,000 gpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.218267Z"},"links":{"cited_paper":"/paper/2402.15627","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:19d7d421b8502dae7820784c1c1ffbfc471b34208514ee5ffc055069051dbb42","observation_id":"432033b2-76e4-4c6b-839f-cbbce1021da7","resolution":{"observed_at":"2026-08-10T21:42:38.218267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T21:42:38.210400Z","title":"Available: https://arxiv.org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.210400Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:d3304d9fd542636171dc765385832bd4d1803d72ac87cde037b880014171cbbc","observation_id":"2b629f5e-1470-412e-a753-13dd96880d73","resolution":{"observed_at":"2026-08-10T21:42:38.210400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12705","last_updated":"2023-12-21T22:06:04Z","snapshot_observed_at":"2026-08-11T15:27:25.428428Z","submitted_at":"2023-12-20T02:03:15Z","title":"Optimizing Distributed Training on Frontier for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12705","snapshot_observed_at":"2026-08-10T21:42:38.225511Z","title":"Optimizing distributed training on frontier for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.225511Z"},"links":{"cited_paper":"/paper/2312.12705","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:6ad4d727823cf817d5553da53d5b69efb5e00b6f8d647d72ea8352027b9a1c29","observation_id":"12f5fa30-71b4-4dd6-8ae2-27c76559ba6e","resolution":{"observed_at":"2026-08-10T21:42:38.225511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00691","last_updated":"2024-02-01T15:50:37Z","snapshot_observed_at":"2026-08-07T22:12:09.953635Z","submitted_at":"2024-02-01T15:50:37Z","title":"Comparative Study of Large Language Model Architectures on Frontier","version":1},"cited_work":{"arxiv_id":"2402.00691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00691","snapshot_observed_at":"2026-08-10T21:42:38.279661Z","title":"Comparative Study of Large Language Model Architectures on Frontier","venue":"cs.DC","work_id":"e800da22-632b-4164-b98e-3fa2a5af1f2b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.229469Z"},"links":{"cited_paper":"/paper/2402.00691","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:04b0509ed2f2cb2b1427c59113206debac9c4b0a3deec2414ced5abd57809724","observation_id":"5e608e03-f496-4b9a-8945-d3c111500d6a","resolution":{"observed_at":"2026-08-10T21:42:38.286343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:42:38.468663Z","title":"Accelerating large language model training with hybrid gpu-based compression,","venue":null,"work_id":"7e5826b4-4048-4236-9bbb-b1523f53005b","year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.222134Z"},"links":{"citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:1941c5e88deacb2eb8710b589d7c633bb092477fa02d23968732473ba9307b71","observation_id":"75297a7e-1ce8-4d1a-8f66-b58553ba9c54","resolution":{"observed_at":"2026-08-10T21:42:38.472809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-08-10T09:51:19.534548Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-10T21:42:38.233849Z","title":"Democratizing ai: Open-source scalable llm training on gpu-based supercomputers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.233849Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:1cf781b505e946357d0400196a9d2314994dd446aa6c48a355de4c73bf67949d","observation_id":"70cee47f-4482-4411-b2cf-e42347847ace","resolution":{"observed_at":"2026-08-10T21:42:38.233849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T21:42:38.119113Z","title":"Available: https://arxiv.org/abs/2009.03300","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T21:42:38.119113Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.04266"},"observation_digest":"sha256:39075f955eae01efb040b7d2f67bf406ac3035f716fa04f005443177c61ada20","observation_id":"c3c524c6-630f-477b-b15e-2c946f85c94a","resolution":{"observed_at":"2026-08-10T21:42:38.119113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.04266","last_updated":"2025-02-04T04:32:42Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-11T16:09:15.099163Z","submitted_at":"2025-01-08T04:19:57Z","title":"Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.04266."}