{"as_of":"2026-08-24T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a78e9412de2c4f3cea20d3a73aed56fdcff0710ceccaf80d41eea2781314bdf","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:57:08.280854Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:34:50.039718Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:49:35.673815Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-06T17:14:19.312416Z","title":"arXiv preprint arXiv:2411.13055 (2024) 12 Özcan et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11417","last_updated":"2025-07-15T15:44:03Z","snapshot_observed_at":"2026-08-20T01:41:22.516284Z","submitted_at":"2025-07-15T15:44:03Z","title":"Quantifying the Energy Consumption and Carbon Emissions of LLM Inference via Simulations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:14:19.312416Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2507.11417"},"observation_digest":"sha256:dcc57da7c95b7e84d0897be48f16b88aa5023a72ec84e75ab7ffe0276279572e","observation_id":"5e7c425e-9cf5-4e10-ac35-a024e27d7583","resolution":{"observed_at":"2026-08-06T17:14:19.312416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-15T16:34:50.039718Z","title":"Hardware scaling trends and diminishing returns in large-scale distributed training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03263","last_updated":"2025-09-03T12:24:42Z","snapshot_observed_at":"2026-08-20T03:14:03.765040Z","submitted_at":"2025-09-03T12:24:42Z","title":"Estudio de la eficiencia en la escalabilidad de GPUs para el entrenamiento de Inteligencia Artificial","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:34:50.039718Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2509.03263"},"observation_digest":"sha256:8cea9e37126cf2f75c10e753760a8e5b2ecb30cdf3955cbdfbd864197cd87ca8","observation_id":"b50beeb8-3ed8-495d-89f3-06fbd20e7bea","resolution":{"observed_at":"2026-08-15T16:34:50.039718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":"2411.13055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-07-04T04:49:35.673815Z","title":"Wehrstedt, L","venue":null,"work_id":"04f4b1ce-cd48-4ed5-94d5-20a05b0f975a","year":2024},"citing_paper":{"arxiv_id":"2606.19789","last_updated":"2026-06-19T12:11:24Z","snapshot_observed_at":"2026-08-21T07:37:48.870021Z","submitted_at":"2026-06-18T04:48:22Z","title":"Dynamic Core Allocation for Malleable Jobs with Unknown Speed-up Parameters","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T16:43:13.430673Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2606.19789"},"observation_digest":"sha256:5144ddd54f3bfbec2d80ff3dfa9cae624485aed56ed317e981dd66fb7d6dc4d3","observation_id":"b1206a0a-57a3-49b7-aa5e-75bd1b9e54e9","resolution":{"observed_at":"2026-07-04T04:49:35.675890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-05T10:31:32.042400Z","title":"Hardware scaling trends and diminishing returns in large-scale distributed training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03880","last_updated":"2026-08-04T16:17:53Z","snapshot_observed_at":"2026-08-17T22:16:21.987718Z","submitted_at":"2026-08-04T16:17:53Z","title":"Evaluating MFU as a Proxy for GPU Power for Energy-Aware Simulation of LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:31:32.042400Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2608.03880"},"observation_digest":"sha256:50452631e3bbe03c734bd587a2907eff9794a0fc5432d702d6356063571d27bb","observation_id":"93a46424-4d30-46fa-9e19-b47043b6880f","resolution":{"observed_at":"2026-08-05T10:31:32.042400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-12T21:08:06.703997Z","title":"arXiv preprint arXiv:2411.13055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-16T11:47:48.638035Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.703997Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:4e041cf5671e239c1432901b3d52e4a96f05ed906aee9d82802bf22d78456f4f","observation_id":"a0f4deb9-0b83-40f3-85b5-0ccb76c475eb","resolution":{"observed_at":"2026-08-12T21:08:06.703997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13055/citation-record","integrity":"/paper/2411.13055/integrity","json":"/paper/2411.13055/citation-record.json","paper":"/paper/2411.13055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.634724Z","title":"The framework tax: Disparities between inference efficiency in nlp research and deployment","venue":null,"work_id":"8633afa1-d92f-4588-bf0f-d4eceb01cd73","year":2023},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.199477Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:bf26070d16584e598661366b41023b2ecadbceb639f510d4a796a097007a1665","observation_id":"9f14b286-ad0b-4956-8309-f61943e7eb3b","resolution":{"observed_at":"2026-08-12T16:57:08.639044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.203305Z","title":"ISBN 9781450357999","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.203305Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:a8fe63155d829166165f13ab7437d58182bfdcf6e987803479876acdbb7e57e0","observation_id":"2cb708ee-016e-4178-93f9-67e759f2c1b0","resolution":{"observed_at":"2026-08-12T16:57:08.203305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-14T19:05:50.682260Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-12T16:57:08.215331Z","title":"John L Hennessy and David A Patterson.Computer architecture: a quantitative approach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.215331Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:d3060e02994af397165d3f17d089f1fc506fa6fa74f4f310fe8a0f5f660a1f8e","observation_id":"de09c840-e31d-410c-ac48-d355e0211be1","resolution":{"observed_at":"2026-08-12T16:57:08.215331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08476","last_updated":"2023-02-16T18:35:00Z","snapshot_observed_at":"2026-08-16T15:54:48.505094Z","submitted_at":"2023-02-16T18:35:00Z","title":"Counting Carbon: A Survey of Factors Influencing the Emissions of Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08476","snapshot_observed_at":"2026-08-12T16:57:08.227649Z","title":"Sasha Luccioni, Yacine Jernite, and Emma Strubell","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.227649Z"},"links":{"cited_paper":"/paper/2302.08476","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:fd1dac31fc8f4771d922dc68f8aaf8c45abf36977b1181701d71b46f7cc24722","observation_id":"39cc2a9b-c2e3-4e21-9ffb-25c7fb214878","resolution":{"observed_at":"2026-08-12T16:57:08.227649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.611764Z","title":"Fully sharded data parallel: faster ai training with fewer gpus — engineering.fb.com.https://engineering.fb.com/2021/07/15/open-source/fsdp/,","venue":null,"work_id":"3de6e0eb-7177-4f22-9ac9-bfb3c41d72cd","year":2021},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.232052Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:0de4c45f7a96edf3a67ebe4ffc975f9bf81854385dec3f3736530d7afe463b2d","observation_id":"059f9918-1a17-47ce-846b-a1478e1f7e8b","resolution":{"observed_at":"2026-08-12T16:57:08.616127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19146","last_updated":"2025-01-19T10:34:08Z","snapshot_observed_at":"2026-08-22T06:36:11.085790Z","submitted_at":"2024-06-27T13:02:43Z","title":"Resolving Discrepancies in Compute-Optimal Scaling of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19146","snapshot_observed_at":"2026-08-12T16:57:08.240003Z","title":"Resolving discrepancies in compute-optimal scaling of language models.arXiv preprint arXiv:2406.19146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.240003Z"},"links":{"cited_paper":"/paper/2406.19146","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:6d9b5e7a059dbfbdc9fb93d7d620cc2c64334be48bee48a6613a336bf7a84b69","observation_id":"379dd7f7-b779-49b2-95a0-f95aa70eec70","resolution":{"observed_at":"2026-08-12T16:57:08.240003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T16:57:08.243679Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.243679Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:098d90249ec4f84dd7397710fccacbc07b8eb84dd19d291b0c535c4732149957","observation_id":"f8ef9593-f213-420f-a0a6-3c43dadb2040","resolution":{"observed_at":"2026-08-12T16:57:08.243679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02084","last_updated":"2018-11-05T23:25:02Z","snapshot_observed_at":"2026-08-21T07:37:44.126553Z","submitted_at":"2018-11-05T23:25:02Z","title":"Mesh-TensorFlow: Deep Learning for Supercomputers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02084","snapshot_observed_at":"2026-08-12T16:57:08.248160Z","title":"Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.248160Z"},"links":{"cited_paper":"/paper/1811.02084","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:af5bb687dc35054eb96be624b08139d7f192888d961df71500fa846eebec50e4","observation_id":"57c7f08b-967d-4e82-8dfb-8a8cb581cd13","resolution":{"observed_at":"2026-08-12T16:57:08.248160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-08-14T19:11:29.708396Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-12T16:57:08.252150Z","title":"Sebastian U Stich","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.252150Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:4461252c3488fe5188cf99dc90d7cca868810d80393e305f88bdeff245be2225","observation_id":"c8b49888-7de9-4398-852c-a9162dee8530","resolution":{"observed_at":"2026-08-12T16:57:08.252150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.256095Z","title":"doi: 10.18653/v1/P19-1355","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.256095Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:7f8183ad89608e0d9376dafeb03255de16c5a5f7becab076432dfa60d061ac39","observation_id":"7b02bdda-a1f3-40ff-8d77-212258cf9285","resolution":{"observed_at":"2026-08-12T16:57:08.256095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.584610Z","title":"Accessed: 2023-05-05","venue":null,"work_id":"5af1ae9e-1505-4887-820a-eaef666665cd","year":2023},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.259740Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:869bcbe5e2011766a17839bc0837e740d3561d3bbfb0ad182fdf810e6a20a9ed","observation_id":"d9f5a1a4-afd7-4fb6-9944-7b3bb43c13de","resolution":{"observed_at":"2026-08-12T16:57:08.588509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T16:57:08.263714Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.263714Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:359a3b3ee92435be67dd689381a0bf0d0582d34305e268af27effe1b4b8aac6a","observation_id":"6be5e19d-562b-4638-acf6-6bd1cfe95de2","resolution":{"observed_at":"2026-08-12T16:57:08.263714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01783","last_updated":"2025-04-21T03:40:10Z","snapshot_observed_at":"2026-08-16T13:03:19.608707Z","submitted_at":"2024-11-04T04:15:36Z","title":"Context Parallelism for Scalable Million-Token Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01783","snapshot_observed_at":"2026-08-12T16:57:08.267655Z","title":"Context parallelism for scalable million-token inference.arXiv preprint arXiv:2411.01783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.267655Z"},"links":{"cited_paper":"/paper/2411.01783","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:d749aa8d44bcd8bfe829ebd9cc199769f170fc4b5257f09f1684da10bdf6f8f8","observation_id":"66ae41e1-028a-4b2f-a0b6-98292fad1375","resolution":{"observed_at":"2026-08-12T16:57:08.267655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.573113Z","title":"Accelerating the training of large language models using efficient activation rematerialization and optimal hybrid parallelism","venue":null,"work_id":"ad79e158-d8e5-4c41-84e6-8659a282d099","year":2024},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.271858Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:4f0996ab4932ecc00b0d0f3a1bafbe88e191bf0564f98e4eccacb12be662b0b3","observation_id":"83872ab0-d920-4d2e-bf4a-7778ac86523b","resolution":{"observed_at":"2026-08-12T16:57:08.576955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.561641Z","title":"For our primary experiments, we trained models using PyTorch 2.3.1 built with CUDA 12.1, with attention implementation provided by XFormers 0.27","venue":null,"work_id":"51fddf0a-75fd-40c2-82b7-54c447bfa11b","year":2022},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.276496Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:f105b6d155a16243ee8191ee323f7cbdd01e6e8b6277bf8e8c722500f6815f52","observation_id":"eda0858f-df94-4e63-8458-1d40fb7b2a6b","resolution":{"observed_at":"2026-08-12T16:57:08.565904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.550993Z","title":"Nodes within the V100 cluster consist of 8-GPU setups connected with first-generation NVLink in a Hybrid Cube Mesh (HCM) topology","venue":null,"work_id":"6d67a209-c31a-4316-b8c7-0440469a7ea1","year":2024},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.280854Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:99ef9ca1d48a0750b12f9cccbb886c5e39285b7553ee5a5926cbaa5791274179","observation_id":"e2fc97e2-8491-43b8-bfa2-b63868813885","resolution":{"observed_at":"2026-08-12T16:57:08.554992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05610","last_updated":"2024-09-24T15:42:51Z","snapshot_observed_at":"2026-08-22T05:39:35.372233Z","submitted_at":"2023-11-09T18:59:38Z","title":"Efficient Parallelization Layouts for Large-Scale Distributed Model Training","version":3},"cited_work":{"arxiv_id":"2311.05610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.05610","snapshot_observed_at":"2026-08-12T16:57:08.422002Z","title":"Efficient Parallelization Layouts for Large-Scale Distributed Model Training","venue":"cs.LG","work_id":"706e0946-5688-4008-b514-4ca851c28949","year":2023},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.210789Z"},"links":{"cited_paper":"/paper/2311.05610","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:14407c642e592d711f7fd08216895f7d1c7faf1ada0acc63565606847087fa59","observation_id":"c75461ec-bd9b-41bd-961b-2f835c97dea3","resolution":{"observed_at":"2026-08-12T16:57:08.428335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-08-17T12:46:02.488423Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-12T16:57:08.206900Z","title":"Olmo: Accelerating the science of language models.arXiv preprint arXiv:2402.00838,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.206900Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:7907e8a9696c306020a8386b0e0f2b17f14bc8572c83a3ebcc88b958731f4146","observation_id":"bdfeb6c4-754e-48a2-97e5-9caac51d19c9","resolution":{"observed_at":"2026-08-12T16:57:08.206900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.647021Z","title":"Zhenkun Cai, Xiao Yan, Kaihao Ma, Yidi Wu, Yuzhen Huang, James Cheng, Teng Su, and Fan Yu","venue":null,"work_id":"9289b110-4374-45f6-a911-ab7759338ce2","year":1967},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.182207Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:9c7bae26f3b9b60acad65121e6cfd017e6adab20f5feebf0dada3764fc4dfd4e","observation_id":"fb2eb854-d209-452e-9b05-46688aed7cae","resolution":{"observed_at":"2026-08-12T16:57:08.650641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T16:57:08.219364Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.219364Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:a54976febe48dfeafde28ccd8f3c6eb789bdc1f4d4f6a75ee5bd2a4780a5af7b","observation_id":"e45cb14d-3e74-4c48-82a9-448c8fcf7ceb","resolution":{"observed_at":"2026-08-12T16:57:08.219364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.624133Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":"7b5abc35-e581-4fcb-8b11-661ce46d12cb","year":2022},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.223363Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:a21d8908f1fda31b6035d29bb14f7d7e42fae9f0cf4a4e4aaa47a183452d3393","observation_id":"4943cd3b-1d50-40ba-b9b8-7516805e7260","resolution":{"observed_at":"2026-08-12T16:57:08.628106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-12T16:57:08.187106Z","title":"Training deep nets with sublinear memory cost.arXiv preprint arXiv:1604.06174,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.187106Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:7d7f15c16a7bf79e3519d5f38b16d3993d154e57de3e81d293e13c9f986b4acb","observation_id":"aa226829-b6cf-4b00-b9c7-c58ebcd8511b","resolution":{"observed_at":"2026-08-12T16:57:08.187106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-18T20:33:44.932427Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-12T16:57:08.191511Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.191511Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:fdfc6694c52f1231d62a454d20305460c958414fc1b0108bbec7727aa8ba9e07","observation_id":"0a63f94a-d0b3-4149-871b-8cff7a9af167","resolution":{"observed_at":"2026-08-12T16:57:08.191511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T16:57:08.195645Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.195645Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:ed0c06b82bcbdae1a2d81f54b1128f5ce8c8d98ef2939e6acd61b80fc153c3e8","observation_id":"2e391d26-2c8f-4134-9c6c-cd6c54f0acc1","resolution":{"observed_at":"2026-08-12T16:57:08.195645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:57:08.597897Z","title":"Saptadeep Pal, Eiman Ebrahimi, Arslan Zulfiqar, Yaosheng Fu, Victor Zhang, Szymon Migacz, David Nellans, and Puneet Gupta","venue":null,"work_id":"0276bee0-55ec-4bc5-b707-1c87fbcd217e","year":2024},"citing_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T16:57:08.236177Z"},"links":{"citing_paper":"/paper/2411.13055"},"observation_digest":"sha256:74366442312a93a45ee9eb46d9b727abcf78791242c17546f13ecf8e403051f9","observation_id":"67ad680d-8f13-440b-84fc-d6b538cbf2f7","resolution":{"observed_at":"2026-08-12T16:57:08.602676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T07:37:27.771133Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2411.13055."}