{"as_of":"2026-08-09T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9759a4daf6260fb98b3c9e65fcf9e1a6ce457299b903a8aab8902addf8694c91","coverage":[{"denominator":140,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:57:52.478813Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:49:48.009790Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:30:51.986121Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"cited_work":{"arxiv_id":"2506.09275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f5a461b-dd82-4ad9-a968-dcf4373b91f2","year":2025},"citing_paper":{"arxiv_id":"2604.04750","last_updated":"2026-04-09T14:13:19Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:16:35Z","title":"DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:17.725111Z"},"links":{"cited_paper":"/paper/2506.09275","citing_paper":"/paper/2604.04750"},"observation_digest":"sha256:26ac6260edcd45f72143d57eb6bc2cfb96b3adb5eaf8b4a6472b303423183dc7","observation_id":"64dd6270-02b5-4755-852c-0eb6a60fb80a","resolution":{"observed_at":"2026-05-10T23:30:51.995488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09275","snapshot_observed_at":"2026-08-01T04:49:48.009790Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22432","last_updated":"2026-07-24T15:50:23Z","snapshot_observed_at":"2026-08-06T21:57:48.528474Z","submitted_at":"2026-07-24T15:50:23Z","title":"TileSight: A First-Principles Tile-Centric Analytical GPU Performance Model from Cores to Clusters","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T04:49:48.009790Z"},"links":{"cited_paper":"/paper/2506.09275","citing_paper":"/paper/2607.22432"},"observation_digest":"sha256:48c4f97df551c317f3f5805ae69ef3f8cc995dd3edc24d5f85da95e2849e2cf1","observation_id":"647f283d-79ea-4de8-bb0a-aa62ba6552c5","resolution":{"observed_at":"2026-08-01T04:49:48.009790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09275/citation-record","integrity":"/paper/2506.09275/integrity","json":"/paper/2506.09275/citation-record.json","paper":"/paper/2506.09275"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.155358Z","title":"Carbon explorer: A holistic framework for designing carbon aware datacenters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.155358Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e000c978666d8035a5c2128e5f80dd60deee5a8e793be37ffffe6c6d4f1af0a5","observation_id":"06b4fd04-f0a1-40c6-bf64-7ee419fdd3a1","resolution":{"observed_at":"2026-08-07T04:57:52.155358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.159428Z","title":"Gar- net: A detailed on-chip network model inside a full-system simulator","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.159428Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ed09a9cb6c7494689cf636ffa29663ab1aef07bd28487090f85177914c42f6cd","observation_id":"cb3b6b2f-b71d-4343-8bf8-0ddd1c08214f","resolution":{"observed_at":"2026-08-07T04:57:52.159428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.162733Z","title":"A survey of computer architecture simulation techniques and tools.Ieee Access, 7:78120–78145, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.162733Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:7ca0a0aafdad7c8bc6cc7dbf99d8990dabffe305b983628760fd0945db032133","observation_id":"69695c15-392a-4cc9-9e65-08090658826f","resolution":{"observed_at":"2026-08-07T04:57:52.162733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.166178Z","title":"Partir: Composing spmd partitioning strategies for machine learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.166178Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:66555636a273c105776f9e8ff3229756524e644ec199982f8cbe2ae235a56530","observation_id":"8284d8a7-fbd4-4660-8909-8b2d35a12d26","resolution":{"observed_at":"2026-08-07T04:57:52.166178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.169568Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.169568Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:35e446e8ba07b27c89043a1dda16df014746b9fc63d519ea8393dae087f86f02","observation_id":"5e0905bd-b6e6-4252-a701-6d6d33932b99","resolution":{"observed_at":"2026-08-07T04:57:52.169568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.172845Z","title":"Deepflow: A cross-stack pathfinding framework for distributed ai systems.ACM Transactions on Design Automation of Electronic Systems, 29(2):1–20, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.172845Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a6413571ef038dabd93ef6aed0c0312fc74d8e1f9f7f54b44f3f597a86142f9d","observation_id":"7e2733f3-9702-423f-b8da-1a9efea7abc5","resolution":{"observed_at":"2026-08-07T04:57:52.172845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-03T02:24:22.577450Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-07T04:57:52.178001Z","title":"Efficient large scale language modeling with mixtures of experts.arXiv preprint arXiv:2112.10684, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.178001Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:477803e05937cd50e19bce7d51125e24b4c665615b57b4074ef7cb436b4f2595","observation_id":"a320d8a0-be26-425e-b3e8-683d7ac95a5d","resolution":{"observed_at":"2026-08-07T04:57:52.178001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.182635Z","title":"Understanding the future of energy efficiency in multi-module gpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.182635Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:f8399b332f91a2e08b27e19625fc216214c2436912e6df519130475d61b25883","observation_id":"61da18ee-e710-46cd-bce9-a157c3fb46a2","resolution":{"observed_at":"2026-08-07T04:57:52.182635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.185601Z","title":"vtrain: A simulation framework for evaluating cost- effective and compute-optimal large language model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.185601Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:2fe8f6ddb139e0e548469ffb82dfc06e4c7442d8bcb3ea23e8f97428d3a15ff9","observation_id":"2a717df5-faab-4a92-83d5-99ad966fe01f","resolution":{"observed_at":"2026-08-07T04:57:52.185601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.188797Z","title":"Dtco including sustainability: Power-performance-area-cost-environmental score (ppace) analysis for logic technologies","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.188797Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d13ca225d03121eeff866793ea6292266351867e92d6d029663e1e9c79c2e682","observation_id":"12d154df-7007-466b-912d-ff39e4285232","resolution":{"observed_at":"2026-08-07T04:57:52.188797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.191642Z","title":"The datacenter as a computer: Designing warehouse-scale machines","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.191642Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e1ad5b5f19e51784fa8ee7a1a1a961b6837e4cbe6bd435c6593fed6d48d815c7","observation_id":"c2b384ca-e873-4d84-a3d7-b23d2f206969","resolution":{"observed_at":"2026-08-07T04:57:52.191642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.194648Z","title":"Stco: driving the more than moore era","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.194648Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d65cdf3005e19b7a0c4faea57ca316050ca9251290b9ec162fee8bc6eda28973","observation_id":"81728c38-877f-4cf8-bb4d-bfcbe3b39a46","resolution":{"observed_at":"2026-08-07T04:57:52.194648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.197731Z","title":"A survey of cache simulators.ACM Computing Surveys (CSUR), 53(1):1–32, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.197731Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:efcea61b1d22d66e6c25c6bea6a475c0375ad8c3ed8cfe5fb05b603c67e4759f","observation_id":"31a1ec10-b15f-4a8a-8736-38f06f28ce7e","resolution":{"observed_at":"2026-08-07T04:57:52.197731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.200901Z","title":"Understanding gpu power: A survey of profiling, modeling, and simulation methods","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.200901Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:5ed46641ef9f8c9cca26a1993ccc8474a157abdf831ab19434b293b7e6e88437","observation_id":"c0aaf8e7-cffc-40c4-a100-73e51bbeaa8d","resolution":{"observed_at":"2026-08-07T04:57:52.200901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.204038Z","title":"Wattch: A framework for architectural-level power analysis and optimizations","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.204038Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:467fc9c5c16c6453988763cb61ca181b5363b489ef5778b5ecce1adcc57fc216","observation_id":"8250d61a-f2e9-4ebc-9537-08d8eff3fe09","resolution":{"observed_at":"2026-08-07T04:57:52.204038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.207088Z","title":"TVM: An automated End-to-End optimizing compiler for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.207088Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:3a754ee7d8cf314b41b8648db9f752f4faedcaba84bd7e4d7114a304ab445c3e","observation_id":"fddf78bc-3abc-42ac-ba1a-b98e993c1fc1","resolution":{"observed_at":"2026-08-07T04:57:52.207088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.0759","last_updated":"2014-12-18T01:13:16Z","snapshot_observed_at":"2026-07-06T03:56:19.212671Z","submitted_at":"2014-10-03T06:16:43Z","title":"cuDNN: Efficient Primitives for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.0759","snapshot_observed_at":"2026-08-07T04:57:52.210089Z","title":"cudnn: Efficient primitives for deep learning.arXiv preprint arXiv:1410.0759, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.210089Z"},"links":{"cited_paper":"/paper/1410.0759","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e0f17aec8e9c4cc5e9ffed41e9626c748d506fccdea17b92031c2d0ad4586f75","observation_id":"88dd7ac2-8c6d-4b7b-8438-ac793b86ce5e","resolution":{"observed_at":"2026-08-07T04:57:52.210089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05499","last_updated":"2024-08-10T09:26:15Z","snapshot_observed_at":"2026-07-06T18:59:09.430784Z","submitted_at":"2024-08-10T09:26:15Z","title":"LLMServingSim: A HW/SW Co-Simulation Infrastructure for LLM Inference Serving at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05499","snapshot_observed_at":"2026-08-07T04:57:52.213733Z","title":"Llmservingsim: A hw/sw co-simulation infrastructure for llm inference serving at scale.arXiv preprint arXiv:2408.05499, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.213733Z"},"links":{"cited_paper":"/paper/2408.05499","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:cbfd5ebdce0a6f303f8aba50f1c797e37246bb7494c0f223fee8fa9a266980bf","observation_id":"4d0adc31-b0f8-4038-abe3-c8b97373299e","resolution":{"observed_at":"2026-08-07T04:57:52.213733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.217230Z","title":"CodeCarbon: v2.4.1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.217230Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:f5548bc7f73c0f90a3c69a8dc902c553b35b469544c7b02cdf01f0a173769e7c","observation_id":"ccc59b65-4911-4cc2-8e58-0c9f97c3af1e","resolution":{"observed_at":"2026-08-07T04:57:52.217230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.220350Z","title":"Gloo100k: Collective communications library with various primitives for multi-machine training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.220350Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:42ec7d4d97c3006461e5cb7e8f7c4f6d993c4e9b2aa91519878e9b45458b269c","observation_id":"cf3883cd-bf1b-4f70-a266-462d927b1536","resolution":{"observed_at":"2026-08-07T04:57:52.220350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.223422Z","title":"Stablehlo: A portable high-level operations set for machine learning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.223422Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:10a7c5dbadeee0ca91c17f72a8fc6bffb99d81d6bea9a704aa4fc06a7082d0fd","observation_id":"cdfca887-7365-459e-bbd0-b9452a47edcc","resolution":{"observed_at":"2026-08-07T04:57:52.223422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.229822Z","title":"Torchscript documentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.229822Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:7abe86e03a6a8be59cee969b104188eeae1bd40bfe584a8f811668924a948d43","observation_id":"fa759020-9088-4f59-87f2-f5a06e259fb2","resolution":{"observed_at":"2026-08-07T04:57:52.229822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.232800Z","title":"Available at https://docs.nvidia.com/cuda/ parallel-thread-execution/index.html","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.232800Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a0b4b1aed56b0d2646ce45dd0671cd5d2c28317ba6b77b8f09f0e2dd287f3527","observation_id":"4013fbfa-c7a7-45fa-ac2e-3045f0c2219d","resolution":{"observed_at":"2026-08-07T04:57:52.232800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.235785Z","title":"Nvidia dgx h200, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.235785Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:9a9ac0fb9c60b139f5c798652aa102a55a1215fc653e9ff172ffe7a98ec2caed","observation_id":"439d6a9c-422a-4080-a5c0-b2564183567a","resolution":{"observed_at":"2026-08-07T04:57:52.235785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21015","last_updated":"2025-02-07T23:27:07Z","snapshot_observed_at":"2026-08-08T03:33:50.673927Z","submitted_at":"2024-05-31T17:04:18Z","title":"The rising costs of training frontier AI models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21015","snapshot_observed_at":"2026-08-07T04:57:52.238746Z","title":"The rising costs of training frontier ai models.arXiv preprint arXiv:2405.21015, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.238746Z"},"links":{"cited_paper":"/paper/2405.21015","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:c41991c3e8ff175c1b224d73a989ac1421189fceff67d863b0a8383b0998cbda","observation_id":"ecfaa338-89ea-4808-b27c-16656cdae504","resolution":{"observed_at":"2026-08-07T04:57:52.238746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.242350Z","title":"Total cost of ownership model for data center technology evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.242350Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:6a1451e9bae59632735158957464c34f80ad8ce4b5331a6cd9b24d5fc4483b97","observation_id":"7bcf91cb-731f-452f-8dd9-e6d4bbeb439e","resolution":{"observed_at":"2026-08-07T04:57:52.242350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.245659Z","title":"Total cost of ownership model for data center technology evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.245659Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:4da707487ffee2a398e56e6ed8fbbd6686b99af48c0fac0a081e07f9232300ef","observation_id":"40692d6d-4a45-4710-87ff-e49d6f0f114b","resolution":{"observed_at":"2026-08-07T04:57:52.245659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.248741Z","title":"Logp: Towards a realistic model of parallel computation","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.248741Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d3779500101ddeb42c81cf352f765748a50ca4f3b7b70d2a1c3587287a295a01","observation_id":"e05d0066-8379-4a47-90ec-542c8ff188d2","resolution":{"observed_at":"2026-08-07T04:57:52.248741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.251859Z","title":"Large scale distributed deep networks.Advances in neural information processing systems, 25, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.251859Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:60357f0acfe07cbfafd149e5ae74a0a89953e11016ba16b9254a756690c568fd","observation_id":"891531be-5c12-4db8-8b63-d392c458601a","resolution":{"observed_at":"2026-08-07T04:57:52.251859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.254897Z","title":"Uptime institute global data center survey 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.254897Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a609ed6c8c12057ab6d4db72f8424140b916a951996f49657ac15c4ad8f9522d","observation_id":"55356466-fa25-45fe-a080-d3921a763848","resolution":{"observed_at":"2026-08-07T04:57:52.254897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.257927Z","title":"Proteus: Simulating the performance of distributed dnn training.IEEE Transactions on Parallel and Distributed Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.257927Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:11680385e0fa33cdbe390163c4a9fd08910212643db8c1d3fa1e3ce146e6fc3b","observation_id":"d66f890b-69d6-4df1-80fe-3b30417286b6","resolution":{"observed_at":"2026-08-07T04:57:52.257927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.260766Z","title":"Cordoba: Carbon-efficient optimization framework for computing systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.260766Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:5fa2746e35c88ce02700c6fe45ae83335dc8c03fcc3b84ae29959a0a72f8fe61","observation_id":"4e16c234-e2b5-4a8b-a9c3-7737870bf0d5","resolution":{"observed_at":"2026-08-07T04:57:52.260766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.264152Z","title":"Amant, Karthikeyan Sankaralingam, and Doug Burger","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.264152Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:127ff5b9db912c37920528a5ba4e9a40b66692ae96c652a808c0581e7695f97c","observation_id":"ff437a87-33d3-43e5-b3cb-bf4972c8b1f2","resolution":{"observed_at":"2026-08-07T04:57:52.264152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.267205Z","title":"Llmcarbon: Modeling the end-to-end carbon footprint of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.267205Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d4373f9d4345577f212d0b2ebb9cb60c937263e29187a3ab0f92791a690b50f4","observation_id":"86fbad80-ab55-474b-994c-abb8a8076a5e","resolution":{"observed_at":"2026-08-07T04:57:52.267205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12487","last_updated":"2024-12-17T02:44:35Z","snapshot_observed_at":"2026-07-06T20:08:16.471575Z","submitted_at":"2024-12-17T02:44:35Z","title":"Echo: Simulating Distributed Training At Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12487","snapshot_observed_at":"2026-08-07T04:57:52.270151Z","title":"Echo: Simulating distributed training at scale.arXiv preprint arXiv:2412.12487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.270151Z"},"links":{"cited_paper":"/paper/2412.12487","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:52a75547720151bf7056b4e1b07baaceb2f8edb892a94f33c28c48ac4634073d","observation_id":"48018a51-2778-4d1c-b45a-7798bea4a185","resolution":{"observed_at":"2026-08-07T04:57:52.270151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.273670Z","title":"Mpi: A message-passing interface standard, 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.273670Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:fab2f44f10f11448afb9b47c935c10a62bbacfbd142ba44bbd550d53f1d66933","observation_id":"e98b8883-529e-4497-87a9-bed524880779","resolution":{"observed_at":"2026-08-07T04:57:52.273670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.276735Z","title":"Estimating gpu memory consumption of deep learning models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.276735Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:0f9db11bc6cbac485103d97b3cf9f662e7f8a4caa725eeb6090e119646fca218","observation_id":"729c737d-e64d-48e0-887d-c26a1d082b1e","resolution":{"observed_at":"2026-08-07T04:57:52.276735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.279670Z","title":"MIT Press, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.279670Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8e26ec0b1737d9dc310bf06748c5b5771d687892f3aa702c52c0f0e7b3597a2b","observation_id":"0a38169d-6d67-48ad-a246-04813615a9b5","resolution":{"observed_at":"2026-08-07T04:57:52.279670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.282879Z","title":"Google data centers efficiency, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.282879Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:b4a7fb08273a7da87f831505726bac6ab2a14e0a826f58f59e34f6599e6e9a03","observation_id":"6ff25cb0-e011-4ca8-b3de-ae09addb69c1","resolution":{"observed_at":"2026-08-07T04:57:52.282879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.286047Z","title":"Catch: a cost analysis tool for co- optimization of chiplet-based heterogeneous systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.286047Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:1d775ddf9637e8f0d2822a963604d06b4ba6ea44903bec82e86f0d27d5f712e6","observation_id":"01c50d2e-bf89-4da5-a498-e71ee1ba46a7","resolution":{"observed_at":"2026-08-07T04:57:52.286047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.292718Z","title":"Gpgpu power modeling for multi-domain voltage-frequency scaling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.292718Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:f395325d420041821356cb0f319e74d37281d703357e787ebebff9b1315a6fd2","observation_id":"e0f43c34-f34c-4fae-9d38-51537f1d458c","resolution":{"observed_at":"2026-08-07T04:57:52.292718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.295993Z","title":"Accelerating design space ex- ploration for LLM training systems with multi-experiment parallel simulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.295993Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:dce5f6934d906cb2122fc9b42468bad72347dabfc4d0931dd1323d201007613e","observation_id":"ff78e0dd-7644-4ace-b5ff-c4fe92447cd1","resolution":{"observed_at":"2026-08-07T04:57:52.295993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:57:52.299174Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforce- ment learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.299174Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:5757a01373f7927763f239a2011f03b5a60ea9dc4c1d8ed5805f83ab3ef1c55a","observation_id":"31715443-f00c-4c3c-b2e7-c194f19950cc","resolution":{"observed_at":"2026-08-07T04:57:52.299174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.302225Z","title":"A survey on performance modeling and prediction for distributed dnn training.IEEE Transac- tions on Parallel and Distributed Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.302225Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:bf298e9043b597010e0d01b15fc819de8880919701c5227028d7495c0997e98e","observation_id":"f19f4bf1-3303-43a3-970f-449ee935a0e7","resolution":{"observed_at":"2026-08-07T04:57:52.302225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.305105Z","title":"Act: Designing sustainable computer systems with an architectural carbon modeling tool","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.305105Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:069ea4c0fff3ade291465e4a022b6660bd99362cd0bc59c85b01def410323ac5","observation_id":"d077cdff-9ae7-430f-a0cd-ee2b2a6bd385","resolution":{"observed_at":"2026-08-07T04:57:52.305105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.308386Z","title":"Chasing car- bon: The elusive environmental footprint of computing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.308386Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8d94ee46483b373259342a96b37898501802e30dea4b3999f21a792b9c13d694","observation_id":"298e90f1-0444-4a18-93eb-762745ac6ba6","resolution":{"observed_at":"2026-08-07T04:57:52.308386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.311440Z","title":"Onnxim: A fast, cycle-level multi-core npu simulator, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.311440Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e3c3f35bb6e49bb876093423f59eb2df242a0d2c93bc57d70091d07c8167a173","observation_id":"89b94b34-6b35-45ad-a8b6-2238d3a46924","resolution":{"observed_at":"2026-08-07T04:57:52.311440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.314915Z","title":"An analytical framework for estimating tco and exploring data center design space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.314915Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ec35f81b2dd1aa81f611a3abd69c820149be98d50f2862beeb4c2a7ff2607f97","observation_id":"7709cf75-a4e8-4c66-9f77-d0d58857bc14","resolution":{"observed_at":"2026-08-07T04:57:52.314915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.318012Z","title":"Ryckaert","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.318012Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:c07b55b8f9559b905d4f64bd870170503a7ce2ea1e56a30b67b36bf14a48b105","observation_id":"ce6d56b5-17b3-48b4-9e61-88c0d5847bdb","resolution":{"observed_at":"2026-08-07T04:57:52.318012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.321145Z","title":"Towards the systematic reporting of the energy and carbon footprints of machine learning.Journal of Machine Learning Research, 21(248):1–43, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.321145Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:55e61a99ef4641914cb250ab782cbe0a5c1fef2498c84f941857d9ce653f2db8","observation_id":"b12418b8-2e43-4cca-a19d-507d1cd019f9","resolution":{"observed_at":"2026-08-07T04:57:52.321145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.324358Z","title":"Towards the systematic reporting of the energy and carbon footprints of machine learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.324358Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e56e79fa500c498e97d5401bbc44e5a890d72ca230cb807fd8e3088207b45387","observation_id":"aa0917dd-7d2b-465f-9e2d-fd79319a13fc","resolution":{"observed_at":"2026-08-07T04:57:52.324358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.327506Z","title":"Group operation assembly language-a flexible way to express collective com- munication","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.327506Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:4270eb9daecf01369f6de8c65ff0ee2f96fcdfea37580988681af7ae940cfe00","observation_id":"870c90f3-f4bc-4fd9-a385-014621ae5e78","resolution":{"observed_at":"2026-08-07T04:57:52.327506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.330563Z","title":"An integrated gpu power and performance model","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.330563Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:45679bf6515e8abeb6aa20f92f933da9ae0d97a1b642ad0dadf1531789b98f89","observation_id":"125ee60b-686f-4599-8c16-72dc4c2a7bd8","resolution":{"observed_at":"2026-08-07T04:57:52.330563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.333657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.333657Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:899d528dc76ba6a703d630fb45c8c789925314012330a7c13da2bbc15180ca3f","observation_id":"37283fa5-61dd-4de5-a73a-a3649c29d043","resolution":{"observed_at":"2026-08-07T04:57:52.333657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.336695Z","title":"imec.netzero public, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.336695Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:9a7d4c6dd9acb646cd6e0ee2e4c82f9964b4e956c5e6e397278635a0f3a15c3c","observation_id":"d3d924b6-120f-4f7e-af78-0438196405f4","resolution":{"observed_at":"2026-08-07T04:57:52.336695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.340228Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.340228Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:f0490428b27cc1c33f57ae9e2186da30c408ce0e06b73d1f5e0edde68ed771e4","observation_id":"5405c30a-c7a0-4311-b747-e981ceea3a9b","resolution":{"observed_at":"2026-08-07T04:57:52.340228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.343296Z","title":"Calculon: a methodology and tool for high-level co-design of systems and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.343296Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:db24c1613e5e11fd9b2c69fcbed4471cb014393be1a92868900bfde861710875","observation_id":"d016ba27-5c77-411a-bcc5-88595efefc90","resolution":{"observed_at":"2026-08-07T04:57:52.343296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T04:57:52.346347Z","title":"Deep- speed ulysses: System optimizations for enabling training of extreme long sequence transformer models.arXiv preprint arXiv:2309.14509, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.346347Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ecbd97c0bb66e6a1566a03e6345e69cf4af2a3045c4bc722bda286d270b1d1aa","observation_id":"fc697b19-932f-498a-bc1e-92cbcf7b64d1","resolution":{"observed_at":"2026-08-07T04:57:52.346347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.350083Z","title":"A quantitative evaluation of contemporary gpu simulation methodology.Proceedings of the ACM on Measurement and Analysis of Computing Systems, 2(2):1–28, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.350083Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d84ed4a31e2ebbb33d484eddef4bbbf4e8ac2fcc3cc9ec2cfa796447a1dd79a9","observation_id":"b3d6af5a-8e8b-4764-9672-6aa70861b738","resolution":{"observed_at":"2026-08-07T04:57:52.350083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.353238Z","title":"Scarif: Towards carbon modeling of cloud servers with accelerators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.353238Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:55a42b33d736841bfe557ebfbdbe2f505b29cd7dd725a7bee1ce6988e03152a2","observation_id":"857459fc-767c-471b-804f-01562e51e737","resolution":{"observed_at":"2026-08-07T04:57:52.353238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.356419Z","title":"Beyond data and model parallelism for deep neural networks.Proceedings of Machine Learning and Systems, 1:1–13, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.356419Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a2765bddd4c0b90158fec391e512ebb0128d10f4c1a373727943b9facc97d038","observation_id":"21b109d6-ab52-4c0e-8e5c-6694a30657a3","resolution":{"observed_at":"2026-08-07T04:57:52.356419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.359282Z","title":"Tpu v4: An optically reconfigurable supercomputer for machine learning with hardware support for embeddings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.359282Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:6f3f5145ef75e0c2d99ae2cf750b8da43360e829e3d4212afd86cda8d7834aad","observation_id":"a44eb354-53e7-4716-b25b-20049c922c2b","resolution":{"observed_at":"2026-08-07T04:57:52.359282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.362258Z","title":"In-datacenter performance analysis of a tensor processing unit","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.362258Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:1b043cf80225cfa352f9b4e243e6958004c5ebbaad6a813107c745abcda00d70","observation_id":"9f2afaf8-5d0f-49f9-949e-8802fd50788c","resolution":{"observed_at":"2026-08-07T04:57:52.362258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.365870Z","title":"Accelwattch: A power modeling framework for modern gpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.365870Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a1c5c4db9458b2ac53198e653fb5762f31903528914bef38d6b4c59859daa841","observation_id":"3dbdb77e-381e-4d5a-8839-6bf47e3a7540","resolution":{"observed_at":"2026-08-07T04:57:52.365870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00078","last_updated":"2019-09-30T20:07:36Z","snapshot_observed_at":"2026-07-06T08:25:52.812775Z","submitted_at":"2019-09-30T20:07:36Z","title":"MIOpen: An Open Source Library For Deep Learning Primitives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00078","snapshot_observed_at":"2026-08-07T04:57:52.368856Z","title":"Miopen: An open source library for deep learning primitives.arXiv preprint arXiv:1910.00078, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.368856Z"},"links":{"cited_paper":"/paper/1910.00078","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:0df7e5ea50e6e8db27a3837101a647941a9dfc8c599158a9a166b408679bff85","observation_id":"c6dea6d6-cfd9-47e5-a421-1fedca7475e1","resolution":{"observed_at":"2026-08-07T04:57:52.368856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.372221Z","title":"Moonwalk: Nre optimization in asic clouds.SIGARCH Comput","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.372221Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:349c290ec5dfb17a96a5bdfaf5ab360e5aa5f3f369a840e47cda8371f263b4f7","observation_id":"071081d0-8493-42ef-a18b-0e99711d9fc9","resolution":{"observed_at":"2026-08-07T04:57:52.372221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10933","last_updated":"2024-04-16T22:11:35Z","snapshot_observed_at":"2026-08-02T21:47:41.305324Z","submitted_at":"2024-04-16T22:11:35Z","title":"LLMem: Estimating GPU Memory Usage for Fine-Tuning Pre-Trained LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10933","snapshot_observed_at":"2026-08-07T04:57:52.375078Z","title":"Llmem: Estimating gpu memory usage for fine-tuning pre-trained llms.arXiv preprint arXiv:2404.10933, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.375078Z"},"links":{"cited_paper":"/paper/2404.10933","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:799e82ef2477ac821ecb4c276460f3e25fbfe480eced25a01a44ebd313315041","observation_id":"73df6e8a-7fa8-4baf-910f-33d09488f446","resolution":{"observed_at":"2026-08-07T04:57:52.375078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T04:57:52.378380Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.378380Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:02f31882080af9d03047530c7d8a4dc8ba1cc54379341cf30dc559d4d2b7f335","observation_id":"91210b0a-f774-4a55-b34f-007207878237","resolution":{"observed_at":"2026-08-07T04:57:52.378380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.381307Z","title":"Greenchip: A tool for evaluating holistic sustainability of modern computing systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.381307Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:4502916af1163fc1a14b641ec42641098a487fa7627d53ff87c4a54253083648","observation_id":"ce9ccecf-224d-429f-a0fe-3e658742cba0","resolution":{"observed_at":"2026-08-07T04:57:52.381307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.384400Z","title":"A simple model for determining true total cost of ownership for data centers","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.384400Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:c50d1ae2419cf97685a6715642e4d8d9590681b09030243ed6ddfa19c7080a26","observation_id":"5e3da598-3bf7-4e8a-8b02-f52055e8c674","resolution":{"observed_at":"2026-08-07T04:57:52.384400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.971526Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"eab9c86e-1514-468c-9f72-15ed6a64f22d","year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.387416Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:de9454cf138bd98c4a7f70c5e3ade93479aee60434e3bbe05b0c1efda3681eb8","observation_id":"d124fa95-9dee-40fc-bd50-ce60eb724ade","resolution":{"observed_at":"2026-08-07T04:57:53.974769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14645","last_updated":"2024-07-19T19:49:05Z","snapshot_observed_at":"2026-08-09T05:34:56.809764Z","submitted_at":"2024-07-19T19:49:05Z","title":"Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14645","snapshot_observed_at":"2026-08-07T04:57:52.390487Z","title":"Performance modeling and workload analysis of distributed large language model training and inference.arXiv preprint arXiv:2407.14645, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.390487Z"},"links":{"cited_paper":"/paper/2407.14645","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ae799e01f21a92e003d2de59d8e84b9af46d69f7f7c0e01a749b1b856b273790","observation_id":"22180df2-748e-4d35-a4b6-11e739f0118c","resolution":{"observed_at":"2026-08-07T04:57:52.390487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-08-07T04:57:52.394060Z","title":"Quantifying the carbon emissions of machine learning.arXiv preprint arXiv:1910.09700, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.394060Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d29c107bee35478a38bb458a53088fcb845420d3e24d6c12d3987c7de1eea392","observation_id":"05e417fa-55ca-4ab1-b93a-0c09c8eb17cb","resolution":{"observed_at":"2026-08-07T04:57:52.394060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.962270Z","title":"Llvm: A compilation framework for lifelong program analysis & transformation","venue":null,"work_id":"1b0ee44c-6110-4bb3-bb34-53aab3d37c2d","year":2004},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.397313Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:775ca216b713fca5c7727bd378f55572c79ddcc200ff066c1f2b2079b3268305","observation_id":"ab11d42e-9657-4393-92d2-1509425612b5","resolution":{"observed_at":"2026-08-07T04:57:53.965486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.953012Z","title":"Mlir: Scaling compiler infrastructure for domain specific computation","venue":null,"work_id":"06f26ac3-5711-4621-988c-6f1821fc684a","year":null},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.400438Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:b3bb157088d5e8812f6e81bf6c18e499517a7300eb858a06b5540d324add95e3","observation_id":"4fb36b0f-25af-430a-8770-e254cea950c8","resolution":{"observed_at":"2026-08-07T04:57:53.956115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13853","last_updated":"2024-12-12T03:21:13Z","snapshot_observed_at":"2026-08-08T03:13:51.064859Z","submitted_at":"2024-07-18T18:47:52Z","title":"Forecasting GPU Performance for Deep Learning Training and Inference","version":3},"cited_work":{"arxiv_id":"2407.13853","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13853","snapshot_observed_at":"2026-08-07T04:57:52.912574Z","title":"Forecasting GPU Performance for Deep Learning Training and Inference","venue":"cs.LG","work_id":"934932ed-22cc-4784-b570-023450adc70f","year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.403708Z"},"links":{"cited_paper":"/paper/2407.13853","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ba8322a0d50f2a45088548ea2db21611c7c351d1222bc070f7a6d64cf19c4604","observation_id":"ded2ce9d-69bc-4240-ac79-fdaa2cb71152","resolution":{"observed_at":"2026-08-07T04:57:52.957704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.943044Z","title":"Mcpat: An integrated power, area, and timing modeling framework for multicore and manycore architectures","venue":null,"work_id":"675f302b-ae54-45e0-9b88-8889ec5e2a6a","year":2009},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.407066Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:b5e7164a01124941329387065778056eaf46765161ccf931c9c92456cb8ebe05","observation_id":"4d6c5cd6-af4c-4b67-bbc9-92b69190c56a","resolution":{"observed_at":"2026-08-07T04:57:53.946559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.934095Z","title":"Towards universal performance modeling for machine learning training on multi-gpu platforms.IEEE Transactions on Parallel and Distributed Systems, 2024","venue":null,"work_id":"0e1b9e96-663f-4b62-a870-a03ca524876a","year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.410215Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:bad7852a511561f9f8a13002de5f6c95573305978e8f34114de670a9ca3c7544","observation_id":"bc0a946d-801a-4667-8a9c-a7dd012d37f1","resolution":{"observed_at":"2026-08-07T04:57:53.937144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:57:52.413074Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, pages 4–14, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.413074Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:5f0cc8d2161abd0a736c16cc4a84ab67f74e7aefe4089755f2f8df9cc316ecdb","observation_id":"25f384dd-3806-494b-bb72-5b1d86181914","resolution":{"observed_at":"2026-08-07T04:57:52.413074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.925096Z","title":"A survey of performance modeling and simulation techniques for accelerator-based computing.IEEE Transactions on Parallel and Distributed Systems, 26(1):272–281, 2014","venue":null,"work_id":"c5516389-840f-4e10-a97c-e061091a41c7","year":2014},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.416313Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:85e7375490c2e0ca63385d6bc3e5ecbca1b6ea3c73dc7967d9c5b9db42d9093f","observation_id":"454d5b3b-5a9e-4c67-8102-92490af8c6ce","resolution":{"observed_at":"2026-08-07T04:57:53.928476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.916212Z","title":"Distsim: A performance model of large-scale hybrid distributed dnn training","venue":null,"work_id":"29856df4-3764-4ab1-b2a9-a5555d42ce3a","year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.419595Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:d0cfeb96417d10dbe37b085757d501df39a7611985f13cb7e4df2ca2112682fd","observation_id":"92a9f44b-e91c-4e62-8851-337837d78599","resolution":{"observed_at":"2026-08-07T04:57:53.919207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.422480Z","title":"Estimating the carbon footprint of bloom, a 176b parameter language model.Journal of Machine Learning Research, 24(253):1–15, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.422480Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:65edf5cb8a8af65ad0594065cece4bb67bf68d044c105fdee4c8ceea2c9384af","observation_id":"8ca5de48-b907-4c95-8482-0676e6786b65","resolution":{"observed_at":"2026-08-07T04:57:52.422480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.900707Z","title":"Review of asic accelerators for deep neural network.Microprocessors and Microsystems, 89:104441, 2022","venue":null,"work_id":"647261c7-3939-4b1f-ac5b-1c32d84b6460","year":2022},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.425429Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:38e03d3d59607d4208a5557a4272ef19560f6656c41badfc943f4005334d61d1","observation_id":"1ce70d94-22df-4e45-8077-77004c4301ae","resolution":{"observed_at":"2026-08-07T04:57:53.904278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.891727Z","title":"Azure Total Cost of Ownership (TCO) Calcula- tor","venue":null,"work_id":"a15c2e0b-b41e-46c2-ba0e-471b94444ce6","year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.428650Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:4ea88fcf42ece4b73ce726a12c30cb8eb00d8fcb02dd9be33ccf81fa2e58eee3","observation_id":"90bcfcb3-e79e-4c0e-a164-0c63b1e6f64d","resolution":{"observed_at":"2026-08-07T04:57:53.894761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.882476Z","title":"Tensor operator set architecture (tosa) dialect","venue":null,"work_id":"4d286bea-947e-4013-b69d-d56b25310de4","year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.431871Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:ac93f2490beef62ca72b87f7b273e3d065d45752024d5ae1ca5a5da009a937a8","observation_id":"fd20dfbf-0bd3-42ae-bf40-14b3316920f7","resolution":{"observed_at":"2026-08-07T04:57:53.885822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.873151Z","title":"Amped: An analytical model for performance in distributed training of transformers","venue":null,"work_id":"1f52ce29-658f-49c8-a265-48fc4f90a62a","year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.435082Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:e0999c0c4db0134cbd542508e78807ca02d63bd8a7e17c49c38ed22e2d836ba3","observation_id":"5fe95af3-1a4a-401f-8bad-08ef7cd95389","resolution":{"observed_at":"2026-08-07T04:57:53.876361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.438443Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.438443Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8695634d09f6d11e820d66f3a425c7889c2d24ee1cc441d5a5406b68ba961951","observation_id":"63cf2743-9f62-4a71-a5e9-b92cc0dae7c0","resolution":{"observed_at":"2026-08-07T04:57:52.438443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.858922Z","title":"Supply chain aware computer architecture","venue":null,"work_id":"61131493-bac1-48b3-8c06-17916af192fd","year":2023},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.441854Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:fea9fc450e822fae1bd0a1fed69cbbeeb45947d37f8e4f51f77c3e856f9d7f47","observation_id":"aacfa65a-10d0-4669-8e34-66d0fbec3d95","resolution":{"observed_at":"2026-08-07T04:57:53.861782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.850431Z","title":"Architectural simulators considered harmful.IEEE Micro, 35(6):4–12, 2015","venue":null,"work_id":"78966cf4-00da-4e5f-90e8-8d79519d353a","year":2015},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.445023Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:7a4765f28c90b1b90b81ab7a790dd20fa990923820d3fe4beaef7cbd74ecbf50","observation_id":"62cd2ab1-669c-4c24-8ede-49f87980ba00","resolution":{"observed_at":"2026-08-07T04:57:53.853278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.841446Z","title":"Available at https://developer.nvidia.com/nccl","venue":null,"work_id":"9b205885-c13c-46ca-bfc0-0c70fd64130c","year":2025},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.448087Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:9a18fc001853c03e56e1d03eb215cbf6558a8db9cd8387332fd31e088c4592d2","observation_id":"2ae537e2-1c53-45bd-ae01-e1e487785f02","resolution":{"observed_at":"2026-08-07T04:57:53.844648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.832553Z","title":"Open neural network exchange (onnx)","venue":null,"work_id":"21db5ff6-5da0-4fd9-a04f-7d62073e7efc","year":2019},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.451184Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:a94c954bac7d120bef3dcc9c63790b770c70bfbcd8d79f4ec66de8083fcb1c86","observation_id":"f42dd465-cb96-4440-8eb9-e210a72bc4bb","resolution":{"observed_at":"2026-08-07T04:57:53.835430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.823317Z","title":"Xla architecture and high-level optimizer (hlo)","venue":null,"work_id":"bab975b1-dc80-4687-866b-33ddaef3d002","year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.454230Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8e05e1e105801afc29656cc714cd2b18b5b422c56de0d4993dfd47c1cf52804c","observation_id":"823d1f6a-0451-4db5-9907-999331e5e05e","resolution":{"observed_at":"2026-08-07T04:57:53.826258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.814317Z","title":"Survey on network simulators.International Journal of Computer Applications, 182(21):23–30, 2018","venue":null,"work_id":"ad60301f-429f-43d1-a2e8-3f22677cf235","year":2018},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.457150Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:b2afb745bfd3d86d325d87526d2e57a528bc9ad1c378c050ef3e0c505fe0ec0b","observation_id":"536ecd84-208b-4335-a258-d340d672a571","resolution":{"observed_at":"2026-08-07T04:57:53.817389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-07T04:57:52.460227Z","title":"Carbon emissions and large neural network training.arXiv preprint arXiv:2104.10350, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.460227Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8baacb3cec6e8a6f9f86ab1b1d9cea496c47c27bd8382da5b01aa068775e01ef","observation_id":"d296986e-9feb-4094-9e74-08a3e9645664","resolution":{"observed_at":"2026-08-07T04:57:52.460227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.805071Z","title":"Chiplet cloud: Building ai supercomputers for serving large generative language models, 2024","venue":null,"work_id":"cf5864c8-7ee5-4191-8c37-052474ee5ec3","year":2024},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.463592Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:c88fca8a42a6db4266c806f80690850b5446b86a72607c68a33fa4c6417fc03f","observation_id":"7f463f9c-46d5-4b72-8016-0264e718bc60","resolution":{"observed_at":"2026-08-07T04:57:53.808681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.796981Z","title":"Paleo: A performance model for deep neural networks","venue":null,"work_id":"3cdcb70b-c0d0-4b40-a7bc-a1c6f91cf2a6","year":2017},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.466865Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:b4afdc1807ade5cab11c4347614852f44bac2d1b403316f0f2c00812baed9451","observation_id":"972fc42c-d806-448f-b670-27ddb58fbaa6","resolution":{"observed_at":"2026-08-07T04:57:53.799860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.469810Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.469810Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:6a59bc4a116ba2c90b12458ea966c4651a134d2930d99efc178a39927ffe48ca","observation_id":"67ccacd2-e5e7-48e9-9b58-50109f9d5f57","resolution":{"observed_at":"2026-08-07T04:57:52.469810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.472779Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.472779Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:8a08f6cf6935395e122f4a72d91eb9aca03078ebce2446b9387b6cd1affd39ff","observation_id":"870d4915-8c1a-4829-9dbb-a77af41af4d5","resolution":{"observed_at":"2026-08-07T04:57:52.472779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:52.475695Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.475695Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:34187359f6de1d84e5ad2e9e756f4beeb842aaf807a5808ee155b5f3d1b1c94f","observation_id":"244a8661-ca23-4a3a-948b-0f62a2ad878a","resolution":{"observed_at":"2026-08-07T04:57:52.475695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:57:53.772825Z","title":null,"venue":null,"work_id":"b930b1c7-9b3f-4140-9bf2-c4a4e9416a6b","year":2022},"citing_paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:52.478813Z"},"links":{"citing_paper":"/paper/2506.09275"},"observation_digest":"sha256:9c457e566ac1afe2c4c8fa858c67849d64702d31ff6e08716a77996e7e10ff42","observation_id":"9a817209-a93d-4a42-9939-53b6a7acb138","resolution":{"observed_at":"2026-08-07T04:57:53.775425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09275","last_updated":"2025-06-10T22:25:29Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T14:32:01.746757Z","submitted_at":"2025-06-10T22:25:29Z","title":"A Survey of End-to-End Modeling for Distributed DNN Training: Workloads, Simulators, and TCO"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":140},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 140 outbound references and 2 inbound Pith citation observations for arXiv:2506.09275."}