{"as_of":"2026-08-20T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c20f2b709dbcafce440ed8f2a991d1a134401ca2eb806cb7aea44ea577e26ad4","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:36:04.931722Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02456/citation-record","integrity":"/paper/2507.02456/integrity","json":"/paper/2507.02456/citation-record.json","paper":"/paper/2507.02456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:35:59.309672Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.309672Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4d8e2cda231d8f3560dddefa907db7e996b3ff44324432f1a23dc261058178ce","observation_id":"c1d1c458-f91d-4ccf-92bb-131143fb65d8","resolution":{"observed_at":"2026-08-06T20:35:59.309672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:15.791386Z","title":"GLM: General language model pretraining with autoregressive blank infilling,","venue":null,"work_id":"2944c98b-b49e-42ab-bb16-569a8cfda48b","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.407398Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:6be5bef7b0bcb9cf084cd984a06398923c8f8918cc093823aa1fe6a6d5a14415","observation_id":"9240627f-84c1-4358-a5dc-43da1e2f78de","resolution":{"observed_at":"2026-08-06T20:36:15.884144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:15.550754Z","title":"BERT: Pre- training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"355071eb-2c47-431f-9114-1cde5edb208a","year":2019},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.492521Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:b4ec11f8846d42132c9deebb42a769d119b836d997b5e37d96a0b5c2bc83493e","observation_id":"79822983-13a0-4324-8e7d-43797f51fbe6","resolution":{"observed_at":"2026-08-06T20:36:15.676991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:35:59.565991Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.565991Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:bb24e24ea1a11d4e071b0862ede39599b74525de11a639977851e8df74a16f47","observation_id":"4d9fc970-16e2-4e76-8b66-4a15cee08583","resolution":{"observed_at":"2026-08-06T20:35:59.565991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:15.387879Z","title":"Training data-efficient image transformers & amp; distillation through attention,","venue":null,"work_id":"10636fe0-f698-470c-9f65-b850954c8707","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.661027Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:6d62474af03f7936c0c0de47217a42ccf5652d02ac722dbd1558321b903e15c0","observation_id":"82037dfc-9536-426f-9681-0fb1087a8bf1","resolution":{"observed_at":"2026-08-06T20:36:15.475069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:15.195445Z","title":"Multiple physics pretraining for physical surrogate models,","venue":null,"work_id":"b562fc10-29de-4768-8e2b-74b2261f5d4f","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.776599Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:1e4ba5d07d9802da53561bb780a250ae0d0dc947dd87ceede543961ceabe6f79","observation_id":"2f8c24de-a924-47d2-b3b3-f2d936a81128","resolution":{"observed_at":"2026-08-06T20:36:15.279957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:15.005504Z","title":"Highly accurate protein structure prediction with alphafold,","venue":null,"work_id":"dac8f8b1-131e-41d1-b1f3-ce9cbba8b33b","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.882025Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:7019a3a58111e20ef50184385d7e92d829bd59ef98b485731f62d93664aad8fb","observation_id":"7ea5edc2-ac6c-457e-a784-b27440222460","resolution":{"observed_at":"2026-08-06T20:36:15.095937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:14.804752Z","title":"Evolutionary-scale prediction of atomic-level protein structure with a language model,","venue":null,"work_id":"15e1e9fe-7741-4d87-85cb-165458776fdc","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:35:59.979597Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:8ffa7b18d21dafc7a8d1191ee430bcecd3d3386bc46fbac647a7e0074bb5dfc2","observation_id":"6787ed9c-0e3b-49bc-b0d4-0b7c0f92a754","resolution":{"observed_at":"2026-08-06T20:36:14.907555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:14.663030Z","title":"A foundation model for atomistic materials chemistry,","venue":null,"work_id":"5b3f5234-de16-4ec0-a4c1-62e0a7a4276c","year":null},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.100244Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:aeb2353381170d71ff85bbfa0c967dc7e27b092da4114cd8dab64d2351c3bcbe","observation_id":"2ad42462-e13b-4523-b844-f38cc6e5e2c1","resolution":{"observed_at":"2026-08-06T20:36:14.738188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:36:00.282601Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.282601Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:e39aa56732678d06551f2ee96adbde956e13e26a5f0497b85c6537d971fa70a0","observation_id":"ac099849-0968-4f0c-ae4f-04218e96b6ec","resolution":{"observed_at":"2026-08-06T20:36:00.282601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:14.484151Z","title":"Efficient large-scale language model training on GPU clusters using megatron-lm,","venue":null,"work_id":"314be5c7-032d-40a9-affe-04aca52eefe5","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.370532Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:b4b175aa90333b7dccd394c15d2764f9df17a79e78af249acc587eb4763abdda","observation_id":"75b3bbd4-f5ea-4ed1-97ba-c6b8bb03c6d7","resolution":{"observed_at":"2026-08-06T20:36:14.588800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:14.207211Z","title":"DeepSpeed-MoE: Advancing mixture-of- experts inference and training to power next-generation AI scale,","venue":null,"work_id":"0a718535-37d9-4a46-bd3d-5d2fe26771fa","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.458869Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:f69d558548c4517a1a623eb9d87019db55e709cc31db2604f883404016b71718","observation_id":"beaf0e9e-52c4-4f79-94b7-be291631421a","resolution":{"observed_at":"2026-08-06T20:36:14.337360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:14.019984Z","title":"DeepSpeed- inference: enabling efficient inference of transformer models at unprece- dented scale,","venue":null,"work_id":"fc53d78e-0a21-4ab8-ae46-971e24b23bcc","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.538105Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:444b56a6177f442899090898832a0360d17e27fbfff88da84085ffbcd3c35288","observation_id":"1c53770a-9cf8-41eb-a684-7a5bd99e37b1","resolution":{"observed_at":"2026-08-06T20:36:14.098512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:13.821305Z","title":"OpenAI’s massive GPT-3 model is impressive, but size isn’t everything,","venue":null,"work_id":"df9d67df-2df6-48ea-af44-3c785190f1b7","year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.604883Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:291fa45ce2043cb63bf4c38f498c79802bc68337ea2491f66b0701c6753dcb0a","observation_id":"52b46adc-c68a-45d0-af41-c95df3e7785b","resolution":{"observed_at":"2026-08-06T20:36:13.917167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:13.590617Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"63b3ca7f-93ae-44c2-8a25-7e6b42937a15","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.653257Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:449da3d1b15dbfe617c2d6196429210f117fe5d5d28fde4a1b23fd87351b5435","observation_id":"5354d26d-14b5-4dce-908a-437baeef0990","resolution":{"observed_at":"2026-08-06T20:36:13.728757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T20:36:00.725603Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.725603Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4bb0d0436f718166a0e264add55750fa48317241142ab027231815ce4a880504","observation_id":"107b19e2-f183-4a68-82e2-f852051f3e64","resolution":{"observed_at":"2026-08-06T20:36:00.725603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:13.434128Z","title":"Glam: Efficient scaling of language models with mixture-of-experts,","venue":null,"work_id":"11062e87-b7aa-4cfa-a327-a176addcccc2","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.784240Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:e75ca6ab73f8354eeb69822d35edf9c38148b01c8dd226db4832c313e54a8b84","observation_id":"fe5b0906-b473-491a-8b3e-5a39aac6a104","resolution":{"observed_at":"2026-08-06T20:36:13.501073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-06T20:36:00.876438Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.876438Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:bf6d475e684596399dadac00e560f42592aade53a0e1bb8729c77bbbe5817c55","observation_id":"0d34d1ff-41e9-479a-94c8-75fe139c49a6","resolution":{"observed_at":"2026-08-06T20:36:00.876438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:13.242861Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low- precision,","venue":null,"work_id":"f5b61b14-f311-418c-a5aa-8ff7fca1245d","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.991151Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:465caecbbe63e3ffd108f855f84413d005faa3507eeddc823785b14a47c3c19f","observation_id":"01f52c28-0579-4c73-a4f7-e597e5724cf2","resolution":{"observed_at":"2026-08-06T20:36:13.348016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:13.081062Z","title":"From words to watts: Benchmarking the energy costs of large language model inference,","venue":null,"work_id":"9de2506e-ffa4-4d1d-b12a-292b4d2f1b72","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.057307Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:5aefa62ad43d896b0ce63359e2e8120891a7ab39674864238e5cd8e943b1d243","observation_id":"fec09ee5-cf3d-4057-9db9-35204a79ab1f","resolution":{"observed_at":"2026-08-06T20:36:13.153456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.920941Z","title":"Energy- efficiency limits on training AI systems using learning-in-memory,","venue":null,"work_id":"58a660b3-8499-465f-8466-9758710693dc","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.121080Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:9615888bb3c8ecf825e3d14546562afc4a3dfedc8c50cfe4084eb7fecfd129c9","observation_id":"ac5c939c-b769-4153-841e-3a74991501c3","resolution":{"observed_at":"2026-08-06T20:36:12.996485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.664630Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding,","venue":null,"work_id":"3f3744ab-e044-46a4-a388-89e157318bae","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.197895Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:33c1b97dc6cf80844a4646674119dffb0bc22fbf37762037b4d8966bc302f18e","observation_id":"862da844-d9f3-44d2-b760-863757afa341","resolution":{"observed_at":"2026-08-06T20:36:12.783882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.521712Z","title":"Astra-sim: Enabling sw/hw co-design exploration for distributed dl training plat- forms,","venue":null,"work_id":"6f8e668a-f4e3-4e14-afd7-31811a03f7b4","year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.274194Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:d6dd70d721b637687c0e3f868b34788eb94d479cb25e97f17ea2633d74463144","observation_id":"ddb77837-6aec-4b3c-9655-07e1d11e4b4b","resolution":{"observed_at":"2026-08-06T20:36:12.587193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.319255Z","title":"AI and Memory Wall ,","venue":null,"work_id":"25f6bb42-2cbc-4d61-b9b3-110bc51bfd62","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.359259Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:d7708553b013602e94fa8a52348e6dd4bccaede3d1a246312fc0e53758a99da0","observation_id":"869ff1bc-0b50-45c8-af95-b8eb7942602a","resolution":{"observed_at":"2026-08-06T20:36:12.421265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.148110Z","title":"(2024, Dec) Nvidia blackwell platform arrives to power a new era of computing","venue":null,"work_id":"fa5491d7-86f2-4612-b967-e55a6250363d","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.434749Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:0184bbceaba9dc63d0bd8156e5e283aa00dbf68e720b6ecff5067b3d3e8ddde3","observation_id":"7f45dedd-f5cc-444a-89e6-0b1f4d8f1934","resolution":{"observed_at":"2026-08-06T20:36:12.218746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:12.016317Z","title":"(2023, Jun) Amd mi300: Taming the hype - ai perfor- mance","venue":null,"work_id":"700ff2e6-7dcf-4dc7-abae-9929863e3a28","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.513128Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:f9d84c267cd396232b6099339346a6fc986fec4952bc0ef6af8f337827c42cd8","observation_id":"39ba6c60-0dea-46d3-ba51-63092de6cde2","resolution":{"observed_at":"2026-08-06T20:36:12.089157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:11.870180Z","title":"(2023) Why chiplets are so critical in automotive","venue":null,"work_id":"b4e87ac9-fa7e-4b9e-814b-a8818f1aa16e","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.582686Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:244ef31cc3ef39b3eed6121ac079963c67452d4ca4cf0bcf77322ee46d0295ce","observation_id":"c3a9a0ce-1fcc-4542-8508-badb27c8fd1c","resolution":{"observed_at":"2026-08-06T20:36:11.948593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:11.627813Z","title":"Performance Modeling and Workload Analysis of Distributed Large Language Model Training and Inference ,","venue":null,"work_id":"ffe075f0-63e8-4c80-88c0-a7c05e09190e","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.663839Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:c35a132718c4ae39fd0fe49a769fffcf860248a4f2e3388214a15dbc7638276e","observation_id":"7af9eb67-6a9f-4283-a5ec-bb9cdca6231b","resolution":{"observed_at":"2026-08-06T20:36:11.752095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:11.409154Z","title":"Chiplets: How small is too small?","venue":null,"work_id":"6d23b222-cf33-4d26-84cc-5a79266367c3","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.722837Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:abc9483a3c3b2a36913ad59dec5b34ca81f649d91ad5b6e3386d0c01cb6bd60e","observation_id":"ef0407cc-075e-47a2-a477-48dfa458830a","resolution":{"observed_at":"2026-08-06T20:36:11.485003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:11.180389Z","title":"Analyzing CUDA workloads using a detailed GPU simulator,","venue":null,"work_id":"64d74462-959d-4d4b-afc6-7f69002dce77","year":2009},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.784352Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:1becbc306595b75e0c31df7c25dfef4fa31770db7829435c1cc7e1a73e8a01cf","observation_id":"01cf57df-5953-42ba-aa88-e7e52ee402fe","resolution":{"observed_at":"2026-08-06T20:36:11.275286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:01.855007Z","title":"Accel-Sim: An extensible simulation framework for validated GPU modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.855007Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:e268d978caeca06cb8b07b400f00b9d280dc12feae2450dd0548e6a6487f54a1","observation_id":"08d581c8-ccdc-418b-a5fa-8c3679cb5a01","resolution":{"observed_at":"2026-08-06T20:36:01.855007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:10.928256Z","title":"Cross- architecture performance prediction (XAPP) using CPU code to predict GPU performance,","venue":null,"work_id":"caefdff2-e913-4050-80df-d7aa9b19eb8e","year":2015},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:01.907155Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:2907794709dd39bf3ce711f073cccba1f89b2a87cf2db8b0b0ccb28a6c28044f","observation_id":"8dc82372-5c50-4095-9714-53e713ed159b","resolution":{"observed_at":"2026-08-06T20:36:11.060825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:10.548757Z","title":"Principal kernel analysis: A tractable methodology to simulate scaled GPU workloads,","venue":null,"work_id":"70496e9c-dc55-4662-8abb-40891690df7e","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.007344Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4165113ff0abc62d2d59234eaefe5aafc5416e5d9cda25cd42a944f065247e0e","observation_id":"14f88a40-1ea5-4dfb-a0d5-eba97493a9ec","resolution":{"observed_at":"2026-08-06T20:36:10.720745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:10.131594Z","title":"Activation in network for NoC-based deep neural network accelerator,","venue":null,"work_id":"0a2bd7ca-a0f0-4662-936f-687a05790f7f","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.075870Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:c9b11e4b2fb56f7e5a46067522c685eb9a3dea9b2b2092efe6c5bacdba9ff381","observation_id":"7cd64e67-eeb1-49af-bed1-a427075f48b8","resolution":{"observed_at":"2026-08-06T20:36:10.343262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:09.711909Z","title":"Performance modeling and scalability optimization of distributed deep learning systems,","venue":null,"work_id":"5a0ffeb7-bb96-4ff9-8c6d-bddf48cf0e03","year":2015},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.185608Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:f0cce6cfffd4d5f052e479466333a506bd5a18484638a1b3be8c9379ae4cb6b2","observation_id":"b086559f-7855-47c8-98fa-cee930af3222","resolution":{"observed_at":"2026-08-06T20:36:09.948280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:09.408752Z","title":"Paleo: A performance model for deep neural networks,","venue":null,"work_id":"e801f4f7-3e2d-468c-bdab-ca40c103175b","year":2016},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.260949Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:a7fbb7c1f711895c9ae54172f9cd7610c62ea2a848e4d56028ff37e2848736de","observation_id":"fd91624f-6a57-4635-af9e-9b127072571c","resolution":{"observed_at":"2026-08-06T20:36:09.574789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:09.223474Z","title":"Performance prediction of GPU- based deep learning applications,","venue":null,"work_id":"3a75cdd1-6c1a-4bdf-b39c-98059c3bbccb","year":2018},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.357371Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:8cfc9aaf386a9aae1b0b6e4c1118b5f9f0e57723bd167517109785783e148037","observation_id":"cbec8c55-40ee-4abb-8734-262cbafe021c","resolution":{"observed_at":"2026-08-06T20:36:09.277020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:09.087327Z","title":"Habitat: A runtime- based computational performance predictor for deep neural network training,","venue":null,"work_id":"577601ac-1d14-459b-9c4e-af1ff554b3ad","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.437306Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:7b599d8ba40a33fe831e77736b073f6f7ff4a5a4a99dd7ad925622cd7e9033cb","observation_id":"c51cf814-1e0a-43f3-ba48-af894539fe4f","resolution":{"observed_at":"2026-08-06T20:36:09.152049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.968446Z","title":"AMPeD: An analytical model for performance in dis- tributed training of transformers,","venue":null,"work_id":"49c22477-8729-4dd1-af94-67b94ebd6001","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.530564Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:964373f8bb5c9aa7415e43ac9a839b317867f0ff73baada950e0765841629cec","observation_id":"9f01cb95-8b14-498c-abaf-986755ad1b9f","resolution":{"observed_at":"2026-08-06T20:36:09.005067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.796324Z","title":"Calculon: a methodology and tool for high-level co-design of systems and large language models,","venue":null,"work_id":"e372ca09-f7ba-4f46-8965-a47b00210c9b","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.635168Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:2254d0cbec07c1691207106739e2ee820567ddf73354826b2c94066be286c5a6","observation_id":"b31bc0f0-4566-4c55-ae70-6f2647d54ae9","resolution":{"observed_at":"2026-08-06T20:36:08.868632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.701349Z","title":"DeepFlow: A cross-stack pathfinding framework for distributed AI systems,","venue":null,"work_id":"4da8f481-e155-4b44-9561-9f95e3f63926","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.724546Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:b87ddfbb5dbdbb6ff260bef19dbdcac60a43369dc85e7a87579ddbd562cb05c8","observation_id":"7801bd08-b3cf-4818-a0a0-14bd3b84097c","resolution":{"observed_at":"2026-08-06T20:36:08.753230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.555054Z","title":"Comprehensive performance modeling and system design insights for foundation models,","venue":null,"work_id":"06207297-2b1f-4484-8216-ed7bab604ae1","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.831557Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4a4230fdc9079a589b1d52aaddd618b9d31a97894429a33b6f3829fc833f4f10","observation_id":"7a84fd28-e1a8-442b-aa66-957282cc91f9","resolution":{"observed_at":"2026-08-06T20:36:08.611265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.403692Z","title":"A simple model for portable and fast prediction of execution time and power consumption of gpu kernels,","venue":null,"work_id":"0ac1349a-6a89-4a44-bdbf-e597243bfe70","year":2021},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:02.940076Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4971772f9a7ac4f6b8734f722f1e513ced64803a7559d4169aebc8c00db12eea","observation_id":"ad24e7ab-7403-4570-ac23-26e653e0eb0e","resolution":{"observed_at":"2026-08-06T20:36:08.467188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.254993Z","title":"GPGPU performance and power estimation using machine learning,","venue":null,"work_id":"3a699de9-6b80-409f-b918-e6da904a764c","year":2015},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.016988Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:3f1a52a411c2c75662c11072f56d46f3918a1ff0eaed2a864ff2fd76a6b02084","observation_id":"39cd6caf-d9a7-498e-a938-26ecadb2cd6d","resolution":{"observed_at":"2026-08-06T20:36:08.327262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:08.115322Z","title":"GPU static modeling using PTX and deep structured learning,","venue":null,"work_id":"a0b8c3c0-63b8-4ea1-84cf-47f1722f7ef6","year":2019},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.071908Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:d21b864f1ca0a4c62d21b2975d53eb6828a508e071fe41b29ffd28bb74a2080d","observation_id":"f65a500d-db18-4c53-8e3e-94189737f378","resolution":{"observed_at":"2026-08-06T20:36:08.185644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.964968Z","title":"Program analysis and machine learning–based approach to predict power consumption of cuda kernel,","venue":null,"work_id":"92f41670-e828-48cc-a470-8cb70fa06cee","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.143503Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:e84d66e8691335df6978470692f4a7330b87f8c0e55658b37d698c2bd83ddcbe","observation_id":"4d62df9d-9a70-4796-a433-3a08b5934dbd","resolution":{"observed_at":"2026-08-06T20:36:08.023418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.824393Z","title":"Forecasting gpu performance for deep learning training and inference,","venue":null,"work_id":"eb631065-99aa-4f44-901a-4be5b67b6883","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.252009Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:a2bc7a17b8fd9ad99718963e60ce0d4ec8bbafa60aab0e7982f5c0a1b026f5f1","observation_id":"5a17e420-aa07-4135-b9bd-8cfebca81794","resolution":{"observed_at":"2026-08-06T20:36:07.876137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.690646Z","title":"Cost analysis and cost-driven IP reuse methodology for SoC design based on 2.5D/3D integration,","venue":null,"work_id":"aba4c304-a396-4318-8793-ac8df659ff50","year":2016},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.323591Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:fc17aae258978059c4a3357ae4887875a682f9b6ebdd1ef864c75f0bb731b69a","observation_id":"f9050f38-5820-4ca1-8617-d99107cedce4","resolution":{"observed_at":"2026-08-06T20:36:07.754329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.566025Z","title":"Cost-effective design of scalable high-performance systems using active and passive interposers,","venue":null,"work_id":"c6ed868c-3b98-4749-86f5-76b31cabb360","year":2017},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.438696Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:4edc77471ff83b2e4397e8a286dc518f787556ae2d60586cf1fc1d6bbaf3eca6","observation_id":"ad6d7033-19eb-4e31-91d0-a0111d2832f5","resolution":{"observed_at":"2026-08-06T20:36:07.628951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.415549Z","title":"Chiplet actuary: a quantitative cost model and multi- chiplet architecture exploration,","venue":null,"work_id":"b2b5781a-533e-4d0c-859f-2424f925dc8e","year":2022},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.527251Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:da212d7eed60241ea95b600e7c2a956acebbe6794951e3f4b7ae6cd437d67380","observation_id":"dd258250-5a16-49c0-8817-a33422e867a8","resolution":{"observed_at":"2026-08-06T20:36:07.491324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-08-18T07:55:39.603370Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-06T20:36:03.647922Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.647922Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:abebf07c81f143c88a97cce63f2a6bfca0ece3076aa0f22fb18886986b1b7af1","observation_id":"ed8e130f-cd72-4d62-b1cc-d1f3a73a57a6","resolution":{"observed_at":"2026-08-06T20:36:03.647922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.282008Z","title":"From online softmax to flashattention,","venue":null,"work_id":"cc21c5a8-e815-43fd-87d1-3249844a17bf","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.796628Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:ac0a6804939f44031c02facaa8358015c930793464ebfce07c325d9b7343adac","observation_id":"74adcbb4-341e-4a99-a6f8-e86cb277eae9","resolution":{"observed_at":"2026-08-06T20:36:07.365346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:07.149170Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture- of-experts training,","venue":null,"work_id":"a8de2d62-7839-4631-842b-0bbdc5abd595","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.850832Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:07428e61657778aecc3c5e5b489a5c529d9e782a82e0452165e8b9ced1bceab3","observation_id":"ac754c03-861b-4d9e-93dd-6faf50682465","resolution":{"observed_at":"2026-08-06T20:36:07.179821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.888363Z","title":"Training deep learning models at scale: How nccl enables best performance on ai data center networks,","venue":null,"work_id":"37b6dda0-f06f-4dba-9b51-f1ad32001764","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:03.930148Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:14e2aee6ab6cd7f5d9d178c985c511872757df39db83d3478e5bd2b2c0571204","observation_id":"de7110b9-6ba8-4c35-9a83-a5243c12a3b5","resolution":{"observed_at":"2026-08-06T20:36:06.998039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.801074Z","title":"Optimization of collective communication operations in mpich,","venue":null,"work_id":"196e6994-c420-476e-8cd3-56e0606f3d10","year":2005},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.020247Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:f85115cbad8d98ea7117308a6f9de3ba182e0826ab2f0bd9103999885107566e","observation_id":"76a485d8-fc27-41f9-8129-e219edcfc1bb","resolution":{"observed_at":"2026-08-06T20:36:06.839641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.692163Z","title":"Highly available data parallel ml training on mesh networks,","venue":null,"work_id":"e8c3cfae-8418-445c-8766-7007d306389c","year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.095555Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:a9decd052023d57d7e0cb965034cf6007640edbd4e0df7c3ccf6d7464428d80e","observation_id":"a5e92057-f09f-4463-9089-bc5fddb9f37b","resolution":{"observed_at":"2026-08-06T20:36:06.745037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.575196Z","title":"An overview of manufacturing yield and reliability modeling for semiconductor products,","venue":null,"work_id":"261b0884-c269-449b-9110-511ab10baca6","year":1999},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.173539Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:5a6161a57e45ce7da85c0684235517887a99062c52bfa288ac5d928fb056519f","observation_id":"d8faf23c-3fc8-4ee4-baeb-d02d21c1e657","resolution":{"observed_at":"2026-08-06T20:36:06.639476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.313715Z","title":"Cost-performance co- optimization for the chiplet era,","venue":null,"work_id":"1be5065e-a963-48b0-b89d-edee564c6171","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.263853Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:7fd8b381d165ce0871f39e6ca81671e90f3f8661a3fe5a0b204201caa2702395","observation_id":"7b47a4e3-3986-48ba-b069-2bc812a35f98","resolution":{"observed_at":"2026-08-06T20:36:06.444858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:06.053274Z","title":"Smoothing disruption across the stack: Tales of memory, heterogeneity, and compilers,","venue":null,"work_id":"6e4a9a5b-59be-4c76-8934-7f17229c9ff4","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.392126Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:c2e212cc08572aa36deaf83693587275fc4954994253c371c208136c24bc6341","observation_id":"8fa55cc9-332d-4950-b6f0-110af4d847e3","resolution":{"observed_at":"2026-08-06T20:36:06.144507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:05.915090Z","title":"Eco-chip: Estimation of carbon footprint of chiplet-based architectures for sustainable vlsi,","venue":null,"work_id":"e6688f13-5d44-424f-8dcb-348260b7bebb","year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.504890Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:97167cd208b5b9898ce865e8e8ba27df8563dd190f11eadf552c0c2460311fdf","observation_id":"5d236e00-f7e8-4e74-b230-d6501449c9dd","resolution":{"observed_at":"2026-08-06T20:36:05.961902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:05.820586Z","title":"Exploiting chiplet integration technol- ogy for fast high-capacity dram modules,","venue":null,"work_id":"c6219be0-5013-4914-927c-ade651162c34","year":2025},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.601202Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:120b76c63376a93b933c77e2b38dd61b9e494af13eda0bdf8b352da1b0570fad","observation_id":"793753d1-d306-4441-a695-ab7d05de76a1","resolution":{"observed_at":"2026-08-06T20:36:05.849708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02885","last_updated":"2025-02-05T12:16:00Z","snapshot_observed_at":"2026-08-20T00:11:20.764794Z","submitted_at":"2023-08-05T14:04:39Z","title":"REED: Chiplet-Based Accelerator for Fully Homomorphic Encryption","version":3},"cited_work":{"arxiv_id":"2308.02885","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02885","snapshot_observed_at":"2026-08-06T20:36:05.096825Z","title":"REED: Chiplet-Based Accelerator for Fully Homomorphic Encryption","venue":"cs.CR","work_id":"4627d890-d783-4e22-a791-88cf74926473","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.657262Z"},"links":{"cited_paper":"/paper/2308.02885","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:054120590952a5e5210a5ba875c928aa8ec63599e2daa39f33728eb630c49c0d","observation_id":"67af2295-df29-43e7-bf68-280fcd1e17e8","resolution":{"observed_at":"2026-08-06T20:36:05.159919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:05.656467Z","title":"Astra-sim2.0: Modeling hierarchical networks and disaggregated systems for large-model training at scale,","venue":null,"work_id":"285b55da-4cdd-412e-b578-e50fec686d60","year":2023},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.755119Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:9a63531d50664c828da43e8b76f3981138ca02288bd8d7df244e61a6a47383d2","observation_id":"23278291-6bae-4e82-a939-aca912426820","resolution":{"observed_at":"2026-08-06T20:36:05.748001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:05.476306Z","title":"(2020) Nvidia dgx a100 system architecture","venue":null,"work_id":"46095163-9fa9-40b7-add0-652ccf6a92fb","year":2020},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.825926Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:bd8167919e04b0e80bb8496ca51a2a9dc678a0ac17b1c8a8d1c1c31bcfe38848","observation_id":"5de680fd-0d9c-42a4-ba2b-7bc509b2ba18","resolution":{"observed_at":"2026-08-06T20:36:05.559798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:05.321883Z","title":null,"venue":null,"work_id":"815e59ba-74f0-453b-b9e8-0968b9e994a5","year":2025},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:04.931722Z"},"links":{"citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:d7e595857cdae737afb999b00506fb869f91d4c365ea74565c5197b595cf147d","observation_id":"6e6a679e-2a17-4eaa-93c6-0365f33b806b","resolution":{"observed_at":"2026-08-06T20:36:05.404171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00096","last_updated":"2025-09-04T13:50:21Z","snapshot_observed_at":"2026-08-04T22:35:15.439821Z","submitted_at":"2023-12-29T23:08:59Z","title":"A foundation model for atomistic materials chemistry","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00096","snapshot_observed_at":"2026-08-06T20:36:00.175701Z","title":"Available: https://arxiv.org/abs/2401.00096","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.175701Z"},"links":{"cited_paper":"/paper/2401.00096","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:89d12f47392519afba5d3411518afbd08597bb2c579b2da07e6e6e4800c7cf8c","observation_id":"dd93d604-a521-40d0-9f9a-9dd1cf51f009","resolution":{"observed_at":"2026-08-06T20:36:00.175701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-19T15:01:46.953665Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":56},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2507.02456."}