{"as_of":"2026-08-12T04:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfba250fcba1357e59ab93f5c66395c333b2b5cc17c8448b9e7fe23a4be8e501","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:01:43.396738Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19845/citation-record","integrity":"/paper/2507.19845/integrity","json":"/paper/2507.19845/citation-record.json","paper":"/paper/2507.19845"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:39.559642Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:39.559642Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:0867afa2bb8e86b6ea63dc3f6f6f9d0623416b1e688e5ee10da05cdd7945b314","observation_id":"ff1925d7-40c7-4c6f-b4bb-df4615080ae4","resolution":{"observed_at":"2026-08-06T14:01:39.559642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.979534Z","title":"Route sparse autoencoder to interpret large language models, 2025","venue":null,"work_id":"42fa5f90-3367-4caa-8e7e-99c5c6122f60","year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:39.638023Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:21120bcb3f14be801c5cdee5bd8f7c573105c8ae20ce9f02ee435a1998f0239b","observation_id":"f9b86a61-9348-4143-aefd-52c6324907e5","resolution":{"observed_at":"2026-08-06T14:01:46.984052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.965632Z","title":"Interpreting learned feedback patterns in large language models, 2024","venue":null,"work_id":"067405f6-44ce-4020-862e-1c89baef15da","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:39.731287Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:1725bb510b0644941d81313db6278d1ab53929341224b927d95bc8ac4428e538","observation_id":"5a2429ba-70c8-4444-b997-dc1a04cf3227","resolution":{"observed_at":"2026-08-06T14:01:46.969779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:39.816521Z","title":"Sparse autoencoders find highly interpretable features in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:39.816521Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:018e5da3c01266fe0f30d20714bd1610921d5ef0d670fde682471d22c0cfe8c8","observation_id":"333a933b-5304-4ace-a646-81d366802d4d","resolution":{"observed_at":"2026-08-06T14:01:39.816521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.940821Z","title":"Tracr: Compiled transformers as a laboratory for interpretability, 2023","venue":null,"work_id":"3c5455ab-4d41-400b-999c-9f1ab1afee41","year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:39.946009Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:3c2df5dca603f65ec7c65490682e4c7c9c36cc81246e0b5a70672b6b0a75c4c4","observation_id":"cb026c37-87c6-4cad-b799-74899eab1997","resolution":{"observed_at":"2026-08-06T14:01:46.945562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.927006Z","title":"Zimmermann, David Klindt, and Wieland Brendel","venue":null,"work_id":"ed29597d-e901-4b58-8384-b6001b2ff120","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.073215Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:b92a166dc642224405459e4a0ca73943e19d6ca96a70e0b9fbb73c9a7899a6e0","observation_id":"ec6fb7e6-1d9b-416b-bd84-dd4d2fb33986","resolution":{"observed_at":"2026-08-06T14:01:46.931252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T14:01:40.184335Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.184335Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:fd9ad445b0d516827d9df297792c529bb13e63252a9b077d0bf63ea02c226f6b","observation_id":"92af1654-07de-4367-a6b4-af36556f750a","resolution":{"observed_at":"2026-08-06T14:01:40.184335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:01:40.340536Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.340536Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:62807f5992748a4204907f78dad71f8b69e21ccae190b56a356121ae3c808fe1","observation_id":"68cecba5-44f4-490b-94db-8929bdc64130","resolution":{"observed_at":"2026-08-06T14:01:40.340536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T14:01:40.462652Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.462652Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:1db3deb84e795052514ac45610b916efd367b35cde0abe894fa06cc68b1ba05c","observation_id":"441abff4-518f-47f4-adde-dece146ca099","resolution":{"observed_at":"2026-08-06T14:01:40.462652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02679","last_updated":"2019-04-11T16:00:53Z","snapshot_observed_at":"2026-07-06T07:43:58.268776Z","submitted_at":"2019-04-04T17:32:49Z","title":"Visualizing Attention in Transformer-Based Language Representation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02679","snapshot_observed_at":"2026-08-06T14:01:40.587293Z","title":"Visualizing attention in transformer-based language representation models","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.587293Z"},"links":{"cited_paper":"/paper/1904.02679","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:952d1bc82e8d1f8f0a201c06a5b41811c77a1cc7bf32141e9ec81fa69f1e3799","observation_id":"82ec489f-a863-4312-b85c-fe96127430d9","resolution":{"observed_at":"2026-08-06T14:01:40.587293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.913296Z","title":null,"venue":null,"work_id":"1d8ce22e-9205-4f9b-b7c9-1817eed778e8","year":null},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.745540Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:abe18337c6406f37816ce0a1c65e3478ab612c3dbfe464a990c7104074dd7c64","observation_id":"3f287fc3-5185-4bd0-b65b-e64b5327549b","resolution":{"observed_at":"2026-08-06T14:01:46.917273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.889699Z","title":"Developments in MLflow: A system to accelerate the machine learning lifecycle","venue":null,"work_id":"362d9f4c-2fdf-4af1-b458-b1c4589ab76a","year":2020},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.973507Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:8f1c0c5cbc173e3de856d285d30aefe4c631f888d117b2f3064a558a0fdb2bf7","observation_id":"74cba2ec-dce6-4bed-bd00-2639b8036c5f","resolution":{"observed_at":"2026-08-06T14:01:46.894388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.875728Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"71504aed-9747-4257-affc-86b8a95c068a","year":2021},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.060899Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:7ad031aaa0b246e20982bda719d124e9a3831dcae4c204b08935282e70b86575","observation_id":"0f683cbd-b2f8-4c4c-b52b-f266749e94d4","resolution":{"observed_at":"2026-08-06T14:01:46.879765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:41.151142Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.151142Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:12c9dc3867e7d6dd69fa6c1e9dcb413459f708dd7ad0d96c8f8025d2644ad9fe","observation_id":"0aee5559-aef9-42ff-bb2c-c874c06b4978","resolution":{"observed_at":"2026-08-06T14:01:41.151142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T14:01:41.217172Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.217172Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:92c5ebaaa4920de0fcd5b3af48f0878a3a9111af4dfe8c06f952ea516595d1e3","observation_id":"a109fa2d-b94b-4970-907e-b0af63d062de","resolution":{"observed_at":"2026-08-06T14:01:41.217172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.852341Z","title":"Scaling distributed machine learning with the parameter server","venue":null,"work_id":"d6b682d3-53ed-4f2e-acfc-da6404ec22b2","year":2014},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.273493Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:af9a4b8dd8fa37613b4f51e00c249c6486d60ef3f04f63e3c0f321c840eb3f40","observation_id":"6b75a2a9-0015-467d-9fa1-f2d45e80d286","resolution":{"observed_at":"2026-08-06T14:01:46.856430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.838640Z","title":"Bandwidth optimal all-reduce algorithms for clusters of workstations","venue":null,"work_id":"2da60d96-b5ea-49e7-91a4-e771773b8064","year":2009},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.351448Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:7a378bcdee023083f504b3184106557287356d8a727c3c54dd68de6b64209f81","observation_id":"6150a5a3-7d91-4ef6-b437-d715e424af2e","resolution":{"observed_at":"2026-08-06T14:01:46.843044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:41.437954Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.437954Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:759cc0c1c3b3ae4fa5400d70efb1e67386d771b22bd9a92149b4338b6f5f3cc0","observation_id":"d670b2b2-2db2-49f3-9895-b89b57899423","resolution":{"observed_at":"2026-08-06T14:01:41.437954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:41.482246Z","title":"Pipedream: Generalized pipeline parallelism for dnn training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.482246Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:7cbd0ddb949fa983a5ef8da8557912fe3fa4f34bc34c248a3e10f738cf33b7d0","observation_id":"36555eb7-47b1-4ef5-a422-6d9be5b26522","resolution":{"observed_at":"2026-08-06T14:01:41.482246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.805565Z","title":"Memory-efficient pipeline- parallel dnn training","venue":null,"work_id":"b2c23bad-e1d5-4fe4-bc61-b2b9982a25d6","year":2021},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.557523Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:f1c7cc875cafd10fe15cc93c1e7d49814e2993053cba8e71add3d030fa5b664b","observation_id":"1354c924-88cd-4093-a6f2-613c17f0e5cf","resolution":{"observed_at":"2026-08-06T14:01:46.809838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.791373Z","title":"Deepspeed, 2024","venue":null,"work_id":"b7626d1c-4064-4245-9ade-bcc22a08cc51","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.681887Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:9bff73a4ad4771049dcec45bf53f1ce41c064ffcc78d482ae4b3f631c9a31e32","observation_id":"21f6cffb-eff5-4679-82a3-d08e5ba1d719","resolution":{"observed_at":"2026-08-06T14:01:46.796008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.777472Z","title":"Zero-offload : Democratizing billion-scale model training","venue":null,"work_id":"0c077849-607a-4691-87e3-419b62f7ba92","year":2021},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.767906Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:bd6b25f5db6e7e0b77a37c8317d58c8870646a3502aec2cd5fdae77cf8d63fb4","observation_id":"cf36bcac-ac4a-4a0e-ad23-85d8dce1308d","resolution":{"observed_at":"2026-08-06T14:01:46.781892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-06T14:01:41.855087Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.855087Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:bf0fb09bbe8aa9c8a67cc89c29f7f229796a34004a25fcc2dd10d646fa3ab66b","observation_id":"93504845-a558-4545-a527-62a941a443c7","resolution":{"observed_at":"2026-08-06T14:01:41.855087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.762253Z","title":"Explainability for large language models: A survey","venue":null,"work_id":"68ccb09e-d4a2-4c63-8344-a3abf7ed2859","year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:41.939220Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:cea49463884abb92fd77ed35cbe4a5fac16b531c2e66ba12601a569efaa6739e","observation_id":"ed74d2bb-3e91-4260-816e-80a5024568b2","resolution":{"observed_at":"2026-08-06T14:01:46.767182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.747241Z","title":"From understanding to utilization: A survey on explainability for large language models","venue":null,"work_id":"f721d257-9440-42ed-a8d3-558f431d4c59","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.029189Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:69a8d2fc12996cf92360ebc77d6823834b95c308a7a769b9f7a3555dd092addb","observation_id":"ceaab547-4e42-4b29-9bc7-9a9e61a1e1b2","resolution":{"observed_at":"2026-08-06T14:01:46.751741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.733342Z","title":"A gentle introduction to mechanistic interpretability of neural networks","venue":null,"work_id":"c8cb1141-d646-4e36-8a60-b096c1249432","year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.116044Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:6fe1a265f7417cf6a1cdb27e10c866ac79eab0a8232137bcb93bea301e82abb6","observation_id":"7010d1ec-8760-4698-aba3-48078e09b0af","resolution":{"observed_at":"2026-08-06T14:01:46.737650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.492554Z","title":"Locating and editing factual associations in gpt","venue":null,"work_id":"77816cc2-65d9-4533-b9a1-1a3c09ddc77f","year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.231334Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:b24dd1d5ef8b8c19ae5ba09c9d7a163c9d6426e457d0560a7c6a647189bbaec4","observation_id":"43547ed2-3779-4be1-a8af-a01560d2f2f5","resolution":{"observed_at":"2026-08-06T14:01:46.633248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.232401Z","title":"Mass editing memory in a transformer","venue":null,"work_id":"78f1512e-29c3-4a10-8b4c-43cbfbd36d21","year":2023},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.317175Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:e4279bf351b3185ab342b6fda9e97d5ac742bd1399490f88c4238aa7f642ed57","observation_id":"2d6f0289-77da-4584-9d94-be27a7c6c358","resolution":{"observed_at":"2026-08-06T14:01:46.375887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:46.010325Z","title":"Advances of pipeline model parallelism for deep learning training: An overview","venue":null,"work_id":"f4f0b979-33ab-4a8f-ae22-2d2d3993350f","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.379183Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:fc0aeee1982945ac6b46d5b8b6fdfd880fc13a6b31066c67c73b8041aaa86dea","observation_id":"f730ae48-5cac-4f9c-bc79-316a5f5afa7d","resolution":{"observed_at":"2026-08-06T14:01:46.105517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:45.729674Z","title":"Dawnpiper: A memory-scalable pipeline parallel training framework","venue":null,"work_id":"2d404ad7-b073-4eed-abf7-132b370d3f67","year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.461412Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:ba02f5e9538dd116ee80889145ef0e900c616c31bd9104a341c828f7adbef857","observation_id":"980faaf9-7684-4298-9263-9c192427a24f","resolution":{"observed_at":"2026-08-06T14:01:45.900742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:45.520748Z","title":"Zero bubble (almost) pipeline parallelism","venue":null,"work_id":"4aa6a999-75f8-442f-9088-94a61127e1b0","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.537348Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:ce1b4a6deec8a7e0792725d0e21f8f5ff0cdff0241bb4c4b46533dcc28236207","observation_id":"38bb6fd1-6f77-4ab0-b3cf-6456c0fb6560","resolution":{"observed_at":"2026-08-06T14:01:45.613957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:45.242658Z","title":"Understanding stragglers in large model training using what-if analysis","venue":null,"work_id":"db55153a-ba78-4138-837f-8ae0efd41791","year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.624276Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:f66b6cede282640d435907e07d428c4d46b381be40583e9da3d0fc4a1b9dd0db","observation_id":"415d253a-784a-4d0a-a294-75c0aa9455e3","resolution":{"observed_at":"2026-08-06T14:01:45.354605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.962195Z","title":"DPro-SM: A distributed framework for proactive straggler mitigation using LSTM","venue":null,"work_id":"1d3bde73-0a4d-4b7e-bb1e-4eb0636433b4","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.690586Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:29c62c43bc8b27970409b7562be990793708728c83753e8d8c3707a9f5acf4df","observation_id":"1ee9aca3-7f24-412a-85ef-1c054c85e8fe","resolution":{"observed_at":"2026-08-06T14:01:45.107771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.845507Z","title":"Greyhound: Hunting fail-slows in hybrid-parallel training at scale","venue":null,"work_id":"d36bb0c6-71cd-44ca-af2a-e4462cfc3741","year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.777113Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:c2af4a8cadbea14c968818a150ed0f37e0de69c7fd622a77fa8d4b6d3754c525","observation_id":"44d3816a-5648-4261-95b9-7db5fcf7a0b4","resolution":{"observed_at":"2026-08-06T14:01:44.913261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.651675Z","title":"FlashFlex: Accommodating large language model training over heterogeneous environment","venue":null,"work_id":"412feeab-031a-48b5-bb33-3a9ee6920228","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.866827Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:d10b0c0eddac7b838247a385343b39ddc427665900178060adf553d5cd9ef8f4","observation_id":"7cba1e19-934a-4b22-b3cd-1a350b27b51b","resolution":{"observed_at":"2026-08-06T14:01:44.742355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.441058Z","title":"NVIDIA CUDA gets RISC-V support","venue":null,"work_id":"a4af781f-9ce2-48b2-9d5a-589b4c8b8461","year":2025},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:42.954461Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:2ca36b18c7f777ef8e1177e2b3e9e5c3fbbb82b56757d8a3bb241058bb259afe","observation_id":"64aa6532-7026-45b8-ae6f-0f38aea52f27","resolution":{"observed_at":"2026-08-06T14:01:44.549284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.282923Z","title":"Varuna: scalable, low-cost training of massive deep learning models","venue":null,"work_id":"699293fd-45d1-4282-8fa2-84c8617dea6f","year":2022},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:43.029406Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:5288cc60c9e26c828c05a953f81bc6bddbf91588f23fb2d10762c2c459d2edfc","observation_id":"8e6928b4-5309-472e-95e5-7b09c541a9b9","resolution":{"observed_at":"2026-08-06T14:01:44.365327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:44.097041Z","title":"NVIDIA Data Center GPU Manager (DCGM)","venue":null,"work_id":"84624b1c-8a34-4f11-9f0a-654743f1c2bf","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:43.129078Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:009f7c8eb103103fa828d852aa6522a0284494b468b898665ccdfdc7200029db","observation_id":"fe38a153-6f27-458f-afeb-600c3d8e9f7f","resolution":{"observed_at":"2026-08-06T14:01:44.183639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:43.905176Z","title":"CUDA Toolkit Documentation","venue":null,"work_id":"6e848634-6a9f-45ec-9e32-01ab46b71b33","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:43.223007Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:4e579a5a9d5b073dd50db223b650ba71d85f8c9803663ef2344dc6cfe6d87fa0","observation_id":"b66d6968-d2d5-4781-a9e5-8a1afe9d455d","resolution":{"observed_at":"2026-08-06T14:01:43.999834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:43.768962Z","title":"Chrome Tracing","venue":null,"work_id":"a193a6e3-7778-416a-b130-b521f87629e7","year":2013},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:43.326477Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:600a921bae22ab87cdb83924c90a8a818b5df637750230da62716fed7b818eb6","observation_id":"d34332ad-b43f-4f4b-a5f2-9b4d18b888e2","resolution":{"observed_at":"2026-08-06T14:01:43.803278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:43.604041Z","title":"Perfetto Open-Source Tracing Project","venue":null,"work_id":"dc91df85-3dc5-4d79-97fc-2158104541a4","year":2024},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:43.396738Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:245f7dc9e7a063b25cbfaea9a1266b9081eac81dd2548bce431a799a77ec5953","observation_id":"950fd966-35d4-4c16-a301-8f1e219f3cd7","resolution":{"observed_at":"2026-08-06T14:01:43.682854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:01:40.874247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T14:01:40.874247Z"},"links":{"citing_paper":"/paper/2507.19845"},"observation_digest":"sha256:f6081878e401b202f94419ab36fdfe9ce9f21b84a0c64ec385855e91d9e5c6e4","observation_id":"1e755396-cea0-4889-b480-2a078e60b8ec","resolution":{"observed_at":"2026-08-06T14:01:40.874247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.19845","last_updated":"2025-07-26T07:39:30Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T15:03:43.580164Z","submitted_at":"2025-07-26T07:39:30Z","title":"MegatronApp: Efficient and Comprehensive Management on Distributed LLM Training"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.19845."}