{"as_of":"2026-08-05T23:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63d92e7247f3140e6939997e7967ceb60503efef8bd609a6cf5c6cee0f21d7d9","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T18:42:09.591282Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.27678/citation-record","integrity":"/paper/2605.27678/integrity","json":"/paper/2605.27678/citation-record.json","paper":"/paper/2605.27678"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":"Chiang, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:21ad3f487fbd23998009708e88749de969fca099f6c0ba872ac8aac213f4a6c3","observation_id":"37afc617-2f4a-4cc3-b942-e946c76673ae","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":"Using Cornstarch 5d parallelism.https://cornstarch-org.github.io/ parallelization/cornstarch_parallel/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:798c549019c81967607c89c131025258125d7fcf73db1fdc8f273afdcf818188","observation_id":"b466a14f-5a54-4f85-a123-fc09a5a382e7","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:caf60eeb9510c003e0491a93023201f85bba7521117defe521a272f503f15dab","observation_id":"835a55c5-6677-4da3-8d02-6c760d47a817","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":"Huang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:db5c51fb33709e05b655eb458282dbaf86cc8a6f489c3ddd58bb332455ff7d69","observation_id":"dbd5eeaf-f463-4c91-a67a-0f1e61aace7b","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:be348205a74d2e8172dd99d3186e4fd76a6229659c5130e18fee546bc6ae0cdd","observation_id":"bd706786-a3c5-4442-9be2-0de0d60f110f","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11367","last_updated":"2026-05-24T17:29:55Z","snapshot_observed_at":"2026-08-03T16:25:15.932259Z","submitted_at":"2025-03-14T13:07:45Z","title":"Efficient Distributed MLLM Training with Cornstarch","version":4},"cited_work":{"arxiv_id":"2503.11367","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11367","snapshot_observed_at":"2026-06-29T18:43:50.403325Z","title":"Efficient Distributed MLLM Training with Cornstarch","venue":"cs.DC","work_id":"6e48c191-84b4-44d8-a183-5a0ad0071f4a","year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2503.11367","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:f5292bf6975e7bd617ccc095a76a20e6399436a373b8c1c4c53d07260e97d004","observation_id":"602a3a2e-ac59-43c7-a30e-31c746f92d97","resolution":{"observed_at":"2026-06-29T18:43:50.404654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17145","last_updated":"2024-10-28T13:44:30Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T21:32:51Z","title":"GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism","version":2},"cited_work":{"arxiv_id":"2406.17145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17145","snapshot_observed_at":"2026-07-04T02:39:24.671169Z","title":"Ganger, Tianqi Chen, and Zhihao Jia","venue":null,"work_id":"cdf7aa78-dd1e-4d9b-a6b0-70e8488bab25","year":2024},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2406.17145","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:e743a9d2ae74c41a4c9bb1781e771c4c7f8a06b1d6a02eefe0a02c45924843a3","observation_id":"5fe3c342-442d-4adf-9c38-cc2c6e1448e5","resolution":{"observed_at":"2026-06-29T18:43:50.399012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1569.376484","doi":"10.1145/3731569.3764843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context Parallelism , url=","venue":null,"work_id":"ac2aebe6-3b72-4fe1-afe9-d512f0a1245c","year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:5b4cde9b5c466455993f1355575f624229b72a9c4776d8475f8873daf84a22dd","observation_id":"49192dec-bb94-41df-af56-6e74e88f3818","resolution":{"observed_at":"2026-06-29T18:43:50.190743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:24:22.627529+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:24:22.627529+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.07894","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.413525Z","title":null,"venue":null,"work_id":"5e04c133-0b19-4adf-9ffa-d7bf9c24a707","year":2024},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:7164e53a03db170c070c9fe7f1a3d2e54fd3060283208101995dc83f30949d47","observation_id":"a0a73dd6-7e11-44b1-bf68-2f434cd09e32","resolution":{"observed_at":"2026-06-29T18:43:50.414857Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-05T01:25:49.519251Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:01b77dfa7c62ef0bf06f6c4ca3baf093998070e1d259a39e8edae37c4b91d025","observation_id":"18dd1c7d-1d54-4fb3-b41d-d0ad1f22525a","resolution":{"observed_at":"2026-06-29T18:43:50.412459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.21788","last_updated":"2026-06-08T12:37:51Z","snapshot_observed_at":"2026-08-02T20:59:23.294747Z","submitted_at":"2026-02-25T11:11:53Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","version":2},"cited_work":{"arxiv_id":"2602.21788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.21788","snapshot_observed_at":"2026-06-29T18:43:50.407822Z","title":"Efficient Scaling of LLM Training with Flexible Context Parallelism","venue":"cs.DC","work_id":"4bdb7e1d-a95f-443f-aa00-2fb386452a38","year":2026},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2602.21788","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:589d0072f34378d8ee959ad007b61eb4fe978263beb32eee3bb148f3521e3871","observation_id":"9c284704-0d17-4296-b8e5-f12cb6ab10f6","resolution":{"observed_at":"2026-06-29T18:43:50.408967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:3123498a3ee435b18e3f84c2e24e3941531d504040ae5343efbe17b1374f8e54","observation_id":"016ac0a1-b5d2-49a4-bcd4-eeb4077c09ee","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:1daac0ce317052c5c745b2ef2e09ab63b5c84d1f6377fa84348b8468e782a56c","observation_id":"eabf0c20-599f-4976-baae-a1fa4f4e07f8","resolution":{"observed_at":"2026-06-29T18:43:50.409788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:42f967a35450381cd313785aab31f50b642a2ee2f107a042e5f44bef30dbbda8","observation_id":"f328d04f-1a59-481b-87cc-bf24da721425","resolution":{"observed_at":"2026-06-29T18:43:50.417019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:ba30597b4f6ee62a8ea54861c5dd04634d24847a851974c27ee977b582f08688","observation_id":"16bc8f80-e4bd-46ec-bb85-73c17165dfd3","resolution":{"observed_at":"2026-06-29T18:43:50.407336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01523","last_updated":"2025-02-11T07:31:03Z","snapshot_observed_at":"2026-08-04T08:13:37.723094Z","submitted_at":"2024-12-02T14:16:03Z","title":"FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism","version":3},"cited_work":{"arxiv_id":"2412.01523","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01523","snapshot_observed_at":"2026-06-29T18:43:50.389607Z","title":"Sam Wiseman and Alexander M Rush","venue":null,"work_id":"91f83fa4-65a9-48f0-9391-7b490cd3a2b3","year":2024},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2412.01523","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:8f2ad595996b728115c48b12228bc8aa2ba610e5232f2823a5e9a704dac001db","observation_id":"8ae92075-ed80-43b8-944a-6720f4976e71","resolution":{"observed_at":"2026-06-29T18:43:50.391035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:1f4128980efcc45df103afa7995cd9a360aab231c369ccbf349f4385ba505c71","observation_id":"7b10cdd8-5ac1-4854-99cb-247968f4ab06","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.394881Z","title":null,"venue":null,"work_id":"68f71f97-9e4d-4959-8a3a-056ffc8df24f","year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:a2b24961eafc1c564c404d0d3456601fe9cc035502928b47a2033d2685b09c19","observation_id":"6f023501-bd6c-474c-b4ff-e2ec066ff998","resolution":{"observed_at":"2026-06-29T18:43:50.396272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9212.379015","doi":"10.1145/3779212.3790153","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dfvg: A heterogeneous architecture for speculative decoding with draft-on-fpga and verify-on-gpu,","venue":null,"work_id":"fd04ae54-1629-47b1-a185-8a49545493bd","year":2026},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:c860a2cccc233c78fb946c8ad3f980802db6f70d8a2eb601d8c7ce130cdda01c","observation_id":"15516d98-1865-4fab-a2ed-cd8b078188a6","resolution":{"observed_at":"2026-06-29T18:43:50.190089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.04275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:39:24.653945Z","title":"Disttrain: Addressing model and data heterogeneity with disaggregated training for multimodal large language models","venue":null,"work_id":"b7cc1521-f3d9-429c-b3d0-9382cdc90533","year":2024},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:c97836aa5a328b1ed91ce3e64cc43556f8a207493a6e8568c12b5b407e2a5b69","observation_id":"59ec43dd-82bd-4913-bf9b-5cbabce0c2c1","resolution":{"observed_at":"2026-06-29T18:43:50.411473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09844","last_updated":"2026-04-27T14:30:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T03:31:22Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","version":4},"cited_work":{"arxiv_id":"2504.09844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.09844","snapshot_observed_at":"2026-06-29T18:43:50.416409Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","venue":"cs.DC","work_id":"ab99a0bf-b674-441d-b0f6-77c86f72578e","year":2025},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2504.09844","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:9fe11c4fb2b7937e97b0074e0fd1794ae25116d20a7e39b40cf35fa63f5cab00","observation_id":"f7e61979-09bc-49e5-929c-4ecec8b13f75","resolution":{"observed_at":"2026-06-29T18:43:50.417700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:2b5a9dbfd45ed876a5657fe027df0c47d1399812e8fa0c9c223219feff60da18","observation_id":"63d514d6-95ec-44e9-aff1-b57c1caed6b8","resolution":{"observed_at":"2026-06-29T18:43:50.403974Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:42:09.591282Z","title":"language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:1c09ad7242fe0ebc436c69efbfdda98d14268a578fdedfce80be404fe9f97f7d","observation_id":"c3758176-ef30-45cb-8fdc-d6c5bffa8d47","resolution":{"observed_at":"2026-06-29T18:42:09.591282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":8,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2605.27678."}