Pith. sign in

Paper Citation Record · LEDGER

Heterogeneous Parallelism for Multimodal Large Language Model Training

As of 5 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2605.27678.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.27678 v1

Coverage vector

measured 23 of 23 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T18:42:09.591282Z

measured 23 of 23 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

23 of 23 outbound references displayed

  • verified exact12
  • verified fuzzy0
  • unresolved8
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 37afc617-2f4a-4cc3-b942-e946c76673ae · outbound

This paper cites Chiang, Z.

Heterogeneous Parallelism for Multimodal Large Language Model Training Chiang, Z

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:21ad3f487fbd23998009708e88749de969fca099f6c0ba872ac8aac213f4a6c3

Observation b466a14f-5a54-4f85-a123-fc09a5a382e7 · outbound

This paper cites Using Cornstarch 5d parallelism.https://cornstarch-org.github.io/ parallelization/cornstarch_parallel/, 2025.

Heterogeneous Parallelism for Multimodal Large Language Model Training Using Cornstarch 5d parallelism.https://cornstarch-org.github.io/ parallelization/cornstarch_parallel/, 2025

Reference 2

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:798c549019c81967607c89c131025258125d7fcf73db1fdc8f273afdcf818188

Observation 835a55c5-6677-4da3-8d02-6c760d47a817 · outbound

This paper cites an unresolved cited work.

Heterogeneous Parallelism for Multimodal Large Language Model Training Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:caf60eeb9510c003e0491a93023201f85bba7521117defe521a272f503f15dab

Observation dbd5eeaf-f463-4c91-a67a-0f1e61aace7b · outbound

This paper cites Huang, Z.

Heterogeneous Parallelism for Multimodal Large Language Model Training Huang, Z

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:db5c51fb33709e05b655eb458282dbaf86cc8a6f489c3ddd58bb332455ff7d69

Observation bd706786-a3c5-4442-9be2-0de0d60f110f · outbound

This paper cites an unresolved cited work.

Heterogeneous Parallelism for Multimodal Large Language Model Training Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:be348205a74d2e8172dd99d3186e4fd76a6229659c5130e18fee546bc6ae0cdd

Observation 602a3a2e-ac59-43c7-a30e-31c746f92d97 · outbound

This paper cites Efficient Distributed MLLM Training with Cornstarch.

Heterogeneous Parallelism for Multimodal Large Language Model Training Efficient Distributed MLLM Training with Cornstarch

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.404654Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:f5292bf6975e7bd617ccc095a76a20e6399436a373b8c1c4c53d07260e97d004

Observation 5fe3c342-442d-4adf-9c38-cc2c6e1448e5 · outbound

This paper cites GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism.

Heterogeneous Parallelism for Multimodal Large Language Model Training GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.399012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:e743a9d2ae74c41a4c9bb1781e771c4c7f8a06b1d6a02eefe0a02c45924843a3

Observation 49192dec-bb94-41df-af56-6e74e88f3818 · outbound

This paper cites DCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context Parallelism , url=.

Heterogeneous Parallelism for Multimodal Large Language Model Training DCP: Addressing Input Dynamism In Long-Context Training via Dynamic Context Parallelism , url=

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T18:43:50.190743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:5b4cde9b5c466455993f1355575f624229b72a9c4776d8475f8873daf84a22dd

Observation a0a73dd6-7e11-44b1-bf68-2f434cd09e32 · outbound

This paper cites an unresolved cited work.

Heterogeneous Parallelism for Multimodal Large Language Model Training Unresolved cited work

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.414857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:7164e53a03db170c070c9fe7f1a3d2e54fd3060283208101995dc83f30949d47

Observation 18dd1c7d-1d54-4fb3-b41d-d0ad1f22525a · outbound

This paper cites Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM.

Heterogeneous Parallelism for Multimodal Large Language Model Training Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.412459Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:01b77dfa7c62ef0bf06f6c4ca3baf093998070e1d259a39e8edae37c4b91d025

Observation 9c284704-0d17-4296-b8e5-f12cb6ab10f6 · outbound

This paper cites Efficient Scaling of LLM Training with Flexible Context Parallelism.

Heterogeneous Parallelism for Multimodal Large Language Model Training Efficient Scaling of LLM Training with Flexible Context Parallelism

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.408967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:589d0072f34378d8ee959ad007b61eb4fe978263beb32eee3bb148f3521e3871

Observation 016ac0a1-b5d2-49a4-bcd4-eeb4077c09ee · outbound

This paper cites Radford, J.

Heterogeneous Parallelism for Multimodal Large Language Model Training Radford, J

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:3123498a3ee435b18e3f84c2e24e3941531d504040ae5343efbe17b1374f8e54

Observation eabf0c20-599f-4976-baae-a1fa4f4e07f8 · outbound

This paper cites ZeRO: Memory Optimizations Toward Training Trillion Parameter Models.

Heterogeneous Parallelism for Multimodal Large Language Model Training ZeRO: Memory Optimizations Toward Training Trillion Parameter Models

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.409788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:1daac0ce317052c5c745b2ef2e09ab63b5c84d1f6377fa84348b8468e782a56c

Observation f328d04f-1a59-481b-87cc-bf24da721425 · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

Heterogeneous Parallelism for Multimodal Large Language Model Training Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.417019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:42f967a35450381cd313785aab31f50b642a2ee2f107a042e5f44bef30dbbda8

Observation 16bc8f80-e4bd-46ec-bb85-73c17165dfd3 · outbound

This paper cites Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model.

Heterogeneous Parallelism for Multimodal Large Language Model Training Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.407336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:ba30597b4f6ee62a8ea54861c5dd04634d24847a851974c27ee977b582f08688

Observation 8ae92075-ed80-43b8-944a-6720f4976e71 · outbound

This paper cites FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism.

Heterogeneous Parallelism for Multimodal Large Language Model Training FlexSP: Accelerating Large Language Model Training via Flexible Sequence Parallelism

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.391035Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:8f2ad595996b728115c48b12228bc8aa2ba610e5232f2823a5e9a704dac001db

Observation 7b10cdd8-5ac1-4854-99cb-247968f4ab06 · outbound

This paper cites an unresolved cited work.

Heterogeneous Parallelism for Multimodal Large Language Model Training Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:1f4128980efcc45df103afa7995cd9a360aab231c369ccbf349f4385ba505c71

Observation 6f023501-bd6c-474c-b4ff-e2ec066ff998 · outbound

This paper cites an unresolved cited work.

Heterogeneous Parallelism for Multimodal Large Language Model Training Unresolved cited work

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.396272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:a2b24961eafc1c564c404d0d3456601fe9cc035502928b47a2033d2685b09c19

Observation 15516d98-1865-4fab-a2ed-cd8b078188a6 · outbound

This paper cites Dfvg: A heterogeneous architecture for speculative decoding with draft-on-fpga and verify-on-gpu,.

Heterogeneous Parallelism for Multimodal Large Language Model Training Dfvg: A heterogeneous architecture for speculative decoding with draft-on-fpga and verify-on-gpu,

Reference 19

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T18:43:50.190089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:c860a2cccc233c78fb946c8ad3f980802db6f70d8a2eb601d8c7ce130cdda01c

Observation 59ec43dd-82bd-4913-bf9b-5cbabce0c2c1 · outbound

This paper cites Disttrain: Addressing model and data heterogeneity with disaggregated training for multimodal large language models.

Heterogeneous Parallelism for Multimodal Large Language Model Training Disttrain: Addressing model and data heterogeneity with disaggregated training for multimodal large language models

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:43:50.411473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:c97836aa5a328b1ed91ce3e64cc43556f8a207493a6e8568c12b5b407e2a5b69

Observation f7e61979-09bc-49e5-929c-4ecec8b13f75 · outbound

This paper cites MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training.

Heterogeneous Parallelism for Multimodal Large Language Model Training MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-06-29T18:43:50.417700Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:9fe11c4fb2b7937e97b0074e0fd1794ae25116d20a7e39b40cf35fa63f5cab00

Observation 63d514d6-95ec-44e9-aff1-b57c1caed6b8 · outbound

This paper cites PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel.

Heterogeneous Parallelism for Multimodal Large Language Model Training PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel

Reference 22

Resolution
malformed identifier
local_arxiv, observed 2026-06-29T18:43:50.403974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:2b5a9dbfd45ed876a5657fe027df0c47d1399812e8fa0c9c223219feff60da18

Observation c3758176-ef30-45cb-8fdc-d6c5bffa8d47 · outbound

This paper cites language.

Heterogeneous Parallelism for Multimodal Large Language Model Training language

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-29T18:42:09.591282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-29T18:42:09.591282Z digest=sha256:1c09ad7242fe0ebc436c69efbfdda98d14268a578fdedfce80be404fe9f97f7d

Pith citing papers

No inbound Pith citation observations are available.