{"as_of":"2026-08-20T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb319f820c1e4a53876a8bcf6be5fadf0f6ad7c925f33140eafdab7515d9bc9a","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:21:38.881968Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14374/citation-record","integrity":"/paper/2412.14374/integrity","json":"/paper/2412.14374/citation-record.json","paper":"/paper/2412.14374"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.339328Z","title":"URL https://www.top500.org/system/180239","venue":null,"work_id":"579b37ce-88c9-4fc3-8912-45b1e8990d3b","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.800001Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:a730b5ddf2dddc82583061d3100f307bae46426ede9e83ed12e19bae739ba6f5","observation_id":"cca14982-b4a1-4f08-983e-2a7c1e0bf6ca","resolution":{"observed_at":"2026-08-11T12:21:39.343082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11202","last_updated":"2024-11-24T12:56:57Z","snapshot_observed_at":"2026-08-16T14:25:57.102865Z","submitted_at":"2024-01-20T10:30:31Z","title":"PartIR: Composing SPMD Partitioning Strategies for Machine Learning","version":4},"cited_work":{"arxiv_id":"2401.11202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.11202","snapshot_observed_at":"2026-08-11T12:21:39.235244Z","title":"PartIR: Composing SPMD Partitioning Strategies for Machine Learning","venue":"cs.LG","work_id":"ec1e508f-222f-49cf-a6c5-47bb572c85cc","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.803149Z"},"links":{"cited_paper":"/paper/2401.11202","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:bdccbf0a919eb6f3167fe8ea55282f9303c3afb2b96001afc2b6b2be9d4c7221","observation_id":"2b7404cb-0d72-4344-9513-d0b078a2de96","resolution":{"observed_at":"2026-08-11T12:21:39.241140Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.332638Z","title":"E., Thekkath, C","venue":null,"work_id":"56bc078a-65c5-4fa8-930a-06e70b8e388d","year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.806478Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:0bc709d093cb46cd53c76f77bf26ab141f1a394da18dc5ca9c0dbc86633555f1","observation_id":"583b702d-4480-4e21-b82d-241700fc0f2d","resolution":{"observed_at":"2026-08-11T12:21:39.335359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.324495Z","title":"J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., VanderPlas, J., Wanderman-Milne , S., and Zhang, Q","venue":null,"work_id":"aa25f8da-0c86-40be-ac49-216955fdbd07","year":2018},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.809473Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:531251fffc2e6285508b30dcff00e770137a139487090e582ae4996187046fee","observation_id":"169ba462-9729-485e-9869-e24430089a78","resolution":{"observed_at":"2026-08-11T12:21:39.327203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.316019Z","title":null,"venue":null,"work_id":"393be2c6-bd52-4682-80b5-215cd5199d5d","year":1901},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.811689Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:cba9c721dff2a3fc3e15b756221b80a3ebd308d259cd28b799e2f3e4f5a0a0fe","observation_id":"6bd4f832-9cf5-4502-b5ba-978ad4580e4f","resolution":{"observed_at":"2026-08-11T12:21:39.318466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-11T12:21:38.814422Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.814422Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:f86a382541d78376a10aa57729c757ed01d57bef6bd676d00bc9ea08ffdb1937","observation_id":"50454ee1-f96d-4d8b-8d0a-553ed39ff100","resolution":{"observed_at":"2026-08-11T12:21:38.814422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1410.0759","last_updated":"2014-12-18T01:13:16Z","snapshot_observed_at":"2026-08-14T23:17:07.466378Z","submitted_at":"2014-10-03T06:16:43Z","title":"cuDNN: Efficient Primitives for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.0759","snapshot_observed_at":"2026-08-11T12:21:38.817499Z","title":"cudnn: Efficient primitives for deep learning, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.817499Z"},"links":{"cited_paper":"/paper/1410.0759","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:4edc75063847de31ef2c7325bc7a19c183bfd8176957f0a231024e7a1c412763","observation_id":"521085b4-422a-4ef0-b961-4f06d2a84a86","resolution":{"observed_at":"2026-08-11T12:21:38.817499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-11T12:21:38.820248Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.820248Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:f9d8a6f7df1ff4f67db75e45bffc6d8fc57c70a3bb78e4d8d911fb0f96637fe9","observation_id":"cfe67fb1-a97d-430e-a0da-89b941f13668","resolution":{"observed_at":"2026-08-11T12:21:38.820248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.308993Z","title":"An Image is Worth 16x16 Words : Transformers for Image Recognition at Scale","venue":null,"work_id":"76725f04-1481-4488-8d97-ebebf58fdf40","year":2021},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.823696Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:25d7f8d3c1fe055e88da41d3144bcdc5e527d2d796899569f03ac8e951a2521e","observation_id":"f474a3f4-9cc6-4e65-9e4b-e784cdc0c0dd","resolution":{"observed_at":"2026-08-11T12:21:39.311729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T12:21:38.826145Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.826145Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:0c340addd2982b16a13e8b0121f5ea7d5f21d6a7f6379840dd2bcdd2a6a3815f","observation_id":"eee7ab37-6dc2-4689-a7e0-0f1f5b09b8e3","resolution":{"observed_at":"2026-08-11T12:21:38.826145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-11T12:21:38.829004Z","title":"Switch Transformers : Scaling to Trillion Parameter Models with Simple and Efficient Sparsity , June 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.829004Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:c766baa87fbdf2fa564e3246e41b6e2ff76092ea0f0b4e00652145c80b46de5b","observation_id":"6e0a0107-32a3-4dbc-9bdf-94719833b9ae","resolution":{"observed_at":"2026-08-11T12:21:38.829004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.302288Z","title":"NeMo: a toolkit for Conversational AI and Large Language Models","venue":null,"work_id":"07e76713-a46b-4625-a186-fd0d384f2249","year":null},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.831819Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:b564eaa6408fef609458d9889e74c68242555f34fd23cd10d512a36de7672383","observation_id":"2b855f9a-56f2-4370-b895-1f31fc336153","resolution":{"observed_at":"2026-08-11T12:21:39.304871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06489","last_updated":"2020-09-21T22:58:12Z","snapshot_observed_at":"2026-08-16T16:47:32.562563Z","submitted_at":"2020-09-14T14:49:10Z","title":"The Hardware Lottery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06489","snapshot_observed_at":"2026-08-11T12:21:38.834591Z","title":"The Hardware Lottery , September 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.834591Z"},"links":{"cited_paper":"/paper/2009.06489","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:6222722c48bac90b589eff9fd06b67e70f516eae30671ac0dfa126430d0134cd","observation_id":"ce303d1b-1216-4043-960c-62ef0b257403","resolution":{"observed_at":"2026-08-11T12:21:38.834591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.294733Z","title":"DISTMM : Accelerating distributed multimodal model training","venue":null,"work_id":"fdf1c250-c9ff-4dd8-afd5-3851d667290e","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.837340Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:4151fe37824e47a4aaf11516b8dfb62ff0c3e408841881c082a98d99fa363794","observation_id":"16c969e5-03c0-4f46-a657-3984bd7abf54","resolution":{"observed_at":"2026-08-11T12:21:39.297798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.288493Z","title":"X., Lee, H., Ngiam, J., Le, Q","venue":null,"work_id":"037f474a-12cc-43ec-aa54-dff7f689fe08","year":2019},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.840111Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:2f4a67280280d03b88ac9400f37cf3b05dde2f7f33cffcdc8508c9c6660f9ad0","observation_id":"e11d4ac1-9a8f-4e44-a1eb-fa043afc8243","resolution":{"observed_at":"2026-08-11T12:21:39.290838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.281255Z","title":"Megascale: Scaling large language model training to more than 10,000 gpus","venue":null,"work_id":"0d539e24-86bc-40e4-ab8f-c39146087984","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.842540Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:27c9d5d243aa525c9fd7454b0ec4101830715e37d7015e63bdb87ad0e96e0f43","observation_id":"da6ae688-feb0-4673-833b-5932ec6ad8a1","resolution":{"observed_at":"2026-08-11T12:21:39.283713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05953","last_updated":"2023-07-06T19:03:41Z","snapshot_observed_at":"2026-08-16T16:17:02.058327Z","submitted_at":"2022-11-11T02:00:32Z","title":"Breadth-First Pipeline Parallelism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05953","snapshot_observed_at":"2026-08-11T12:21:38.844910Z","title":"Breadth- First Pipeline Parallelism , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.844910Z"},"links":{"cited_paper":"/paper/2211.05953","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:68cdea0c1c744983c939f73c7a57773d2243eb28db15f046d71ddafe22a113cc","observation_id":"d633020d-f208-47aa-bfcf-919c4a64c8ca","resolution":{"observed_at":"2026-08-11T12:21:38.844910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:38.847921Z","title":"Mlir: Scaling compiler infrastructure for domain specific computation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.847921Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:8ac81a98ac69e3d632f283efce0d3a5055243a173f307e1bfc36ac6ccfac2602","observation_id":"25aee9dc-f7e2-40fd-aa0f-a5b604a316ee","resolution":{"observed_at":"2026-08-11T12:21:38.847921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-11T12:21:38.850831Z","title":"GShard : Scaling Giant Models with Conditional Computation and Automatic Sharding , June 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.850831Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:3554c9d3cd749adc9a76be4579a0045d7a3010013344cee978641430665636fb","observation_id":"2b3b2526-6801-492d-8f4f-685660219c67","resolution":{"observed_at":"2026-08-11T12:21:38.850831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-20T01:25:00.721226Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-11T12:21:38.853492Z","title":"Torchtitan: One-stop pytorch native solution for production ready llm pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.853492Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:cb62d4abade2d6aa0939364e857ed50c5e322da8ade9c276b0e50a19351d935c","observation_id":"7e5b2747-743f-40fd-b377-275a8e5b7bb4","resolution":{"observed_at":"2026-08-11T12:21:38.853492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.272911Z","title":"nnScaler : Constraint-Guided parallelization plan generation for deep learning training","venue":null,"work_id":"a2e100dc-cc6d-4927-b8e5-97d9c6941e28","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.855609Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:34aa2853520987a614d2e737075fa4d7b7f07f143e5e358f37f57ac54fec9200","observation_id":"05d3bdda-1b07-48be-be7b-1baa835d2375","resolution":{"observed_at":"2026-08-11T12:21:39.275275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.265932Z","title":"I., and Stoica, I","venue":null,"work_id":"81a8d615-9973-464d-8a74-247aa045fc8d","year":2018},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.857809Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:aecd538237e212cafe25345a301e555b8edcde3e48931be6d2f591fb5b347f41","observation_id":"69ef8b5f-b024-4bc5-97b8-d9d8565df6c8","resolution":{"observed_at":"2026-08-11T12:21:39.268253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:38.859640Z","title":"R., Ganger, G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.859640Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:380d7287a80d1e0d085d277881b6283e72e9eab38c854f9fff19d021dff774ed","observation_id":"415839ce-169e-4de3-ac1a-a2e0c9f7c9b5","resolution":{"observed_at":"2026-08-11T12:21:38.859640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:38.861312Z","title":"Efficient large-scale language model training on GPU clusters using megatron- LM","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.861312Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:5743fee3dba3e61796cb1ecb248bf646c6058b969d097b120549b6fd9b7ec7e3","observation_id":"506b34d0-76bc-43cb-9d32-bd63359d76c2","resolution":{"observed_at":"2026-08-11T12:21:38.861312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-16T16:17:24.089886Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-11T12:21:38.863523Z","title":"Efficiently Scaling Transformer Inference , November 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.863523Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:1149d578b59d1af096c306f1665645407a139454de9c6aef05e0f4914cd13465","observation_id":"7e71a091-1a37-45d6-80f0-d925ea1e9ac6","resolution":{"observed_at":"2026-08-11T12:21:38.863523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.258444Z","title":"Zero bubble (almost) pipeline parallelism","venue":null,"work_id":"50286e3e-66a7-47ba-8ab6-099151f41431","year":2024},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.865394Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:10565bc0e753750b6780ed07fbe81b428c822b589be33c2a8d660165431da4a3","observation_id":"23434b05-17ef-4201-a699-71dc0ea260c2","resolution":{"observed_at":"2026-08-11T12:21:39.261101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:38.867300Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.867300Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:db9e8ea5ca8899e01ff2931e0143079bde0cc1773eea166d344e4123df556e37","observation_id":"b2250dfa-f9ba-4c79-b19d-84aa37f179a4","resolution":{"observed_at":"2026-08-11T12:21:38.867300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T12:21:38.871089Z","title":"Megatron- LM : Training Multi-Billion Parameter Language Models Using Model Parallelism , March 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.871089Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:922ec1401f6706b60b2604ee8835262bedeb02a6b5ce796ea3189125e1fceefb","observation_id":"0d66b898-5d83-450e-a330-79555137b4ee","resolution":{"observed_at":"2026-08-11T12:21:38.871089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-09T17:07:26.804289Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-11T12:21:38.873748Z","title":"Y., Bernauer, J., Song, X., Shoeybi, M., He, Y., Houston, M., Tiwary, S., and Catanzaro, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.873748Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:ba82d841e52bd7b559ad6ebc58f4669060c105784f1a3b1f054d5b0e3abcd468","observation_id":"35c41776-aef2-47f9-b8e2-de1b42291142","resolution":{"observed_at":"2026-08-11T12:21:38.873748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T12:21:38.875932Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.875932Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:2562bb06ef8853d1353fb8c11fb3ae79a71231a9ff93ab10dba38bb918010e70","observation_id":"84b218d4-88fd-44d4-bd43-7e7d3c8c1b09","resolution":{"observed_at":"2026-08-11T12:21:38.875932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-08-19T16:35:52.969358Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-11T12:21:38.877852Z","title":"GSPMD : General and Scalable Parallelization for ML Computation Graphs , December 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.877852Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:ac4fdc84c02f890392d5e0f573438f1c3459157adb3f9a4295c44082f4ca8993","observation_id":"7a1aa935-be64-4cc3-a3ad-1ded6930fefc","resolution":{"observed_at":"2026-08-11T12:21:38.877852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:39.251722Z","title":"P., Gonzalez, J","venue":null,"work_id":"e09b9c81-064a-4518-8cdb-132c5ce89b37","year":2022},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.880211Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:92d90a74b75f035ac0fbf822c5347dd79f9a18081744db2dad3b18da4f4b33b3","observation_id":"19f5bb7c-b741-4659-8308-a0c83c856c75","resolution":{"observed_at":"2026-08-11T12:21:39.254328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:21:38.881968Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:21:38.881968Z"},"links":{"citing_paper":"/paper/2412.14374"},"observation_digest":"sha256:6da4fb34cfba5446ecd7297d979cafbfa7e96c72ffdb76548d1ab01ca945d0f0","observation_id":"a8926a3b-9286-4308-9bc3-b35537842853","resolution":{"observed_at":"2026-08-11T12:21:38.881968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14374","last_updated":"2024-12-18T22:15:11Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-15T07:35:31.387494Z","submitted_at":"2024-12-18T22:15:11Z","title":"Scaling Deep Learning Training with MPMD Pipeline Parallelism"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2412.14374."}