{"as_of":"2026-08-08T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc24ffbd67fb1086b88b38d5110c6d4a835a83bf25fb2b6f804f9fa964d8ccdd","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:28.228455Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22175/citation-record","integrity":"/paper/2506.22175/integrity","json":"/paper/2506.22175/citation-record.json","paper":"/paper/2506.22175"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.690500Z","title":"On the optimization of deep networks: Implicit acceleration by overparameterization,","venue":null,"work_id":"e379cc7b-d98d-4087-b45e-16ef734ddd8e","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.501953Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:059c2a963f0280192cd6fc9e0a3a25d3f842b21db4bbdfcf48329e7730526a76","observation_id":"80e302e1-70b3-48e4-9fb2-efa3d16c2011","resolution":{"observed_at":"2026-08-06T22:15:32.788377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.441884Z","title":"Exploring the limits of weakly supervised pretraining,","venue":null,"work_id":"beea2488-f498-4ec5-9140-521bfa710a3c","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.611239Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:7e4792c551c77a646588b44d9cd235076f27c52b9b6a492e4c9f02e82713a3e7","observation_id":"da7e2b1f-e19f-4471-8b74-013bcc6e3fac","resolution":{"observed_at":"2026-08-06T22:15:32.565005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.226499Z","title":"Antman: Dynamic scaling on gpu clusters for deep learning,","venue":null,"work_id":"79a1f7b9-4429-4fa5-8298-fadd1b7bfff9","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.755050Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:755f9e562aee061a59ee3e3b4ed68400fea1fb1dcfb7b0f56ca6f03c3a3a7c95","observation_id":"c0832550-adb5-4c73-999e-1b1107862a00","resolution":{"observed_at":"2026-08-06T22:15:32.311875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:32.017472Z","title":"Whale: Efficient giant model training over heterogeneous gpus,","venue":null,"work_id":"180c00ac-949b-412e-ae79-577357f29e0b","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:25.901684Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:e888772928367eb8b8fe55b27dd0d1d9719dccd109d8a6fee6584bb235b809a0","observation_id":"b4e4428f-2f87-4a99-a327-3399924419b9","resolution":{"observed_at":"2026-08-06T22:15:32.114853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.729947Z","title":"Axonn: An asynchronous, message-driven parallel framework for extreme-scale deep learning,","venue":null,"work_id":"09c12d9b-80b2-4c81-991f-271a87d69765","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.037612Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:df164e00e7086e325f0137bf9cf1e990daefd01bf13d2568531c9bb6c797c4bc","observation_id":"4a45c5aa-fed0-4ad2-903a-aa8ea74b4ac7","resolution":{"observed_at":"2026-08-06T22:15:31.870218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.612514Z","title":"An efficient and non-intrusive gpu schedul- ing framework for deep learning training systems,","venue":null,"work_id":"c873d53a-1b10-4ac3-b55c-d747bfbfcfd2","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.141093Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:2ed2919dd9b8b92a401a9dde52dbf335c620fe1072a67fbd2ac9353efff0b3d9","observation_id":"202fd7a0-346f-4d78-b43d-6d7a2e0321a8","resolution":{"observed_at":"2026-08-06T22:15:31.651693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.437211Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"2e6db439-d90d-494e-bdbe-ce1a95f98604","year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.269023Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:1d26ca4ad77343f3cd34dbfa776057a4ef5fb4318575e371dcd65e753b8f1bed","observation_id":"f4fe10b9-0f1b-4450-9e60-b23b2571da6f","resolution":{"observed_at":"2026-08-06T22:15:31.543830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T22:15:26.398427Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.398427Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:8d6a4896d81860ea091371b6d47dcb4d2b03c0aaf2bb95d2402a7d74b55adda5","observation_id":"ace6e3a0-ef11-45f4-a95e-78859d2aefd2","resolution":{"observed_at":"2026-08-06T22:15:26.398427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.293550Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"29a70c3b-c078-4269-b1aa-c18a3dbfd02a","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.502541Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:fdeb49a8a285171d938d74e5d209ef96887a4a92b97c0f621085b4b7d206c7cb","observation_id":"5ea1faec-ca1e-4b18-8d4d-900f39b7ebea","resolution":{"observed_at":"2026-08-06T22:15:31.337050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:26.600395Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.600395Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:f1dd29b514b8fcd9ad57d05350cdac082c0675e3bf2416feb53fa0f842e1eb66","observation_id":"c0368665-aa1a-4d71-a103-10d3923d409e","resolution":{"observed_at":"2026-08-06T22:15:26.600395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07837","last_updated":"2022-04-24T12:51:35Z","snapshot_observed_at":"2026-07-06T13:00:57.257337Z","submitted_at":"2022-04-16T16:19:47Z","title":"BLISS: Robust Sequence-to-Sequence Learning via Self-Supervised Input Representation","version":2},"cited_work":{"arxiv_id":"2204.07837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.07837","snapshot_observed_at":"2026-08-06T22:15:28.611786Z","title":"BLISS: Robust Sequence-to-Sequence Learning via Self-Supervised Input Representation","venue":"cs.CL","work_id":"bf7130e3-d3aa-4671-8a38-fb32f5dfd2b6","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.715460Z"},"links":{"cited_paper":"/paper/2204.07837","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:59c39fb2f46cd8f967f22414695b46fefc79dc47e45161a9884960a5630b5b0f","observation_id":"9e9724b0-cf24-495c-a834-667601713bd7","resolution":{"observed_at":"2026-08-06T22:15:28.679030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14912","last_updated":"2024-01-09T09:44:10Z","snapshot_observed_at":"2026-07-06T13:15:17.438229Z","submitted_at":"2022-05-30T08:25:36Z","title":"E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2205.14912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14912","snapshot_observed_at":"2026-08-06T22:15:28.478666Z","title":"E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation","venue":"cs.CL","work_id":"f098466c-9b72-4137-852a-85f262bea1e2","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.817024Z"},"links":{"cited_paper":"/paper/2205.14912","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:08d8891bebcb2120bad921353f0f162e5c0a63a57d4cc72accf5d5eee29362c6","observation_id":"9129e399-e0bb-4626-8d95-36dbff9f54fe","resolution":{"observed_at":"2026-08-06T22:15:28.537261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:31.108581Z","title":"Unsu- pervised cross-lingual representation learning at scale,","venue":null,"work_id":"05833904-d690-43e1-953e-2e4430af2ad8","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.871985Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:4bcf12afbb5db564003d0e4c19e2e36f3054cb65ac6be3189fff5ee7bcf79a2e","observation_id":"a588efc2-b4fd-4dd4-8bdc-8dc75e06d433","resolution":{"observed_at":"2026-08-06T22:15:31.199126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01853","last_updated":"2022-12-04T15:36:18Z","snapshot_observed_at":"2026-08-08T01:58:19.747610Z","submitted_at":"2022-12-04T15:36:18Z","title":"Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01853","snapshot_observed_at":"2026-08-06T22:15:26.922616Z","title":"Toward efficient language model pretraining and downstream adaptation via self-evolution: A case study on superglue,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.922616Z"},"links":{"cited_paper":"/paper/2212.01853","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:4879dd54d1ef573ca4e174aeaaaf2535911514479c9ddc4513655c94acbd5dbb","observation_id":"c51cf98b-e571-425f-bbf9-cb073dfb0325","resolution":{"observed_at":"2026-08-06T22:15:26.922616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T22:15:26.970238Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:26.970238Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:de397c69606d012dbc905d78271f2f5fe4d9118d015368b3f948715c2c0037d5","observation_id":"45b1a33d-616a-487a-bccb-fb8ccd773284","resolution":{"observed_at":"2026-08-06T22:15:26.970238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-06T22:15:27.043950Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.043950Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:9d6c9ea6e5e1556783e587bbdf7be585137681b4a2ef3b88c58260b56ab2b651","observation_id":"1e365e47-038f-4936-851c-975894fcde0d","resolution":{"observed_at":"2026-08-06T22:15:27.043950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.850879Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":"7f6469cb-7e9f-463c-8847-7fa84f7aefee","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.110599Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:38935fd9384a7817ab0cc5d25091f84952d8f957348b0ca356d71171b14c0432","observation_id":"25121131-c2c5-4c52-98d2-7cfd717c1894","resolution":{"observed_at":"2026-08-06T22:15:30.997680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05528","last_updated":"2023-05-31T09:27:56Z","snapshot_observed_at":"2026-07-06T14:16:40.674342Z","submitted_at":"2022-11-10T12:42:43Z","title":"PAD-Net: An Efficient Framework for Dynamic Networks","version":4},"cited_work":{"arxiv_id":"2211.05528","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.05528","snapshot_observed_at":"2026-08-06T22:15:28.360067Z","title":"PAD-Net: An Efficient Framework for Dynamic Networks","venue":"cs.LG","work_id":"187efe54-9ca7-452a-8933-7f8e8bc4b80a","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.198838Z"},"links":{"cited_paper":"/paper/2211.05528","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:a2801027fdeb5c6b953d65b54ec8eaa62a88520601456d692134a250b1d0b62b","observation_id":"52d7527b-358b-4360-af2c-cbe2b11d13a6","resolution":{"observed_at":"2026-08-06T22:15:28.401357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.618509Z","title":"Base layers: Simplifying training of large, sparse models,","venue":null,"work_id":"e42d5bc6-9cf4-42ad-9f7b-ffc666f0b847","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.260718Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:0ef31332ef5b7021278c4e94a851ead5721df49e72f078918caaa2a161509cf1","observation_id":"d1ab2883-4be9-4ebd-8bcc-18f2bfd914b5","resolution":{"observed_at":"2026-08-06T22:15:30.739187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.379291Z","title":"Gating dropout: Communication-efficient regularization for sparsely activated transform- ers,","venue":null,"work_id":"92ff99a6-4add-45c7-a3bc-40ac22a7c754","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.323226Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:0789360b8678a835794ee4712cdd801ab60454b30d08b12876ace4bda139ea33","observation_id":"81121fdc-711e-4918-8173-af010a61e654","resolution":{"observed_at":"2026-08-06T22:15:30.504450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:30.130248Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation AI scale,","venue":null,"work_id":"5ec32c16-7920-41ef-aabe-4e66ed46099b","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.397140Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:fed782b883ffb6914dff31868de2e4ed13ad71b38cf7cb24c7b02194d89b0fc8","observation_id":"f5762c01-f99e-42bd-903b-cb895bac91df","resolution":{"observed_at":"2026-08-06T22:15:30.256375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.921414Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models,","venue":null,"work_id":"b2338310-f0b2-4664-83b3-58a84724d837","year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.451658Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:b200d616ac0cccde80271d49a399cc09638fa98fdc03b17179401f41a15fb09e","observation_id":"10ad3246-ce10-4f75-8cf0-b201c7eae5b4","resolution":{"observed_at":"2026-08-06T22:15:30.040462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.711776Z","title":"Scalable distributed dl training: Batching communication and computation,","venue":null,"work_id":"452c7e46-0d38-41b1-8499-56da71fd3c05","year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.495731Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:22745eada7f47d57f0e48e342a8b10cf77062609e9b2bf130e1d35b150f89b53","observation_id":"da501c63-0f1f-4977-a420-cf8acc594f93","resolution":{"observed_at":"2026-08-06T22:15:29.822345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.405587Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":"4b8dce19-0c00-47ec-ac6d-317a3429a413","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.557041Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:487c75526ea4b3b4e444493fee24449000a948b0d481b6519a9a8702b56a7a44","observation_id":"77bc7860-4971-447f-867d-c7965f20e622","resolution":{"observed_at":"2026-08-06T22:15:29.593956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-07-06T11:50:05.714539Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-06T22:15:27.618354Z","title":"Scalable and effi- cient moe training for multitask multilingual models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.618354Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:448ff7dc36d522bbc714cb05120f1ee97727d8317f2f2a954a806779f211f5d4","observation_id":"89d2c24a-c7ce-4c6e-b494-0c6e08c1f0db","resolution":{"observed_at":"2026-08-06T22:15:27.618354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-06T22:15:27.666690Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.666690Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:fc4848c8e86cb5b56c7a13593a2ec3ad44af55fafb7d584c0e3a3d81cd833629","observation_id":"e3157efc-d1e2-4f18-928f-81e7d59f0558","resolution":{"observed_at":"2026-08-06T22:15:27.666690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.118385Z","title":"vdnn: Virtualized deep neural networks for scalable, memory-efficient neural network design,","venue":null,"work_id":"652d1202-309d-4db9-b209-1465e909c6a2","year":2016},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.733735Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:db549111cb0307416ffe48484fde9ae3489b154ba9e1de7b11eeffee70ade05d","observation_id":"61131dc7-3ae8-4b15-b543-4815bf7e6cda","resolution":{"observed_at":"2026-08-06T22:15:29.248516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:29.003418Z","title":"Buddy compression: Enabling larger memory for deep learning and hpc workloads on gpus,","venue":null,"work_id":"14fb683e-0c7b-4bd7-a603-10cae21004db","year":2020},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.805975Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:94d6f373c0fd54b7fd91e86351d5d061b82353058992b74986eca8304ec43249","observation_id":"954749e8-cf15-4840-8bcd-07b8fddcad2b","resolution":{"observed_at":"2026-08-06T22:15:29.046713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:28.878864Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":"288c267c-e064-447b-85c0-f033be1135da","year":2021},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.873864Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:7fb2b3d0ff725c2071e6c779b3aaa5977170d9b4187d29852452f76de0274aff","observation_id":"0637980d-29df-4b1c-b823-c91db9e0624f","resolution":{"observed_at":"2026-08-06T22:15:28.945997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:27.918794Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.918794Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:2ad76c7be112f953828b3f0b6f7984b4fde0d5aed3d6d31738e7ec5219aeffc3","observation_id":"5f77f9e4-68da-46a4-9a5b-fe15d0db598c","resolution":{"observed_at":"2026-08-06T22:15:27.918794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:27.975062Z","title":"Gpipe: Efficient training of giant neu- ral networks using pipeline parallelism,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:27.975062Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:cba7fd7db1ac20e06876c6775b8ac048b98eea92a828b6ba6bb81bdf3931e289","observation_id":"1df6a646-9d37-49d9-94b6-61dbb4a70cfb","resolution":{"observed_at":"2026-08-06T22:15:27.975062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-08-06T17:50:04.734688Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-08-06T22:15:28.050477Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.050477Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:68d0d15c6a1d84bee2d34b913ba336f3708118b99a6cf1719bbecce2cc1a2d22","observation_id":"cc6a1c04-8cc7-41c1-9dfd-bd462064a2e0","resolution":{"observed_at":"2026-08-06T22:15:28.050477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:28.763639Z","title":"Mesh-tensorflow: Deep learning for supercomputers,","venue":null,"work_id":"62b80f2d-ce57-49c5-9299-461523159765","year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.110425Z"},"links":{"citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:b0eb6f4d005ed1487d4f8e203c2458b4dba2d5b4ee491d5f3771e806aa7418e1","observation_id":"74773f93-26a2-4e1a-bccc-250a63346df8","resolution":{"observed_at":"2026-08-06T22:15:28.801078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:15:28.158421Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.158421Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:468038a9b09dc15191edc410467a6d962d5a5e3eee0820bae398cc128f86069e","observation_id":"0cc0be77-5179-45f1-b922-db552ce61723","resolution":{"observed_at":"2026-08-06T22:15:28.158421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-02T18:12:03.258298Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-06T22:15:28.228455Z","title":"Pipedream: Fast and efficient pipeline parallel dnn training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:28.228455Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2506.22175"},"observation_digest":"sha256:a9371ebe7548f37ba23ece6be7855206bf6b1df1b8c52b86fee37fc4defc4a23","observation_id":"fcc388e8-10f4-48cc-a89d-78c841b56b78","resolution":{"observed_at":"2026-08-06T22:15:28.228455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22175","last_updated":"2025-06-27T12:41:53Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T22:07:13.608902Z","submitted_at":"2025-06-27T12:41:53Z","title":"MPipeMoE: Memory Efficient MoE for Pre-trained Models with Adaptive Pipeline Parallelism"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.22175."}