{"as_of":"2026-08-13T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9fc3f150b2d9f4194040527e9b258df49b789f5e1008a62fe130d7b3e9914e3","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:10:00.382168Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10003/citation-record","integrity":"/paper/2411.10003/integrity","json":"/paper/2411.10003/citation-record.json","paper":"/paper/2411.10003"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.199938Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.199938Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:56b4acde9a9902fc91566af761eacb7d394770fee8bc024549202ade00a1e162","observation_id":"e36d548d-3952-47a7-a449-edec124c2c0a","resolution":{"observed_at":"2026-08-12T20:10:00.199938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.203536Z","title":"Glam: Efficient scaling of language models with mixture-of-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.203536Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:0891ad062e4a761f140c6a4ae2e7e345e88a1e090ae0bdb8d2dfe85b512dd6dc","observation_id":"b452d13e-0844-444c-9281-3036ffbb069a","resolution":{"observed_at":"2026-08-12T20:10:00.203536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T20:10:00.206774Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.206774Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:96d5e179891203a10ac42c7f8b07c21b90b1e1218f2428f3cac3b7a664609e00","observation_id":"7f798d6e-bf4f-47ca-b80d-96dc7b51556f","resolution":{"observed_at":"2026-08-12T20:10:00.206774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.210378Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation ai scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.210378Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:0b89a022a6fa73ddf64dc52345169f2496257131a5c20d6e78ffed7268f4b16a","observation_id":"cc6d02f9-b1e9-4827-a2fe-338b2737372e","resolution":{"observed_at":"2026-08-12T20:10:00.210378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.213587Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.213587Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:79318a5c5d21444d2d4f34d00afe32b97640409b050c361ba60b9627fd24065c","observation_id":"05b77c6d-d58f-4c68-99c6-487f56dee8dd","resolution":{"observed_at":"2026-08-12T20:10:00.213587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.216540Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.216540Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:d145bce3b1dca3df27e3c0c8d79800bc7005f51c40cf56496fa3d775b5de14fe","observation_id":"9dfd5072-c6ac-4d8d-b664-59294ae5c7ce","resolution":{"observed_at":"2026-08-12T20:10:00.216540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.219726Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.219726Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:bad45681909490a58eca52cde3266be1c779c21ea0880b177a4a8186e34040b8","observation_id":"c9efb5b9-d7e9-4890-bca6-8868a99fa61e","resolution":{"observed_at":"2026-08-12T20:10:00.219726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.785506Z","title":"Faster- moe: modeling and optimizing training of large-scale dynamic pre- trained models,","venue":null,"work_id":"905d938a-b582-4fca-bfe8-50c9b4ca1425","year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.222415Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:4d9ff91a4b403d3da8cf97c64515694ab2a1b16cc956d00e2b60b74e7e257745","observation_id":"09976f2d-8bef-4494-8040-2d022e3473b2","resolution":{"observed_at":"2026-08-12T20:10:00.788777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.224968Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.224968Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:3ff8b3fe1ebb60bed443f23058779cb7bc103593e875f20756ea1221ac9d019e","observation_id":"c36279c3-9609-4d50-a18a-153a4be382b1","resolution":{"observed_at":"2026-08-12T20:10:00.224968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.227609Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.227609Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:2459e2947245ba4e137ea711c21aed98fb5023e40ecc29d35e365697ab2b6d15","observation_id":"29dd0267-7124-4cae-8baa-246793263d54","resolution":{"observed_at":"2026-08-12T20:10:00.227609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T20:10:00.231213Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.231213Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:bdf3ced5374dd202907abd966c5b32b4f13c43d7ae700173be64440e63dde485","observation_id":"49b1da81-cc16-4eb7-ae87-f6c63a864304","resolution":{"observed_at":"2026-08-12T20:10:00.231213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T20:10:00.234422Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.234422Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:82b03685453b8152b7f4ddd4bd2264617cc856a9c9aa05a4d73ae13f364d8931","observation_id":"c9d435d4-ea4a-4a82-bbef-b908c81fa615","resolution":{"observed_at":"2026-08-12T20:10:00.234422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.237219Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.237219Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:1c94dc23079533ceaacd828bae1163eec9c1b25628a0dc48f84c25c4d28c749a","observation_id":"2e8315ff-cb5d-4199-b7e1-652a144dcd75","resolution":{"observed_at":"2026-08-12T20:10:00.237219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.240658Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.240658Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:298d992db5709e75ab730252c21c90e7222153231e65b756cbb6efdfb874ceff","observation_id":"4440c7bc-d19d-4091-a2cf-65cfecebc704","resolution":{"observed_at":"2026-08-12T20:10:00.240658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T20:10:00.243213Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.243213Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:fe60d4912766673ac8968277d848febb75208bd086571f737785ef3930266e1a","observation_id":"34821e7a-2354-4cba-853e-7974fa80fe15","resolution":{"observed_at":"2026-08-12T20:10:00.243213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.246182Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.246182Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:8877f5c6134e443a135fbcc965b43f7bc3870350316fe8361f96bc93262c659f","observation_id":"d145997b-c7d3-446b-80e6-fb8425bac0f5","resolution":{"observed_at":"2026-08-12T20:10:00.246182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.248941Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.248941Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:9cc3a3bf1005a697c6cb1ac405c3811bf25c31a9f65cb30154764edd2f3a1824","observation_id":"21a68326-a51d-4cf2-9ef0-cb58780bbe26","resolution":{"observed_at":"2026-08-12T20:10:00.248941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-09T17:07:26.804289Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-12T20:10:00.252688Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.252688Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:16b6174573e6151cd5a924b9a83479c9f39924845368459d46ad9af367659c78","observation_id":"aff407bc-51ed-4917-b305-4a238d19ef69","resolution":{"observed_at":"2026-08-12T20:10:00.252688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-12T23:28:33.412949Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-12T20:10:00.257132Z","title":"Mixture of a million experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.257132Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:7dc63ea1f14c85fcd7a95b8899ffd64f231086c805e5072bc7dd7dcca76e09ac","observation_id":"3809ba1a-448b-47f8-b717-3d5b47fde7ba","resolution":{"observed_at":"2026-08-12T20:10:00.257132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-07-06T11:55:57.117755Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-12T20:10:00.260529Z","title":"Taming sparsely activated transformer with stochastic experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.260529Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:bf9ac2f750131598976762013445aa6a71adfbb6750c0715f5b9cff90bc78082","observation_id":"52602f3f-2653-4d8f-b858-a60f96c09ede","resolution":{"observed_at":"2026-08-12T20:10:00.260529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.747664Z","title":"Scaling laws for fine-grained mixture of experts,","venue":null,"work_id":"904271be-2a83-44cc-9713-976fd1359368","year":null},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.263578Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:bcf333d8e5652bc117694f16ef3475e867745622534c8e8aff232abc825b767a","observation_id":"fc4f260d-5b54-4dd9-a9aa-07fe5e8455b5","resolution":{"observed_at":"2026-08-12T20:10:00.752028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05055","last_updated":"2023-02-17T17:54:50Z","snapshot_observed_at":"2026-07-06T14:28:52.486524Z","submitted_at":"2022-12-09T18:57:37Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05055","snapshot_observed_at":"2026-08-12T20:10:00.266892Z","title":"Sparse upcycling: Training mixture-of-experts from dense checkpoints,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.266892Z"},"links":{"cited_paper":"/paper/2212.05055","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:2f341da10fad8f5ecdc0457d520becbdae025ffa28671c14f201d115390bfd6a","observation_id":"e9b2b9de-b84d-42fa-82f9-8122320186ae","resolution":{"observed_at":"2026-08-12T20:10:00.266892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.270242Z","title":"Go wider instead of deeper,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.270242Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:f0562e03d74e61465a6ded867c44f4c4cd98d8e4eaa478df045fd9615938526f","observation_id":"290384aa-3190-4961-b0ae-38e50cd62f5c","resolution":{"observed_at":"2026-08-12T20:10:00.270242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10890","last_updated":"2022-10-25T08:07:05Z","snapshot_observed_at":"2026-07-06T12:31:27.444916Z","submitted_at":"2022-01-26T12:11:02Z","title":"One Student Knows All Experts Know: From Sparse to Dense","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10890","snapshot_observed_at":"2026-08-12T20:10:00.272918Z","title":"One student knows all experts know: From sparse to dense,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.272918Z"},"links":{"cited_paper":"/paper/2201.10890","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:ec0a1cf429b31ef96635a13cc9fecef19575f3693c647e5a593f6fe7c8adc516","observation_id":"cc186b9a-7c60-4240-9bf8-99c451518807","resolution":{"observed_at":"2026-08-12T20:10:00.272918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-12T20:10:00.275906Z","title":"St-moe: Designing stable and transferable sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.275906Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:850d147f9a7ff1fe7422f275a28814de9b92c2c99a5c7bb040823daa506d3cde","observation_id":"38ee513d-0e03-42ba-b6f2-90914a5cf819","resolution":{"observed_at":"2026-08-12T20:10:00.275906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T20:10:00.279105Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.279105Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:610ef05971ca318a70dc9f1e7d82d065b159f396bc2ea58e3108c7e8153f929e","observation_id":"2d53ee6d-218c-4ed4-aa53-ae7d224fd501","resolution":{"observed_at":"2026-08-12T20:10:00.279105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.733612Z","title":"Stabilization of planar collective motion: All-to-all communication,","venue":null,"work_id":"2fd9c5c4-7de0-4ca9-b8f2-daa291c8e5d1","year":2007},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.282279Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:4fc62c96bb720fe9f7bbbcd999f462b055b8b8f3c0e6d4c099e90aea471a321c","observation_id":"699f02f3-d1f9-4b75-8533-38a0486d714c","resolution":{"observed_at":"2026-08-12T20:10:00.736945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.723805Z","title":"Optimization of all-to-all communication on the blue gene/l supercomputer,","venue":null,"work_id":"08ba04be-7282-49d6-b79f-80e2e32dfbf0","year":2008},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.285105Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:c68b009de1b8ac93246907c3d4c590ae1a24364ccf51d004303d640d676b8060","observation_id":"8c2d3890-f7a6-4d17-bd70-7f01b8af434f","resolution":{"observed_at":"2026-08-12T20:10:00.727086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.715029Z","title":"The hierarchical factor algorithm for all-to-all communication,","venue":null,"work_id":"e9b24217-c88b-4ddc-b106-bec51acfa339","year":2002},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.288038Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:99f2a2e16a0f89dba8e7047db837354976889b59e6e03b5ccec71f291f9e6bb3","observation_id":"f37a21b1-5643-4dd9-9d6c-4b0286378d15","resolution":{"observed_at":"2026-08-12T20:10:00.718422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-12T20:10:00.290731Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.290731Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:a9d5427b59bce7c935dedc069c24a1c40f9eacbc8ec36be417c2111d346e965e","observation_id":"af6da1f4-89f5-4d0c-8aec-55ac85df5188","resolution":{"observed_at":"2026-08-12T20:10:00.290731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14685","last_updated":"2022-11-17T11:30:17Z","snapshot_observed_at":"2026-08-10T12:49:30.614724Z","submitted_at":"2022-03-28T12:32:25Z","title":"HetuMoE: An Efficient Trillion-scale Mixture-of-Expert Distributed Training System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14685","snapshot_observed_at":"2026-08-12T20:10:00.293880Z","title":"Hetumoe: An effi- cient trillion-scale mixture-of-expert distributed training system,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.293880Z"},"links":{"cited_paper":"/paper/2203.14685","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:834dddd656249bb94b4c8f9e8a781ba00bdcc79e6f3a1125086182a5f375782a","observation_id":"7ebe3cf2-a672-4597-8f35-550841df79cc","resolution":{"observed_at":"2026-08-12T20:10:00.293880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-10T06:33:13.988909Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-12T20:10:00.296977Z","title":"Fastmoe: A fast mixture-of-expert training system,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.296977Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:57bf0d543089ec024791539226115e731cb0c81372d3b4d169a2dcc0e93bf55d","observation_id":"826989a0-251e-4486-b7c8-e460c0678026","resolution":{"observed_at":"2026-08-12T20:10:00.296977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.300195Z","title":"Moesys: A distributed and efficient mixture-of-experts training and inference system for internet services,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.300195Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:474300974ce56931292b803158e3675ac3ff428011e0eb492482dc1defd1b48c","observation_id":"80806519-2428-4747-949b-66856a7bfbb3","resolution":{"observed_at":"2026-08-12T20:10:00.300195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.700696Z","title":"Accelerating distributed moe training and inference with lina,","venue":null,"work_id":"c804079c-9a53-46cb-99da-33c511d73b0f","year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.302914Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:d5a6cfa15291011dbea06295b7425254c572e5c8f090e531b7b2114de8b9b01f","observation_id":"9f26843c-db03-4bab-92db-f7371fc18d86","resolution":{"observed_at":"2026-08-12T20:10:00.704177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.691924Z","title":"Janus: A unified distributed training framework for sparse mixture-of-experts models,","venue":null,"work_id":"2b6e65c0-230c-4d6d-a6ff-b435b3ac86d1","year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.305921Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:88e56508acc3517738a3ae331175f9fec6ef83c1533fd1bd57a0a1890f49c8a5","observation_id":"dd018d99-45b1-47b4-9e39-d869372a3e2e","resolution":{"observed_at":"2026-08-12T20:10:00.695266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.682382Z","title":"Amp: Automatically finding model parallel strategies with heterogeneity awareness,","venue":null,"work_id":"f8a7d29a-a702-4458-b284-2984080e4e9d","year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.308883Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:0bdce8c70bd939b9feadba533a6ac9173f800026542d11581ddf4c411d331d3f","observation_id":"7e2bfbb1-5918-4be1-88c8-a3c798fc9ed9","resolution":{"observed_at":"2026-08-12T20:10:00.686137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.311581Z","title":"Merak: An efficient distributed dnn training framework with automated 3d parallelism for giant foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.311581Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:6bcb9a529eeaaaaba1bb83fdb9b6c39c6d7194fefa6c820458db6b932e3139d1","observation_id":"9f5c84a0-ef36-470f-be87-de44ef55257a","resolution":{"observed_at":"2026-08-12T20:10:00.311581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.668544Z","title":"Hippie: A data-paralleled pipeline approach to improve memory-efficiency and scalability for large dnn training,","venue":null,"work_id":"37278b63-71e9-4aee-93de-f1a7265fb9de","year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.314245Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:f5c36355e28d649d7bb9eeaea4db5b9716373e33deedb0048b90e0b576ab3d7d","observation_id":"46c22993-8ac0-47e4-a2ca-434d3d1db28e","resolution":{"observed_at":"2026-08-12T20:10:00.672088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.317161Z","title":"Colossal-ai: A unified deep learning system for large-scale parallel training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.317161Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:5aafbeda18e9413d5bdb7c60a27c9d11916c824e4ca2db1c6b32fe6b0d9836b0","observation_id":"360af553-4124-49e6-bedf-1f840cc44f51","resolution":{"observed_at":"2026-08-12T20:10:00.317161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.655059Z","title":"Piper: Mul- tidimensional planner for dnn parallelization,","venue":null,"work_id":"05ebfdc9-965e-4d37-9334-a5e6a1e2dfe7","year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.320208Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:3f40eb784933156eb0be969e59aa3c1f5acc2e4880c44c8af1e8c7221e4f3dab","observation_id":"6e0242cb-1274-4526-880d-b762bbc4d5af","resolution":{"observed_at":"2026-08-12T20:10:00.658455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.645150Z","title":"Parallel intelligent computing: development and challenges,","venue":null,"work_id":"5b019c45-784e-40f2-9529-54b8d3ac0f59","year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.322933Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:b2a0c8b3d95e402631ba0d26eeb123c28086f047b1053736848cadb842c5ac2e","observation_id":"b951c0a5-908f-4ecc-bc98-899fa3472acf","resolution":{"observed_at":"2026-08-12T20:10:00.649130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.635601Z","title":"Zero- infinity: Breaking the gpu memory wall for extreme scale deep learning,","venue":null,"work_id":"f4cd86ef-4b17-44d8-9a56-f39b72f5e331","year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.325797Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:c86003451e1bd4446c3e3d69a31baffaf729b536dd4429f8633f1cef0e58365f","observation_id":"8d3a6b4a-c378-4a98-b349-19dc4cfa6be5","resolution":{"observed_at":"2026-08-12T20:10:00.639818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.627138Z","title":"Zero-offload: Democratizing billion-scale model training,","venue":null,"work_id":"447f37c1-08d5-4a47-9bb0-8af64719ccc7","year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.329512Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:d120e46511b1a3d135b264d7a2e5b8ed2e0aefceb2dc0a22a0ae2b36a123fe03","observation_id":"72044f93-4f03-47a2-b08f-2c859365b88a","resolution":{"observed_at":"2026-08-12T20:10:00.630265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-12T20:10:00.332429Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.332429Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:30466b0d03241636214a05db47987b369ee81eac22bc4cd87529af3cc84c889a","observation_id":"10ce9216-144c-4931-bc69-a483136a8b34","resolution":{"observed_at":"2026-08-12T20:10:00.332429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00119","last_updated":"2022-10-28T15:55:09Z","snapshot_observed_at":"2026-07-06T13:05:19.702730Z","submitted_at":"2022-04-30T00:55:29Z","title":"MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00119","snapshot_observed_at":"2026-08-12T20:10:00.335691Z","title":"Mics: near-linear scaling for training gigantic model on public cloud,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.335691Z"},"links":{"cited_paper":"/paper/2205.00119","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:72cc15071cc2a5cfc193983c9c947553ec89d25a69509b2417787f9716970a9b","observation_id":"51bd6a73-b9cd-4b03-8802-1d55e0763222","resolution":{"observed_at":"2026-08-12T20:10:00.335691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14450","last_updated":"2021-05-30T07:41:08Z","snapshot_observed_at":"2026-07-06T11:14:04.454155Z","submitted_at":"2021-05-30T07:41:08Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14450","snapshot_observed_at":"2026-08-12T20:10:00.338766Z","title":"Maximizing parallelism in distributed training for huge neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.338766Z"},"links":{"cited_paper":"/paper/2105.14450","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:0d5313d8d2819d5201935cb8ecd3a37af564b556f8de65561f739caf0b6a5ff3","observation_id":"c05e997e-1f81-4404-a78f-22131273c31c","resolution":{"observed_at":"2026-08-12T20:10:00.338766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.617040Z","title":"Autopipe: A fast pipeline parallelism approach with balanced partitioning and micro- batch slicing,","venue":null,"work_id":"6ea35003-835f-40ad-9463-99a1b04e27f1","year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.342063Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:856e8b8cc0e7a04ac96c3eb9f8b9fbfad2c54f1647a3d2a069007a4346103e63","observation_id":"9b97b545-503f-4084-9ef2-f3196c6a566f","resolution":{"observed_at":"2026-08-12T20:10:00.620566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.608307Z","title":"Hph: Hybrid parallelism on heterogeneous clusters for accelerating large-scale dnns training,","venue":null,"work_id":"c5ef1b92-1d70-43b8-a8cf-b5dfdf276778","year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.345381Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:f59311b76876eb72e0205140936403d78e5767493dcf2ba44ddae19b6e3cb22c","observation_id":"24de2ed7-f199-4900-a52d-3a1c7e66e0e0","resolution":{"observed_at":"2026-08-12T20:10:00.611602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-12T20:10:00.348204Z","title":"Sequence paral- lelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.348204Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:1dba35a20132110138e723c72125199e118b0468974969e57c619cee76513983","observation_id":"85eae24b-9be0-41e4-9ced-6facda989775","resolution":{"observed_at":"2026-08-12T20:10:00.348204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.351017Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.351017Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:5238acf69e2074d6ad710b858ae62513ed85f7631305899adc35e1afdf50dd0c","observation_id":"ae5eb7df-23fc-48f6-86c1-912b5b2efea5","resolution":{"observed_at":"2026-08-12T20:10:00.351017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-12T20:10:00.354500Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.354500Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:a27b32fe837a42754f9357f4dd7ca06ef01da8c5db7b98d5b259b4a646a04eb7","observation_id":"459f212d-2063-40f8-a3d1-cb5d50a95469","resolution":{"observed_at":"2026-08-12T20:10:00.354500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-12T17:42:29.402066Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-12T20:10:00.357780Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.357780Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:d6c267c1598b6114f8aedfaa5d85deee08d79c8d433a3aebaa49547d6957825e","observation_id":"c2d30e42-31d6-44f3-ace7-11f1858ea94a","resolution":{"observed_at":"2026-08-12T20:10:00.357780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.361017Z","title":"Bagualu: targeting brain scale pretrained models with over 37 million cores,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.361017Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:bdcc768f33c189dd2dbf5bf654891715a4fd8ad3fb271229fe58e207f3770c9f","observation_id":"0b245745-c6a7-491f-bf00-0ca0fe2d9f0c","resolution":{"observed_at":"2026-08-12T20:10:00.361017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.590226Z","title":"Parm: Efficient training of large sparsely-activated models with dedicated schedules,","venue":null,"work_id":"d7817993-672c-4e2f-a324-4f4a5620bd05","year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.363917Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:39e345efae1bc590003ac737e75dea7a7e726e9883eb388a099950ecc1f9f1ea","observation_id":"90b3f15f-2ac1-461d-a45f-6634f43a9305","resolution":{"observed_at":"2026-08-12T20:10:00.593618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.367178Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture- of-experts training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.367178Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:b45c2af2ada7cd89a172314da3f916c0ef817c1e8a3f3b07a8bff967a8805784","observation_id":"170fcd03-b062-4ae9-8564-7850af247d9e","resolution":{"observed_at":"2026-08-12T20:10:00.367178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.576147Z","title":"Mg-wfbp: Efficient data communication for distributed synchronous sgd algorithms,","venue":null,"work_id":"4a10eaad-64b0-4efb-a9cb-c35ffaebe4dd","year":2019},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.370350Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:fb5a9f4912f8440872ad58b5eae1ff242c628cec5793e634f8474eec0b14b5af","observation_id":"8b1933bb-90f3-4d74-878b-0bbc965268e7","resolution":{"observed_at":"2026-08-12T20:10:00.579108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.03161","last_updated":"2021-02-12T12:26:03Z","snapshot_observed_at":"2026-08-09T05:31:10.979727Z","submitted_at":"2021-02-05T13:39:31Z","title":"PipeTransformer: Automated Elastic Pipelining for Distributed Training of Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.03161","snapshot_observed_at":"2026-08-12T20:10:00.372977Z","title":"Pipetransformer: Automated elastic pipelining for distributed training of transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.372977Z"},"links":{"cited_paper":"/paper/2102.03161","citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:f86d4b1bb0a33de8c067b7aa03e78f7c4ce663c519b84c970c9fcbac611a1e39","observation_id":"330a99b6-790c-430b-ace4-199aeb2e85b3","resolution":{"observed_at":"2026-08-12T20:10:00.372977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.565075Z","title":"A multidimensional communication scheduling method for hybrid parallel dnn training,","venue":null,"work_id":"9d6a0aef-2292-4c4c-a7e1-f8e57fa58e92","year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.376113Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:effbd30381f35ff98e6d288aae318ba9cfee9c5496b86ba270f8801b9b8ae1dd","observation_id":"fe168bc5-30cb-4bf0-a885-1718896f5399","resolution":{"observed_at":"2026-08-12T20:10:00.570645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.379017Z","title":"Schemoe: An extensible mixture-of-experts distributed training system with tasks scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.379017Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:2eb6033dd23673d045f2fb6c0588cad29f8a25950346ee0b4c5d9b5ad68dae9b","observation_id":"b1c76ec9-0a12-47b8-96bd-a305aff7edc3","resolution":{"observed_at":"2026-08-12T20:10:00.379017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:10:00.382168Z","title":"Pipemoe: Accelerating mixture- of-experts through adaptive pipelining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:00.382168Z"},"links":{"citing_paper":"/paper/2411.10003"},"observation_digest":"sha256:e5393f1ca843bfb5a8514e89d9f51f839ab1e7c6bfacf8157b556754d63d7a3a","observation_id":"7b64b832-e524-4522-b65d-dd22fe32f106","resolution":{"observed_at":"2026-08-12T20:10:00.382168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10003","last_updated":"2024-11-21T07:10:32Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-12T20:02:23.545823Z","submitted_at":"2024-11-15T07:27:58Z","title":"Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2411.10003."}