{"as_of":"2026-08-12T22:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98e87147a371224705d6b9a4e908936b76136026e002fa141626db1f70a1837f","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:24:00.465856Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15419/citation-record","integrity":"/paper/2411.15419/integrity","json":"/paper/2411.15419/citation-record.json","paper":"/paper/2411.15419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.225425Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.225425Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:8b360e0faa4ba1eb60675fe91c107d699ffdfc50001f34247ab7ce4a3ea2742c","observation_id":"0a280264-2777-44ee-86ec-191dfdd495f2","resolution":{"observed_at":"2026-08-12T14:24:00.225425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T14:24:00.230885Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.230885Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:98a2b834844d1e53afd6ec5413c3dcd7bec930e8c89d9ced3cb848dc72fb1bf7","observation_id":"a04b83fb-5c21-464b-9275-38b39740cdbc","resolution":{"observed_at":"2026-08-12T14:24:00.230885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.236232Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.236232Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:3c427fcd1a922493550cfc4f455ff3b3b5b5b37de2ca73a88e4075b1d949cd97","observation_id":"d7bdecca-5cc6-413b-8280-79330a94d8dd","resolution":{"observed_at":"2026-08-12T14:24:00.236232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T14:24:00.241305Z","title":"Scaling laws for neural language models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.241305Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:d29c272af49f9090c0be2107c46458b4944e7a4a2c0dd922a3c1ab53b684ee85","observation_id":"9301b913-d786-4804-a656-d5c6c6488c5d","resolution":{"observed_at":"2026-08-12T14:24:00.241305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T14:24:00.246516Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.246516Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:758119a88447776c7a6efbb56336230d314e533321235e089ee4559f6554c63d","observation_id":"f5496b08-8a18-4e12-88dc-df73a3efa4fe","resolution":{"observed_at":"2026-08-12T14:24:00.246516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.251780Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.251780Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:aad076cb3f88ddfb33763f73b79efb63593eacba4948520c14f81275d48c0389","observation_id":"4e0bebad-8f71-4e95-9af0-e5d4172f6b1c","resolution":{"observed_at":"2026-08-12T14:24:00.251780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.257034Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation ai scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.257034Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:743be2f88b4b04f189eb3c7774a589bd2d7a17b8ae4bf96a930d8140bb227aaf","observation_id":"40f0ac79-2cb9-4f8b-991a-9287f134d4d2","resolution":{"observed_at":"2026-08-12T14:24:00.257034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.261755Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.261755Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:d7f606d60b95b7e3e8d87b7b26759ce21ab594822d076a52ecf975827013b8ef","observation_id":"32743ec6-8d9a-4074-b121-3a21e783519c","resolution":{"observed_at":"2026-08-12T14:24:00.261755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:01.108904Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement,","venue":null,"work_id":"32d2cc38-a2aa-4ed0-8410-850ec4f15811","year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.266533Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:12bb928fb1deeb6a2154cba8ca6911c02ddc9fec805f87155b77fb5fb858e894","observation_id":"47cd25e9-1ff7-4056-876b-015c3601e47c","resolution":{"observed_at":"2026-08-12T14:24:01.114174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.271283Z","title":"Janus: A unified distributed training framework for sparse mixture-of-experts models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.271283Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:93bc34233111c02f6d7cc01c3340ff6916865271dd24deab6f33e9a52a84a257","observation_id":"d67466c7-272d-4c1e-a165-0ac5b345c237","resolution":{"observed_at":"2026-08-12T14:24:00.271283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.276180Z","title":"Accelerating distributed {MoE} training and inference with lina,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.276180Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:cebe802e5699fc32eff7b92c8706c466b18cb48a491b9f079b6540400ce41ac1","observation_id":"af105974-1e52-46b4-b291-0f139b6f2d39","resolution":{"observed_at":"2026-08-12T14:24:00.276180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.280979Z","title":"Gating dropout: Communication-efficient regularization for sparsely activated transform- ers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.280979Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:137593d8dc7f1e40eed12c549209bdf1b70409cedd62febc5253186e91397226","observation_id":"90e63e08-7b37-4d80-a0b2-5e79652addb8","resolution":{"observed_at":"2026-08-12T14:24:00.280979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.285442Z","title":"Faster- moe: modeling and optimizing training of large-scale dynamic pre- trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.285442Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:280955148eb53d712dd4c7486a2ef665c7d141804df721aab3c540a53d83861d","observation_id":"3c50de7e-42a4-428e-9e76-6fda5d12953d","resolution":{"observed_at":"2026-08-12T14:24:00.285442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.289979Z","title":"Dota: detect and omit weak attentions for scalable transformer acceleration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.289979Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:053a7cdbee51f15263079fae4c532ba8b8b923cec58888c68634a8bdf5d7e679","observation_id":"473b3e24-55b5-4b80-b7e8-0f6c585f1f46","resolution":{"observed_at":"2026-08-12T14:24:00.289979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:01.037570Z","title":"Vitcod: Vision transformer acceleration via dedicated algorithm and accelerator co-design,","venue":null,"work_id":"92382201-a486-475e-80b1-8939c6de102c","year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.294391Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:6d306c034bda57fb9e86295e806ca41a3049df7b2549ac5df7e531e22659a205","observation_id":"494eb4b3-c4e4-4195-8db4-5ab5e9f58cd3","resolution":{"observed_at":"2026-08-12T14:24:01.042677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.298778Z","title":"Scaling vision with sparse mixture of experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.298778Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:6f8fae25312ec209be59d3436e7d5abe7b532ea27b5cc157e596e2a63feb58b8","observation_id":"c83d3174-2cf8-45c8-b86b-d079ce6cf3c1","resolution":{"observed_at":"2026-08-12T14:24:00.298778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-12T14:24:00.303294Z","title":"Designing effective sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.303294Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:45b5280ce2b0ecde460da6dddb1527be9cd9ecf56f4e0600a9f35976acaac4a3","observation_id":"cda643f5-befb-4273-8c2b-16b4640fd7cd","resolution":{"observed_at":"2026-08-12T14:24:00.303294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.308149Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.308149Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:e01c43bdf2c69332ac89cd859d84020e9b50fbaaa5ab79ad64d80a8620d28727","observation_id":"df9ea7e2-6dc4-4fc8-ae7f-9b8ba5f3c86b","resolution":{"observed_at":"2026-08-12T14:24:00.308149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.312424Z","title":"Bagualu: targeting brain scale pretrained models with over 37 million cores,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.312424Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:e3f9f3a7986923586c8cb134d6fc2be5326ec6fcd07e42eabe6b7333852eb3b6","observation_id":"9d67b0c2-877f-446f-af4d-5dc95e558616","resolution":{"observed_at":"2026-08-12T14:24:00.312424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-10T06:33:13.988909Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-12T14:24:00.317008Z","title":"Fastmoe: A fast mixture-of-expert training system,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.317008Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:726f644c1902b17430548a9e1f605f510696784969a385174de66acf103b896d","observation_id":"718c5dc3-3874-4f11-91c0-c0f7d46d9915","resolution":{"observed_at":"2026-08-12T14:24:00.317008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.322070Z","title":"{SmartMoE}: Efficiently training {Sparsely-Activated} models through combining offline and online parallelization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.322070Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:bb7fb8ddaaf2692793007432aa565cedbab81b686c2eddd2f2d7795fdbcf014b","observation_id":"8456a3e5-5214-4706-a9f4-ec1966c179e8","resolution":{"observed_at":"2026-08-12T14:24:00.322070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-12T14:24:00.326484Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.326484Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:5291bc4266665c6520c0a95c86b38fb2bd0629dfae536fe0736e82ef7817dc5e","observation_id":"d08a7bd0-15ac-456c-b82b-9fa41790159e","resolution":{"observed_at":"2026-08-12T14:24:00.326484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T14:24:00.331127Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.331127Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:f59b035301884f4941cc4bda7b8c73fddc25cb4957f9d80c8d7947930e999510","observation_id":"e381844c-2fb7-4493-97fc-1a2769e9639b","resolution":{"observed_at":"2026-08-12T14:24:00.331127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.982018Z","title":"Evaluating the stability of embedding- based word similarities,","venue":null,"work_id":"06860c64-2281-4619-b5f1-6e3c9cec78fd","year":2018},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.335822Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:b77973abef1eef9835dca21728c9a47d98aac4c52125eb4a854241baf58379c3","observation_id":"5321b8d5-d25c-4dfa-a6ef-26b31711acf8","resolution":{"observed_at":"2026-08-12T14:24:00.987117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.965818Z","title":"Sentiment classification using docu- ment embeddings trained with cosine similarity,","venue":null,"work_id":"34aeb720-63ae-410e-bdbb-1c6eaf4b9cc7","year":2019},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.340229Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:5d4c89fee5404d3f39bad962d034722cb1919bda2f397a9ccf65349c8b505c5f","observation_id":"f4ae30d9-3e43-4c48-a267-ecaec1b2ff23","resolution":{"observed_at":"2026-08-12T14:24:00.971076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.950094Z","title":"Problems with cosine as a measure of embedding similarity for high frequency words,","venue":null,"work_id":"158b25d6-6d52-4586-b991-cf346cbf8a4f","year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.344952Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:b2c280f76225300970054030297145420f662fe3b9337058dd991b177b2e8c20","observation_id":"fe9f19ea-c65e-4219-8610-8065e01afaac","resolution":{"observed_at":"2026-08-12T14:24:00.955273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17276","last_updated":"2023-12-27T11:49:24Z","snapshot_observed_at":"2026-07-06T17:09:28.880512Z","submitted_at":"2023-12-27T11:49:24Z","title":"PanGu-$\\pi$: Enhancing Language Model Architectures via Nonlinearity Compensation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17276","snapshot_observed_at":"2026-08-12T14:24:00.349134Z","title":"Pangu-π: Enhancing language model architec- tures via nonlinearity compensation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.349134Z"},"links":{"cited_paper":"/paper/2312.17276","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:c9db8bb803e52a709e329ce9a30eec61c255a56ebff4cb393cf36c74c5f8f2b7","observation_id":"776d376f-a324-46e6-ba43-979288ca7ad6","resolution":{"observed_at":"2026-08-12T14:24:00.349134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.354236Z","title":"Turbotransformers: an efficient gpu serving system for transformer models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.354236Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:d990e24c9ca24988c699011a3e60624d6f763234dda1d14eac4e5d0cd6362fee","observation_id":"362ef62c-6582-4a07-9ab1-e50b1462e7c6","resolution":{"observed_at":"2026-08-12T14:24:00.354236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.358622Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.358622Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:da6f8e73bd55860b0f2e5c236d43e9b0c86b446929826dd67fa3e2c5463d193d","observation_id":"3744365b-3450-41ce-aece-6fa235c139d3","resolution":{"observed_at":"2026-08-12T14:24:00.358622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.362885Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.362885Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:eef2b40cacca2141ca28700908c4ae8852ad9d794a969ec5505e1c2c441b3ab2","observation_id":"dc879ffb-3799-4dc5-be37-b8bde5b4553a","resolution":{"observed_at":"2026-08-12T14:24:00.362885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.905794Z","title":"Deep graph library: Towards efficient and scalable deep learning on graphs,","venue":null,"work_id":"5e789b94-28c6-4e7c-8692-25fb6dcc576d","year":2019},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.367558Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:46787e177c5f5a3d443173f11606ab985b7ae988c90e9edfc6ec4dbad1a547b7","observation_id":"dd5c1a8a-ccd1-4be1-b474-ff6e14732725","resolution":{"observed_at":"2026-08-12T14:24:00.910518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.889919Z","title":"Pointer sentinel mix- ture models,","venue":null,"work_id":"3c1eaab2-c184-4687-9639-a35f1c640a86","year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.372344Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:011022d21643394deebc072c4dd7964d1c5c2753b499a44560c936493b385e93","observation_id":"80472934-57cb-4614-aa99-b72ccb8aabf5","resolution":{"observed_at":"2026-08-12T14:24:00.895148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-12T14:24:00.377195Z","title":"Squad: 100,000+ questions for machine comprehension of text,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.377195Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:f011b6a0a0689803e00c22e2d84aa28b5e5fbbc208504e30ebf9aebd399a9e78","observation_id":"23546902-2a1f-43e7-b732-5a6d90a56522","resolution":{"observed_at":"2026-08-12T14:24:00.377195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.873770Z","title":"Samsum corpus: A human-annotated dialogue dataset for abstractive summarization,","venue":null,"work_id":"dd9af833-53e4-44d4-8697-8eaf8a119e18","year":2019},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.382319Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:d38f9ff0fd242a80dcf1bb4546ff626801266e678e49e0134777df6ccedf24fe","observation_id":"ea65bc08-baed-432c-8caf-74f28e9851c7","resolution":{"observed_at":"2026-08-12T14:24:00.878621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.857951Z","title":"Language models with image descriptors are strong few-shot video-language learners,","venue":null,"work_id":"fdab4dc4-4d61-4ec4-bb86-bd650345b33b","year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.387010Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:445c644a93edc5f53bd6e7cfe3ef93f679b328360b6db0e2e3fc31c9c1f86bde","observation_id":"7434d240-26bc-4341-9dce-c9dfaa2304a0","resolution":{"observed_at":"2026-08-12T14:24:00.862671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.843165Z","title":"Multitask mixture of sequential experts for user activity streams,","venue":null,"work_id":"f24e1b81-32a7-4941-a33b-8fa812c41bf1","year":2020},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.391978Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:80098c74db0818b90151d7d094646940b0e82de2a408f83dee89374e6dda37ad","observation_id":"6816a34e-bba2-4804-90d8-13fc59af7298","resolution":{"observed_at":"2026-08-12T14:24:00.847940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-07-06T11:55:57.117755Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-12T14:24:00.396667Z","title":"Taming sparsely activated transformer with stochastic experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.396667Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:47d39759170edb3a8b9c44835816c2b97baf73346b92bbc1bc170734f44a5b2c","observation_id":"1b998076-e7ee-4d05-b0e6-200ffa91e923","resolution":{"observed_at":"2026-08-12T14:24:00.396667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.828161Z","title":"Generalizable person re- identification with relevance-aware mixture of experts,","venue":null,"work_id":"912dadfd-8890-40c2-b29e-4ec60932b229","year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.401465Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:4daa2eeefbc7a29a15c66e7a57894925240169cbf0c768ff5f09ba0f349f1c00","observation_id":"88639ef7-6f65-42fc-930c-4d361d9c077c","resolution":{"observed_at":"2026-08-12T14:24:00.833098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.812775Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts,","venue":null,"work_id":"39407dbf-73f1-4217-9115-97dbd20b096a","year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.406077Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:755d52f4fd90fa7154a7839b18c5fe6d9dc5fbdcc4d40ba50178bd6c3e83a44d","observation_id":"f692a302-b56d-4130-912b-043a87f3d6e0","resolution":{"observed_at":"2026-08-12T14:24:00.817749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.410376Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.410376Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:9bc93cf169f97b9418c3b73503a01b7ac37f0763ad22973a46b1d75b8cb569ea","observation_id":"326748dc-4b49-4e69-b1b5-d9002782496a","resolution":{"observed_at":"2026-08-12T14:24:00.410376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.414670Z","title":"Glam: Efficient scaling of language models with mixture-of-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.414670Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:8a9f160a25f3ed8929d0b4f1722b3715623fd56bc7437dc0ca40b6144c67eb8d","observation_id":"52e05fe1-472d-474a-b3cb-976103035ec4","resolution":{"observed_at":"2026-08-12T14:24:00.414670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.776983Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre-training,","venue":null,"work_id":"eaeeb66f-1371-429e-974b-915a2e87085b","year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.419324Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:fa8d0747589fed6abe4d8b47fd9e39d26c70281857a71b51bc09e404ce7db122","observation_id":"e826fa77-eaf6-4493-a3c1-8246c9a1c15a","resolution":{"observed_at":"2026-08-12T14:24:00.782311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-12T14:24:00.423688Z","title":"Open- moe: An early effort on open mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.423688Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:6d8a0e94d08db2ecc59ec8e11cc810cce6d67b54063db460a13b5eec763f56df","observation_id":"a9bce051-d954-492c-8611-0506c5d3fdf8","resolution":{"observed_at":"2026-08-12T14:24:00.423688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T14:24:00.428858Z","title":"Deepseekmoe: Towards ultimate expert spe- cialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.428858Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:eda48bc92e551cb34503691204467850db1357a9fea1e3b4eafc2b82255bd5de","observation_id":"ef3facce-caa7-4c67-8bb6-456edfd66297","resolution":{"observed_at":"2026-08-12T14:24:00.428858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-12T14:24:00.433734Z","title":"Gspmd: general and scalable parallelization for ml computation graphs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.433734Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:fd3b98f4c7d4e7fbfa7ec11c08993d486ae13740f2900884535a3725a641689f","observation_id":"a6a663f9-4cbf-446d-81ee-c53354ab40bd","resolution":{"observed_at":"2026-08-12T14:24:00.433734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.438386Z","title":"Base layers: Simplifying training of large, sparse models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.438386Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:b0ebd89bd558d59c294778bb453ab31d3910a521a9c755c0cda13b0754707fc8","observation_id":"7b787e6d-8484-4896-9d4b-da3eeeffdc85","resolution":{"observed_at":"2026-08-12T14:24:00.438386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-06T00:26:50.886840Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-08-12T14:24:00.442960Z","title":"fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.442960Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:7f40632260f31905623edbbfa986f0b614eabcd214f30afdbf275f5c079c0257","observation_id":"4c3c2234-a201-4c3f-9b05-2121b62c75cc","resolution":{"observed_at":"2026-08-12T14:24:00.442960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.447653Z","title":"Pipemoe: Accelerating mixture- of-experts through adaptive pipelining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.447653Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:b603cd5ec7617fe098a5f50690880d02ef711e21eadf1b5d27ff510a26df136b","observation_id":"4298b2fd-0172-4e22-858c-05aaac22e60a","resolution":{"observed_at":"2026-08-12T14:24:00.447653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.451989Z","title":"Mpipemoe: Memory efficient moe for pre-trained models with adaptive pipeline parallelism,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.451989Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:ae49e6852d6558c84d147bf71b5490e27777edf23920fd3e26f6e9ea79d263c0","observation_id":"c0ec9ec0-aa5f-4fda-ad27-8498ff592d33","resolution":{"observed_at":"2026-08-12T14:24:00.451989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10034","last_updated":"2024-08-12T09:23:13Z","snapshot_observed_at":"2026-08-12T14:36:38.307883Z","submitted_at":"2022-05-20T09:09:27Z","title":"MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10034","snapshot_observed_at":"2026-08-12T14:24:00.456236Z","title":"Se-moe: A scalable and efficient mixture- of-experts distributed training and inference system,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.456236Z"},"links":{"cited_paper":"/paper/2205.10034","citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:7f5857109f8e8b94c49754c5fba609f78177c5f6438bbb1764586e4925b2045d","observation_id":"c16bf56f-ec91-4130-9987-ba68b2356f8e","resolution":{"observed_at":"2026-08-12T14:24:00.456236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.731052Z","title":"Alpa: Automating inter-and {Intra- Operator} parallelism for distributed deep learning,","venue":null,"work_id":"bb8f26e1-f42e-40a9-8e2c-863d4e18b667","year":2022},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.460975Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:f1a9603657ba014dda763cb26959fe7caedbd4e900e18b2eebf4655fd99bd6ee","observation_id":"cc6ba828-6fa6-4b12-b88d-7d5097de5b10","resolution":{"observed_at":"2026-08-12T14:24:00.737473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:24:00.465856Z","title":"Schemoe: An extensible mixture-of-experts distributed training system with tasks scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:00.465856Z"},"links":{"citing_paper":"/paper/2411.15419"},"observation_digest":"sha256:2907c6ba427646704601595dd9b0dfa26ca0ec23ad8785c4ac3f323ebeae2799","observation_id":"a263021b-5801-415c-ab26-56f647fab923","resolution":{"observed_at":"2026-08-12T14:24:00.465856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15419","last_updated":"2024-11-23T02:41:34Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-12T14:17:23.867496Z","submitted_at":"2024-11-23T02:41:34Z","title":"Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2411.15419."}