{"as_of":"2026-08-11T06:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7513cd47d2726d2dfbf7263bc689decbe03ea0ddb8e4bbe55180b6d88d3be995","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:05:55.300522Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10714/citation-record","integrity":"/paper/2501.10714/integrity","json":"/paper/2501.10714/citation-record.json","paper":"/paper/2501.10714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.902806Z","title":"https://developer.nvidia.com/blog/doubling-all2all- performance-with-nvidia-collective-communication-library-2-12/","venue":null,"work_id":"4458faea-8488-49e7-910b-709c1e8665ae","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.113340Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:5f42bc630f491b191e172aee812c210c4cb9fc22437080e6a50e610327ad2c54","observation_id":"6eca6e43-5a8a-4632-be01-fc69e718477d","resolution":{"observed_at":"2026-08-10T19:05:55.906955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.891814Z","title":"Deepspeed-inference: enabling efficient infer- ence of transformer models at unprecedented scale","venue":null,"work_id":"2a53a1f1-db36-4cbb-9b36-84c37d3a0d88","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.117819Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:f3918924762cbb71a04bc8dc41d3151abaa0f6893414df35ad57bb6fbae2850e","observation_id":"7ae7939d-1a8c-450f-ae8a-9912a56d556d","resolution":{"observed_at":"2026-08-10T19:05:55.895967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.121971Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.121971Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:2fbfa3bf8cb6e36a1f7a656a1b5b4a0bc6e1b3cf5e5fce914ccd6862466377e1","observation_id":"a8bf19b0-5037-4016-a15e-e11f7b484f37","resolution":{"observed_at":"2026-08-10T19:05:55.121971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-07T05:35:13.505081Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-10T19:05:55.126143Z","title":"FLUX: fast software-based communication overlap on gpus through kernel fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.126143Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:90736e3d7cab2095cbc8500c7ec08f29c856f8d6bbc157af0267ca81c11ef877","observation_id":"0dfe1503-fe16-4ecd-9e8c-9c6b07ef8dd9","resolution":{"observed_at":"2026-08-10T19:05:55.126143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.873510Z","title":"Centauri: Enabling efficient sched- uling for communication-computation overlap in large model train- ing via communication partitioning","venue":null,"work_id":"1b609071-9616-42d0-944f-2bcbbbc1663a","year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.130548Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:589a067f179cb7fc1bf4015ce4a8b9f7e711ce2fd7ecd946e8fbdb36a91df498","observation_id":"07bbda01-9b0a-45de-a31f-80cd7be94982","resolution":{"observed_at":"2026-08-10T19:05:55.877549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.862598Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"c66a613a-06c0-4999-91f0-209eceeab740","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.134272Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:acb6c63e8b07d1ff8f495ae7ec8e9406936fa59b8db0d725f1e563938992101a","observation_id":"2c3471e6-22bb-4817-a501-5d26b5371634","resolution":{"observed_at":"2026-08-10T19:05:55.866473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.138161Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.138161Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:e1546043a1520860652ae9fe08fa653abeb69165f271966760e5b308cc553916","observation_id":"91b8be49-ef8e-47b9-87da-b812022e2b72","resolution":{"observed_at":"2026-08-10T19:05:55.138161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.845387Z","title":"Stablemoe: Stable routing strategy for mixture of experts","venue":null,"work_id":"dc5f776e-a6c6-459c-a6c4-0340ec6fa4a3","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.141579Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:a320329ed667954516e0da7b8ee69f30a2d9b2bd99eccca14e67330e0f99fc84","observation_id":"96093689-98ff-4c7c-82c8-acc315e8ae4f","resolution":{"observed_at":"2026-08-10T19:05:55.849207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.145012Z","title":"Large scale distributed deep networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.145012Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:d3045433bab387e129f79c8359cdfeea11a151f3820c56118a75c49eae3951c5","observation_id":"a9ed7357-2285-4a41-83fc-f6ff33610287","resolution":{"observed_at":"2026-08-10T19:05:55.145012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.148417Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.148417Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:7f6481fa15d37869a62f4894810e1d7ffd173ecd4f8cc049b0af7f55591d9e92","observation_id":"27b22620-c9b6-4b58-bc38-3cf0ad4ac1fd","resolution":{"observed_at":"2026-08-10T19:05:55.148417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-10T19:05:55.151848Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.151848Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:fd43629be977f16eb6b93dbaaa3e5feb8ef2165142d1e3e5c9634b77061c90eb","observation_id":"b705c846-265e-4b57-8a8f-d58dbca2b99f","resolution":{"observed_at":"2026-08-10T19:05:55.151848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.155744Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.155744Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:b3e0cd5a31a8843e6b82e020cc2c6b8dbc90d4e2814ae39032e9c7e81ef621d5","observation_id":"f150b62a-8c17-4517-afe3-92c62b7d4306","resolution":{"observed_at":"2026-08-10T19:05:55.155744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-10T06:33:13.988909Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-10T19:05:55.159063Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.159063Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:dad839e7b3376b4c6d6474766a99388549d230ac79c0293f07133d2d56781a51","observation_id":"e984d50e-df31-4780-aa12-a2adcb3a7427","resolution":{"observed_at":"2026-08-10T19:05:55.159063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.811543Z","title":"FasterMoE: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"08222c0f-ad52-4925-8ac2-356a1d8cca91","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.163115Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:9c2d672a3e9d723c739b97ed5fa08e48e6fbcdde012594a6ef75b6c70d623e0d","observation_id":"3f4daa76-9012-4571-9e41-e1ff91bc8ae1","resolution":{"observed_at":"2026-08-10T19:05:55.815293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.166393Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.166393Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:8052409ae373b4f4d9467452434de5b7eb812dee686bbdc34b7a180a90c87549","observation_id":"18eda69a-b686-4d42-ba83-a3c27739cd61","resolution":{"observed_at":"2026-08-10T19:05:55.166393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06093","last_updated":"2023-08-25T14:30:45Z","snapshot_observed_at":"2026-08-10T04:19:52.774123Z","submitted_at":"2023-08-11T12:05:12Z","title":"Experts Weights Averaging: A New General Training Scheme for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06093","snapshot_observed_at":"2026-08-10T19:05:55.169824Z","title":"Experts weights averaging: A new general training scheme for vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.169824Z"},"links":{"cited_paper":"/paper/2308.06093","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:e15bbec93a27186f9ae3eda0f46c9105b0f831974c701aa9443132c5247107ad","observation_id":"78f4a3b7-a753-4059-98a5-2809dbed33f5","resolution":{"observed_at":"2026-08-10T19:05:55.169824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.793491Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":null,"work_id":"43a05dcb-c6f2-4784-8bb9-7f09159f9b85","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.173791Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:3939d0b6ebdc16571002c0f5c08342fe2472d9581fbb3d7815c913f6050c13c9","observation_id":"634bc3ae-50d3-473e-a721-10f5ad0a058d","resolution":{"observed_at":"2026-08-10T19:05:55.797394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.782293Z","title":"Breaking the computation and communication abstraction barrier in distributed machine learning workloads","venue":null,"work_id":"da1341d4-0cb5-48c6-bb8f-7683c52c71d8","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.177255Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:4d303e6339cc73076a3e86dcc3801340ed5ec5f5a8a3391debb691165d557041","observation_id":"83246816-fbbf-4c31-8cf4-f1b71791528f","resolution":{"observed_at":"2026-08-10T19:05:55.786294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.770959Z","title":"Highly scalable deep learning training system with mixed-precision: Training ImageNet in four minutes","venue":null,"work_id":"44cd00c9-0259-4809-9f02-e1ff8a2f8381","year":2018},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.180968Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:f2c4fea015deb2b72006e63b31fbf295fd3e54a67e5260298080a98ca71d9f8c","observation_id":"7088d145-0197-4f83-ab97-0eee12afdced","resolution":{"observed_at":"2026-08-10T19:05:55.775383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T19:05:55.184623Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.184623Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:6b26014e857e084ecb510bfa7a3dc39db178337eb3bb88529dd1151dea233607","observation_id":"e201b5e5-da61-4f10-9622-d1c5cf2c216a","resolution":{"observed_at":"2026-08-10T19:05:55.184623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.759106Z","title":"Lancet: Accelerating mixture-of-experts training by over- lapping weight gradient computation and all-to-all communication","venue":null,"work_id":"4ce5f11d-3555-494c-b900-48f55b3acaf1","year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.188654Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:47df9ce09de5c27aa50e10cd1e042f83e6b94ba035115bc65d6da796fc2e8338","observation_id":"fd46062d-05f2-4e73-b91b-3ebd3e54bb9d","resolution":{"observed_at":"2026-08-10T19:05:55.763414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.748257Z","title":"Gshard: Scaling giant models with conditional compu- tation and automatic sharding","venue":null,"work_id":"9b3d4b7a-985f-45fb-adb7-d8e6c88faed4","year":2020},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.192429Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:aa354953948c9b896292164c82d2c343bb7e6fcbf66296ca012bb4c72dad9876","observation_id":"339ab4a9-001b-4c33-a978-aa7fe1876c84","resolution":{"observed_at":"2026-08-10T19:05:55.752070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.737379Z","title":"BASE layers: Simplifying training of large, sparse models","venue":null,"work_id":"baef0f35-e4e8-43fb-83bf-4b7f8714c1e2","year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.196205Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:2e1ac50ea579e05b147f55d9e6413564fcdb2b0cf91a7ab87a35ca8842c1c545","observation_id":"b95e5bc8-9bad-4eae-b600-eddb1a94b54b","resolution":{"observed_at":"2026-08-10T19:05:55.741240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.726320Z","title":"Acceler- ating distributed{MoE} training and inference with lina","venue":null,"work_id":"496b82dc-69aa-48e0-90f1-43634b5f15b8","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.199901Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:4ebd4d108af14ed4eded6bff3df27ffc072b55a2037efa5dc5fbf22612c6e626","observation_id":"8fb7b99b-61d0-48b7-882b-b28145780031","resolution":{"observed_at":"2026-08-10T19:05:55.730249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.713330Z","title":"Janus: A unified dis- tributed training framework for sparse mixture-of-experts models","venue":null,"work_id":"6ab5106c-4337-4b85-834e-dfd12183bf2d","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.203250Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:2339e86f15712c921ba94d094be7d4613989f6c0f96685eb8354d70bab936b2d","observation_id":"71b22f36-7a78-4d02-b6df-3910757c8aae","resolution":{"observed_at":"2026-08-10T19:05:55.717844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.700037Z","title":"Gating dropout: Communication-efficient regularization for sparsely activated transformers","venue":null,"work_id":"855cfa7c-36e2-4051-a323-0129019b1998","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.206956Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:e8f57bac45ff035666a39ed07b8b7d38b020a6dd88ec20bfad4afa5b424888bc","observation_id":"36092380-1151-4b27-8fc5-ccf28957205b","resolution":{"observed_at":"2026-08-10T19:05:55.704357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.686964Z","title":"Modeling task relationships in multi-task learning with multi- gate mixture-of-experts","venue":null,"work_id":"b848e6ea-c5af-471e-987b-7c893bc3e6ca","year":1930},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.210485Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:e7a154070b5bc2917515f705c424bc4346f150a0519bad74425ef7b611f41ace","observation_id":"a3148a43-8b3e-42db-a45f-4a910214841e","resolution":{"observed_at":"2026-08-10T19:05:55.691636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.673292Z","title":"Bagualu: targeting brain scale pretrained models with over 37 million cores","venue":null,"work_id":"a179707f-4965-456f-9434-38f17c609fe5","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.214438Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:6e3ae2dbb553cc0da63690a1ba5c0153690e782f7c96c461294e634a517349dd","observation_id":"ee9cd83a-4fed-4246-ad23-f565fc339481","resolution":{"observed_at":"2026-08-10T19:05:55.678285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.659128Z","title":"Efficient large- scale language model training on GPU clusters using Megatron-LM","venue":null,"work_id":"d8022caf-c577-4f8d-b9ca-9f442949bab4","year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.218354Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:1fed3048ee2a4ba8ad6a11008614c56adbb8105e5d37399c696098ec2b2600ff","observation_id":"f4051df7-4d54-4b72-a120-664d48e2a369","resolution":{"observed_at":"2026-08-10T19:05:55.664058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.640638Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement","venue":null,"work_id":"189474ec-86cf-4245-a91a-134cf569f53c","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.222298Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:7987be2bc976eba82702b0da425586d4b3b54fb55ffdee80d635c068f29ef340","observation_id":"df6aacf6-b731-4fa8-a8e7-6483b5eca643","resolution":{"observed_at":"2026-08-10T19:05:55.645363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14685","last_updated":"2022-11-17T11:30:17Z","snapshot_observed_at":"2026-08-10T12:49:30.614724Z","submitted_at":"2022-03-28T12:32:25Z","title":"HetuMoE: An Efficient Trillion-scale Mixture-of-Expert Distributed Training System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14685","snapshot_observed_at":"2026-08-10T19:05:55.225891Z","title":"Het- umoe: An efficient trillion-scale mixture-of-expert distributed training system","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.225891Z"},"links":{"cited_paper":"/paper/2203.14685","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:288f0134943ea25f58f115144ea18439bcb43903f42a49df056b69b08bf14d89","observation_id":"7a7c8003-d358-44a5-8c97-ee152cf73e38","resolution":{"observed_at":"2026-08-10T19:05:55.225891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.229870Z","title":"Springer, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.229870Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:b5fa6b49ead701ed295e9432901ce3b21c8e38337d3f56f9ff341161a1de6390","observation_id":"5e0c7257-5456-482f-b6bc-294482416b5e","resolution":{"observed_at":"2026-08-10T19:05:55.229870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.619118Z","title":"Parm: Efficient training of large sparsely-activated models with dedicated schedules","venue":null,"work_id":"2c80d361-4a52-401b-85cc-1978fa36d6c5","year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.233478Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:6fa52bca37c87df63b064cc45ce0db33305a3aa32efff59864d37c3431ed4325","observation_id":"1b9e643d-5a85-4770-8283-463e0c0ee288","resolution":{"observed_at":"2026-08-10T19:05:55.623764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.605961Z","title":"Sinclair","venue":null,"work_id":"9b6df812-77b7-449b-a554-503e482306ab","year":null},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.236995Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:5a7af241f8bb7fa1a20149e7eb06c3b3175c3982964a835485b5b764d2d6c867","observation_id":"637c6623-802f-4d7d-94e8-908e7294bf6b","resolution":{"observed_at":"2026-08-10T19:05:55.610245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.592473Z","title":"Differential evolution","venue":null,"work_id":"825c9243-a11f-46c9-a4bf-f6f4806d0c45","year":2013},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.240768Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:db37f6d8b4bbce74ccc03632c64dca0135ba177aa4055572d8a8f8b6ac2c296c","observation_id":"dcf067a7-1b92-4851-b2f1-48df2593038a","resolution":{"observed_at":"2026-08-10T19:05:55.597154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-10T23:31:51.746878Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-10T19:05:55.244443Z","title":"From sparse to soft mixtures of experts.arXiv preprint arXiv:2308.00951, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.244443Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:9b3b1d617ea9f19f87b7017b4f8f3a3d614135958bf2c0e41977c9d9209b650d","observation_id":"97fbd66a-aa5f-4700-a6e9-6a3ee8637a87","resolution":{"observed_at":"2026-08-10T19:05:55.244443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.579077Z","title":"Beckmann","venue":null,"work_id":"21d035e1-4360-499f-92bb-9deb816710a6","year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.248468Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:ea665394f2aeb301d92c283d3dc7ae50b8522f7b0a58224bf9302cfae250d1a0","observation_id":"9527e6fe-90cd-4b97-be65-8a0bddcc8609","resolution":{"observed_at":"2026-08-10T19:05:55.583586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.252114Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.252114Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:70232f18ad44f391659a06797efb13c71f2795bcb84f783fd19c7248aed8b2f0","observation_id":"63a85fec-f237-48cf-a2aa-62c79a08a610","resolution":{"observed_at":"2026-08-10T19:05:55.252114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.555205Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"85b2d02e-c98b-45a6-b6e7-557cad91c8f5","year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.255661Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:02cd7f43a266c664f36e4cc12a39ffa52af392a67d0e3e51c6a5f3cafb255c44","observation_id":"936a2d2d-802f-491f-bae0-7c05ef6573c6","resolution":{"observed_at":"2026-08-10T19:05:55.560292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.541544Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"c2114230-8005-4023-a4d1-1ea5fb34204d","year":2016},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.259055Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:1013858b9165f3da22ab1f013b8deaa4f9f36b85468cc19265eff77e301c79ad","observation_id":"bb688046-91ee-43d3-96bf-356c9dabf994","resolution":{"observed_at":"2026-08-10T19:05:55.546293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.528382Z","title":"Exploiting simultaneous communications to accelerate data parallel distributed deep learning","venue":null,"work_id":"88fe7fbd-14ca-4ee5-9b10-afe1af66c2ee","year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.263102Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:9bfd4ab9e7d7c37ad375c050fb2f63f8d8b5af5b74edf7ec00a4b5d681136584","observation_id":"8829b396-86f2-4407-b2a7-edefdf954dd6","resolution":{"observed_at":"2026-08-10T19:05:55.533093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.513472Z","title":"PipeMoE: Ac- celerating mixture-of-experts through adaptive pipelining","venue":null,"work_id":"febd8380-b4a6-492d-8107-7827e8157dbc","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.266430Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:2e42271ad4de2a9fd544a6dcd44adbf4b582122a806369c61c93d38f254faff8","observation_id":"6cb210e4-3597-4aea-b8ef-2c3ed4f88006","resolution":{"observed_at":"2026-08-10T19:05:55.518217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.499576Z","title":"Schemoe: An ex- tensible mixture-of-experts distributed training system with tasks scheduling","venue":null,"work_id":"64e52cb1-625c-4920-9721-2a809144c567","year":2024},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.269557Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:66d810e105e7d188553ae1904af55912f0c5a7b858866bacbf7db1cf0ea90108","observation_id":"5ade87aa-a439-476f-97d5-c54b1ed5f19d","resolution":{"observed_at":"2026-08-10T19:05:55.504495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.481837Z","title":"A hybrid tensor-expert- data parallelism approach to optimize mixture-of-experts training","venue":null,"work_id":"61f795cc-5a31-4822-bce9-8950bde10dc4","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.273159Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:95813654356ce9a1f4be335687e0e7f1f604f7cb4c27bf522b13cb86b2baff48","observation_id":"3fa568d8-b289-4def-bee2-4f77473dc4e9","resolution":{"observed_at":"2026-08-10T19:05:55.485399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.276366Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.276366Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:1a59bf7d02d2c419a2680bea4f767001b4c7c8c06031c36deef79da6fe1948e5","observation_id":"e9e45f2c-f3cd-4126-b2c9-30360a6bdf08","resolution":{"observed_at":"2026-08-10T19:05:55.276366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.464038Z","title":"Overlap communication with dependent compu- tation via decomposition in large deep learning models","venue":null,"work_id":"78c78765-7dca-4633-9354-a31b44c99bae","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.279486Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:6e03692b02ba0b3ecabbb8454be8f74316d194547dc4c216837109447a98b49f","observation_id":"2b2112e4-8c85-4dc1-85ab-63011375483b","resolution":{"observed_at":"2026-08-10T19:05:55.468097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.453318Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":"dd3ba593-d11a-49ac-aa8d-eabd4ae76225","year":2020},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.282689Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:0ca5c9e33a3192984a36f50d1556ab7ce5e59cfa9367d48644e8e1be8bff9e15","observation_id":"d8952115-49a6-4eb3-8d5f-a75eb3d24060","resolution":{"observed_at":"2026-08-10T19:05:55.457249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03036","last_updated":"2021-05-07T02:38:23Z","snapshot_observed_at":"2026-07-06T11:07:08.503991Z","submitted_at":"2021-05-07T02:38:23Z","title":"SpeechMoE: Scaling to Large Acoustic Models with Dynamic Routing Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03036","snapshot_observed_at":"2026-08-10T19:05:55.285944Z","title":"Speechmoe: Scaling to large acoustic models with dynamic routing mixture of experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.285944Z"},"links":{"cited_paper":"/paper/2105.03036","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:9405d37f9b675e06b1ff0a471aad839c614bdad5ab2a8f23009f0a8634e4365a","observation_id":"3c0f0013-3795-4faa-acdd-7e56b87e99e7","resolution":{"observed_at":"2026-08-10T19:05:55.285944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.442821Z","title":"SmartMoE: Efficiently training Sparsely-Activated mod- els through combining offline and online parallelization","venue":null,"work_id":"cd9731ae-a89e-44e2-8ecc-2d0c9fc7f4f6","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.289368Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:1b5f014546835fb5622d48faf1f6927875c434a8b843490513405773d96a6c41","observation_id":"9c5b9b8b-b453-497a-906e-b1a03ab170a3","resolution":{"observed_at":"2026-08-10T19:05:55.446707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.431123Z","title":"Pit: Optimization of dynamic sparse deep learning models via permutation invariant transformation","venue":null,"work_id":"804a68f7-42ea-435f-afd5-7a392cd264ec","year":2023},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.292629Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:315cff90f0fe30a5e7e9a986b5bedbab8798eaef81fbc5e0c0f3a114a16ba432","observation_id":"d9c12ac6-24df-4160-81c0-2d54e0dd9b73","resolution":{"observed_at":"2026-08-10T19:05:55.435346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-07T01:23:19.488468Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-10T19:05:55.296446Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.296446Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:c0f970e2d9e633582067d1b35d695b28e77af1dbe0f48a371369eff8a013bb23","observation_id":"487fa7b9-974a-45bc-9f95-830f85be3280","resolution":{"observed_at":"2026-08-10T19:05:55.296446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:05:55.417341Z","title":"Taming sparsely activated transformer with stochastic experts","venue":null,"work_id":"8655c7e3-a67d-4bfc-b194-530bf3780336","year":2021},"citing_paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:55.300522Z"},"links":{"citing_paper":"/paper/2501.10714"},"observation_digest":"sha256:1e1f98a6e80142a78265ec0945c631f925b95c6280c3fe0bc620b2ee9352d322","observation_id":"f4b27ede-16fc-4098-bbbe-a828271fcf63","resolution":{"observed_at":"2026-08-10T19:05:55.423266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10714","last_updated":"2025-01-18T10:14:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T18:59:26.636069Z","submitted_at":"2025-01-18T10:14:37Z","title":"FSMoE: A Flexible and Scalable Training System for Sparse Mixture-of-Experts Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2501.10714."}