{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8018deb745b46cf9bef13981899faba394eed1f65d10a774827907dd8b11b141","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:04:51.571500Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T01:06:46.426582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:07:44.209146Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"cited_work":{"arxiv_id":"2508.09591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09591","snapshot_observed_at":"2026-07-11T01:07:44.209146Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","venue":"cs.DC","work_id":"02e34a1d-f4ff-4128-bd72-95222e27acb6","year":2025},"citing_paper":{"arxiv_id":"2604.27844","last_updated":"2026-04-30T13:29:59Z","snapshot_observed_at":"2026-08-11T15:39:24.717327Z","submitted_at":"2026-04-30T13:29:59Z","title":"ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T05:22:35.487173Z"},"links":{"cited_paper":"/paper/2508.09591","citing_paper":"/paper/2604.27844"},"observation_digest":"sha256:8015db67cb5d7c216fed4a3c36d5aebff1b1e9e32c6a09e3a41cbd407c52fe4c","observation_id":"3d3fa414-138c-4c95-845e-f8435ce927ce","resolution":{"observed_at":"2026-05-12T10:36:30.633632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"cited_work":{"arxiv_id":"2508.09591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09591","snapshot_observed_at":"2026-07-11T01:07:44.209146Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","venue":"cs.DC","work_id":"02e34a1d-f4ff-4128-bd72-95222e27acb6","year":2025},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-31T18:13:20.224549Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T13:43:17.950000Z"},"links":{"cited_paper":"/paper/2508.09591","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:8e57213d79e8836713096771d4bf577b0b5b2df9cac36fcf0b0324e5536ae6dc","observation_id":"1b663c6f-23fb-4918-84fa-57d389092cb0","resolution":{"observed_at":"2026-07-08T13:44:54.933618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"cited_work":{"arxiv_id":"2508.09591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.09591","snapshot_observed_at":"2026-07-11T01:07:44.209146Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","venue":"cs.DC","work_id":"02e34a1d-f4ff-4128-bd72-95222e27acb6","year":2025},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-31T18:13:20.224549Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T01:06:46.426582Z"},"links":{"cited_paper":"/paper/2508.09591","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:6279505a83f4c7346ec5c513941f98e80b0e4db2e8576b5dee8436cbb2e391e1","observation_id":"e1c042cc-f0e7-43ee-87af-608aeeacf1a7","resolution":{"observed_at":"2026-07-11T01:07:44.237527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.09591/citation-record","integrity":"/paper/2508.09591/integrity","json":"/paper/2508.09591/citation-record.json","paper":"/paper/2508.09591"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.443267Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":"fdacdea2-854a-47cc-a0d9-342367a8bfa4","year":2016},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.307636Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:5ab87f17e7348df33cef261d83c8adfee4a0c31f0a758ea79b9d44d65378d411","observation_id":"1cb75582-0214-4189-b99b-4aefa2ff262d","resolution":{"observed_at":"2026-08-05T21:04:52.466256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.391034Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":"f9d90f86-c0b0-4c06-9159-ea8893a12b52","year":2020},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.313212Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:76341ca7b4218485cacc4eb798ae22c23dfafbff5ce400af10bbd0057c09926f","observation_id":"bd7a2b6a-3511-405f-9107-436b990b1f71","resolution":{"observed_at":"2026-08-05T21:04:52.411606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T21:04:51.318582Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.318582Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:e854f4ab8ffb9382265db560fc351a5dec4a53048f0c60e8fe631688a97ed5ee","observation_id":"97ee3d29-b70b-4ec7-a2f6-2e4424528411","resolution":{"observed_at":"2026-08-05T21:04:51.318582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T21:04:51.324759Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.324759Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:c76c21645f4fb6fee83c7f1a04fd218069e251fac6332b6255778e585c4222a4","observation_id":"0fe12440-a22f-44c7-8e7f-4c35e2ab370c","resolution":{"observed_at":"2026-08-05T21:04:51.324759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.360267Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":"34661345-e7e1-4434-8ca2-423eb0fb9441","year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.331758Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:434fe15db1e2847b98f8dfbac903f5a322b896746735e036ec2d778cbbec35e9","observation_id":"a4dd5e64-513d-4883-b2d9-6e0ba4258259","resolution":{"observed_at":"2026-08-05T21:04:52.372176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-09T06:38:13.784365Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-08-05T21:04:51.339338Z","title":"Jetmoe: Reaching llama2 performance with 0.1m dollars,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.339338Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:008b3e5c243e617df9682c6f702e40fb276622dc3892607a88a912f4c3389e02","observation_id":"7dfca171-e8f1-4f89-8175-4a349e2d0941","resolution":{"observed_at":"2026-08-05T21:04:51.339338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T21:04:51.347798Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.347798Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:eb11b75ce83f33089ec5fa39043b906969f14fbf903fb0f9c80afe544dbbaaac","observation_id":"430868f8-87b8-4556-9d26-4990572789cb","resolution":{"observed_at":"2026-08-05T21:04:51.347798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.330429Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":"4f37a268-6890-4482-b93b-2b0bbe7648be","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.354950Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:13ddea108c39f697484f7222b69fe441c37e6ee90885e4ab1353fdc43a5e8e28","observation_id":"98f84a7c-d2dd-4677-9c33-c5124866eb79","resolution":{"observed_at":"2026-08-05T21:04:52.340459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.303715Z","title":"Gating dropout: Communication-efficient regularization for sparsely activated transform- ers,","venue":null,"work_id":"7c19066f-f140-4671-9030-b1dfd174ede8","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.361002Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:834342b73061754d256c01ce7be34763189a54bdb4a3a28fafa71cdf91a4dd71","observation_id":"1dbc42e1-3ad6-4281-a3ac-c575fe6d2756","resolution":{"observed_at":"2026-08-05T21:04:52.312401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.279716Z","title":"Accelerating distributed {MoE} training and inference with lina,","venue":null,"work_id":"8c88da62-cd10-4a73-9010-e6d3be2a227e","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.367266Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:a65368267c586a03bc828b5f182c5e7314c5e1cf00d6773a65de054147b25faa","observation_id":"edf06073-732f-481a-bcd5-0f03954ef7b7","resolution":{"observed_at":"2026-08-05T21:04:52.288439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.374061Z","title":"Schemoe: An extensible mixture-of-experts distributed training system with tasks scheduling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.374061Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:423921097345462dc3a270076a613dfc130ddf97b42925616da5e38e0ed99a5a","observation_id":"1d81ebaf-5a67-4147-9d8b-bd9b15b36c14","resolution":{"observed_at":"2026-08-05T21:04:51.374061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.242691Z","title":"Fsmoe: A flexible and scalable training system for sparse mixture- of-experts models,","venue":null,"work_id":"7cfa8cd1-92d9-476c-8680-99eb5541ccdc","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.381629Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:a14fd265dc39a935521a8e3ae81865e6f92a3b4f7846b20b83acf63d4a269a45","observation_id":"2fc967ab-b6c7-41ab-ab82-f029d9c621f5","resolution":{"observed_at":"2026-08-05T21:04:52.249782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.222175Z","title":"BASE layers: Simplifying training of large, sparse models,","venue":null,"work_id":"abf6beda-092d-40d6-80f0-add674df23b7","year":2021},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.387518Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:425fd377c6c44dd51dab3c1349f2919628eb9786598be04e9d9fbf92dd04eba3","observation_id":"e678a3c3-96b4-4565-926c-a2cb7352bde7","resolution":{"observed_at":"2026-08-05T21:04:52.229381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-07T01:23:19.488468Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-05T21:04:51.395288Z","title":"Mixture-of-experts with expert choice routing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.395288Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:266d2710cb941b8bfce85f562364f2b7a7d85db874f4c23bacc494d6d78ff9ae","observation_id":"dcb4c457-3d14-4810-a4f7-d4f4eb7b5871","resolution":{"observed_at":"2026-08-05T21:04:51.395288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.202686Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":"90b67e24-301c-4763-91fc-94e0286c54d0","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.403226Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:4361e39ba555f028f33d13ffad98c7b0361767f74cdac6d5098337ba286c09f3","observation_id":"b04c30a7-1cee-46c6-9058-e4f228c2d156","resolution":{"observed_at":"2026-08-05T21:04:52.208055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.170190Z","title":"On the representation collapse of sparse mixture of experts,","venue":null,"work_id":"1a68a9a0-bd28-4177-9cc2-abf008e1cdae","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.408738Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:f0b0db74b2e477cffb00258037d8266a21ee00e0125626c63d816c5ff06980c8","observation_id":"fca64878-a51f-4498-84d0-b9e636da083e","resolution":{"observed_at":"2026-08-05T21:04:52.181226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-10T23:31:51.746878Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-05T21:04:51.415891Z","title":"From sparse to soft mixtures of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.415891Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:2def29f52df6e7e44fc45f5ae5b56d001db2822c3c7033cbdd775abb5234d9ab","observation_id":"a9b30a42-7534-45c3-a6b9-c85f4cd04e63","resolution":{"observed_at":"2026-08-05T21:04:51.415891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.145812Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation ai scale,","venue":null,"work_id":"c97069c1-b5ca-4509-9db7-18e0f9a5b4bb","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.423312Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:51d3e47d6a7a82f721ea93e409d2848151964fa7acaee4aa2c1d31d36f7f22c6","observation_id":"afecca68-c281-4afa-bcc9-02bfd9cc36f1","resolution":{"observed_at":"2026-08-05T21:04:52.151690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.127003Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":"a8145b85-8f49-4ed1-a7d7-37acde5d1e1a","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.431842Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:e6fee58905025c66462b9a81eb614fe47ab69107285d4205a98bf7bcc1df2c8d","observation_id":"c507ad06-8e9b-46b5-aff5-8393a810ed2e","resolution":{"observed_at":"2026-08-05T21:04:52.132386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.103019Z","title":"Bagualu: targeting brain scale pretrained models with over 37 million cores,","venue":null,"work_id":"e5dbd0f6-8d6c-48fe-843e-79827d6a39e2","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.439613Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:fd9cabc926cd7f76cb17cf3bcb1d5f43a2f74ccccc4012cddd37cbe7061e9d64","observation_id":"4b445470-b14e-47b9-9cb9-7e3d78bb1883","resolution":{"observed_at":"2026-08-05T21:04:52.110429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.078122Z","title":"Faster- MoE: modeling and optimizing training of large-scale dynamic pre- trained models,","venue":null,"work_id":"a1a06310-7e71-4266-a580-63d47bd8c9ce","year":2022},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.446137Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:ef8ca386b2a814bad25ed2fe2ee7166dd4f73ae2c21ee3f1b6f050b1638df2f0","observation_id":"de2d75d7-950d-4dd5-9a92-4c387e5f0251","resolution":{"observed_at":"2026-08-05T21:04:52.086717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.050603Z","title":"PipeMoE: Accelerating mixture- of-experts through adaptive pipelining,","venue":null,"work_id":"dfd8aa04-8412-406e-a297-f755cb32184e","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.455108Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:2df39da9774459eaa3e5648572b2cafefaa8e16da660185236937fb9e705577a","observation_id":"0da1faa3-4a03-407e-873e-fc637cc5a4a1","resolution":{"observed_at":"2026-08-05T21:04:52.060197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.028597Z","title":"SmartMoE: Efficiently training Sparsely-Activated models through combining offline and online parallelization,","venue":null,"work_id":"3e8c7f42-fe17-49b2-925f-da9020bf0be0","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.462127Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:0de7d7b772f530cbf99b27d5630751f4623d9d60c7808483ccb6b08ab2a6d6a2","observation_id":"3be2d0c8-b444-4139-ac1e-7be7179b9241","resolution":{"observed_at":"2026-08-05T21:04:52.034297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:52.008519Z","title":"Janus: A unified distributed training framework for sparse mixture-of-experts models,","venue":null,"work_id":"e18d2659-98df-4d55-b419-bcf408ff20b5","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.474427Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:dad5540da609babb8d45d8b8e54b76448cecf93b652325011f2d2bf688f5d4e1","observation_id":"f28ca483-ff35-4eb9-9518-2f6a846ce2b8","resolution":{"observed_at":"2026-08-05T21:04:52.014066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.987842Z","title":"Parm: Efficient training of large sparsely-activated models with dedicated schedules,","venue":null,"work_id":"7f4fc39f-cf38-4c99-a1c4-b8749b64d43f","year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.482427Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:1803bced3ec25bf6816d9331d9c390a2143b2d750c0f72d1182e58e51dedbee6","observation_id":"d700887f-d7c4-47c4-88e5-1275501fc589","resolution":{"observed_at":"2026-08-05T21:04:51.994739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.494649Z","title":"Cen- tauri: Enabling efficient scheduling for communication-computation overlap in large model training via communication partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.494649Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:f22eba8445bb81189d9dbc86346db4d9decab80b3a32b2cfdd86a97b4b56117b","observation_id":"e83c30be-0e0e-4733-b8b0-d1a15fbda6a4","resolution":{"observed_at":"2026-08-05T21:04:51.494649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.955547Z","title":"Lancet: Accelerating mixture-of-experts training by overlapping weight gradient computation and all-to-all communication,","venue":null,"work_id":"e3487a0b-fe3b-451f-96f1-5f84719e7087","year":2024},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.500807Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:b0862409cf49f31e971f1524144787e6e0593d2f9dd69e1c0f23e3c3af4a347d","observation_id":"1f78ca91-8299-40b5-a666-3600dde75cd9","resolution":{"observed_at":"2026-08-05T21:04:51.961310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.939361Z","title":"Sp- moe: Expediting mixture-of-experts training with optimized pipelining planning,","venue":null,"work_id":"f8834289-ac6c-4b84-94aa-dc40b431839f","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.509667Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:0ba076d4c384ff6f5c4bbae1f5241bf8d9f54fb642eec83731929084fa96d7e2","observation_id":"90e812b6-c3eb-474b-b727-262729d7fd02","resolution":{"observed_at":"2026-08-05T21:04:51.944284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.922623Z","title":"Mitigating contention in stream multiprocessors for pipelined mixture of experts: An sm-aware scheduling approac,","venue":null,"work_id":"0135d7a1-f36e-4e62-a68d-d75af9850a9c","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.515751Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:ac54b328cfb021a85bd69029f7dcee046987a4fa499505f2b2806b3730e66869","observation_id":"2e5e7af2-e2d4-494e-bb9d-d8e6afcc504a","resolution":{"observed_at":"2026-08-05T21:04:51.928112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.905151Z","title":"Mast: Efficient training of mixture-of-experts transformers with task pipelining and ordering,","venue":null,"work_id":"7ee8d99c-b709-4e4d-9cca-188c9bd2b81a","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.521028Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:32d9c9baf7341725f81c8bc4e237cc9c11f9ae1a2b6bf97e4f765fe6d1a7c02a","observation_id":"a5eef799-1339-48b1-9d7b-3df5b2c750bb","resolution":{"observed_at":"2026-08-05T21:04:51.911072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.887277Z","title":"Scheinfer: Efficient inference of large language models with task scheduling on moderate gpus","venue":null,"work_id":"35858bce-2822-4df4-9f2b-18bb36cd1f87","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.525705Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:eda9c96a91fdf2629e39fbbda45c933c77d2ec06972bbb5900cf7e024b1b7799","observation_id":"cb13c37a-e101-4934-a63c-04708b943edf","resolution":{"observed_at":"2026-08-05T21:04:51.893405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.869141Z","title":"Data center tcp (dctcp),","venue":null,"work_id":"49443657-fb6e-4813-841e-cd2d7ed470e5","year":2010},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.531999Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:078e2a98959358a25bdf4e86e2f63d1f0cf3f3812005eecaa2753f07527225af","observation_id":"a549a193-b524-4e4a-ad17-7e8d658ebdc4","resolution":{"observed_at":"2026-08-05T21:04:51.874271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.849459Z","title":"A scalable, commodity data center network architecture,","venue":null,"work_id":"5903d09c-4049-4247-b5a4-737fc57623ad","year":2008},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.538271Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:83eea8bf5bad5891e99998a0c790049be019f8c1fdbb005a397882468dc2d033","observation_id":"ae1b1ddc-afa8-41cd-956e-31be9d4bd519","resolution":{"observed_at":"2026-08-05T21:04:51.856828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.830913Z","title":"{TopoOpt}: Co-optimizing network topol- ogy and parallelization strategy for distributed training jobs,","venue":null,"work_id":"40ee8e94-df4a-4717-b746-ae709fe19134","year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.544173Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:a1c3354c41a396e35262e89c4439db534e693476270ccf53eb0a4a3743296f13","observation_id":"469e70d0-d164-4a92-9ac2-e8330ed989a4","resolution":{"observed_at":"2026-08-05T21:04:51.836229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.807993Z","title":"Insights into deepseek-v3: Scaling challenges and reflections on hardware for ai architectures,","venue":null,"work_id":"baf9d962-3e84-47d1-9974-f473985496af","year":2025},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.549688Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:845aaa90a234c4d0ba975e6f301dd7a3890e546b72ee9883fc554d46171156fd","observation_id":"338d7657-7a2d-4e0e-b118-399e3b83cc26","resolution":{"observed_at":"2026-08-05T21:04:51.814898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.785328Z","title":"Large scale distributed deep networks,","venue":null,"work_id":"59c4983a-4aac-44ad-a0c2-edae309e4550","year":2012},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.554736Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:8db36afb30770be7451e327b69f6b34fe4a29d170733b65ce1c5b95fa48eefc1","observation_id":"0647cf00-4a4f-47e2-af54-efd24a285ebd","resolution":{"observed_at":"2026-08-05T21:04:51.791727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T21:04:51.559842Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.559842Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:605d27cd616052a7543d9934c9eaa6342cbedb768b8c8a535ecfa48f9571185f","observation_id":"9ba23427-8128-4646-99b4-5e853ce4bb3b","resolution":{"observed_at":"2026-08-05T21:04:51.559842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.565480Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.565480Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:9d594c323d6fb56b4a1932e6cf45b23fcefa35af3730e057f1d8d95a50020e8c","observation_id":"752da9a0-9f57-42cf-bd63-9ff8691ede32","resolution":{"observed_at":"2026-08-05T21:04:51.565480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:04:51.746814Z","title":"\\ell 1, p-norm regularization: Error bounds and convergence rate analysis of first-order methods,","venue":null,"work_id":"a1c76df4-2795-4382-9e9b-1152dd0cf847","year":2015},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.571500Z"},"links":{"citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:2e95627a15446eaeb8a68a077dc9daa84ae52f75d590ffe79ec06ca4a107ba2d","observation_id":"fdaebd7e-20d1-46c9-b8bc-29853dd642da","resolution":{"observed_at":"2026-08-05T21:04:51.754885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-10T12:47:28.180558Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2508.09591."}