{"as_of":"2026-08-05T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59a155ef1816d4ff63b3e4d6e7c7f1a3478c4eda29abd168f457bab19d228a22","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:08:45.674652Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11005/citation-record","integrity":"/paper/2605.11005/integrity","json":"/paper/2605.11005/citation-record.json","paper":"/paper/2605.11005"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:03eec5d018b6dfbf5da7fe163e6bd4bce2ae923cb7942aead51c409aef14cdf4","observation_id":"aebdcfe5-452f-4924-b6c2-c0b6590d1602","resolution":{"observed_at":"2026-05-13T01:52:06.281680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How to scale your model","venue":null,"work_id":"0a659bf7-cbfb-439f-9c77-76fc04b5907b","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:7cc27288e443eebe88ebd4555c1c2e92963ba83723ec58da3bf2379ef20ed485","observation_id":"7dcc398b-bd0d-4ff5-8772-068acdc300f8","resolution":{"observed_at":"2026-05-13T15:37:56.298164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm: Scal- ing language modeling with pathways.Journal of Machine Learning Research, 24(240):1–113","venue":null,"work_id":"3666415a-d6cf-4caf-9154-38be0a24df7a","year":2023},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:a7a3138fc6198852bb12c2f7a46032eb9bf5f764139cb89cfc74fe74cd9416b0","observation_id":"ad84c46f-19a8-4e99-afbe-af49b4e3bad8","resolution":{"observed_at":"2026-05-13T15:37:56.308017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-07-11T03:27:46.973573Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:4b0c4583dca49043a45c6dc5ff4b3374ecce5c04033c7250ed9f1350e93c661c","observation_id":"440705cd-1d65-408d-8836-c2f16e5a10ce","resolution":{"observed_at":"2026-05-13T01:52:06.290764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344– 16359","venue":null,"work_id":"f44733b6-22ba-464a-8650-a8dd1379b711","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:6d594db130421bec31bfc7ac68135ab4ee02ba987b20e9133dd0b34b71939e68","observation_id":"c6cac2c0-d909-4658-acc6-6e3f731cd78a","resolution":{"observed_at":"2026-05-13T15:37:56.296073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-V3.2: Efficient Rea- soning & Agentic AI","venue":null,"work_id":"9ab0eb29-413b-4ab6-b53f-7ff87c5dac2a","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:9e45fd24abda3dbc16bdc40474b91422324a89515ce723b4729f9bbdf5d704e2","observation_id":"f8fea870-9ac5-4cce-b290-d947184e47ed","resolution":{"observed_at":"2026-05-13T15:37:56.302243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:1538f678c1807c40d6023a19dc51c6fc61870f98984ec383de29696ad4faaf0f","observation_id":"358437bf-f23a-425e-a1fe-dcc5291b1a13","resolution":{"observed_at":"2026-05-13T01:52:06.285496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-V4-Pro","venue":null,"work_id":"f45d7f4e-60bc-41d2-8e14-18d15919d47d","year":null},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:0cf2fcda1aae867fb7e7193eda4433bcde0a1718db5bf08bd570cad91b457b28","observation_id":"34496c21-5e53-4b4c-8895-eb305d063f37","resolution":{"observed_at":"2026-05-13T15:37:56.305885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:46:03.503056Z","title":null,"venue":null,"work_id":"2570d5e1-b731-46ee-b40b-de6f5541763c","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:2d9f31c9129dba609b56258d33395e304b8eff595ba45097381afaef4d298891","observation_id":"5a95d605-3335-4f26-acd1-a9de55694189","resolution":{"observed_at":"2026-05-13T15:37:56.300363Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.638286Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39","venue":null,"work_id":"34699817-8561-4043-bbe1-445a0c93266b","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:b102264db36c911db21bf66b39c462950ece030d1b05906647725e7426a41e9e","observation_id":"562c5fe4-d1a5-46a2-a578-6b5445df2af2","resolution":{"observed_at":"2026-05-13T15:37:56.304154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rdma over ethernet for distributed training at meta scale","venue":null,"work_id":"db480c16-2501-4809-87e9-0d0b39e30c80","year":2024},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:deaf120b58c412b24a7c2610e0d398ac0ab9de5e1bb3589a5c92906e81802de5","observation_id":"9f0d9c14-fcc4-44d8-a35c-6ae26fb3c8b0","resolution":{"observed_at":"2026-05-13T15:37:56.314748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gurobi Optimizer Refer- ence Manual","venue":null,"work_id":"60832b9f-05d1-4914-99bf-4f8e17749b4d","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:2bdb5d296ba7427fa04e415fb1731aa274fff30885c3d8949570a316ba681c60","observation_id":"24811c06-76d2-497e-b814-611c2103168f","resolution":{"observed_at":"2026-05-13T15:37:56.327526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faster- moe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"a7492de1-028b-40fd-9b4f-a9a345862bd1","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:dcbd188cbf343e3b0c59005b8203f84bd3a63b862f2230ca44de940a17a438d9","observation_id":"31c25f9a-cd6d-457d-833b-dd72254ad402","resolution":{"observed_at":"2026-05-13T15:37:56.323301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03382","last_updated":"2023-06-05T15:05:24Z","snapshot_observed_at":"2026-07-06T13:18:20.583926Z","submitted_at":"2022-06-07T15:20:20Z","title":"Tutel: Adaptive Mixture-of-Experts at Scale","version":2},"cited_work":{"arxiv_id":"2206.03382","doi":"10.48550/arxiv.2206.03382","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03382","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":null,"work_id":"96d1130a-f636-4196-b910-d4bb0cda5d38","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2206.03382","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:f7ba7c8a0ce243f40d99ccd66c99675809cdc49675f2b4a6df89cc2b2f84a4a2","observation_id":"f2b8a846-bafa-4f14-8e93-07b7e100dc46","resolution":{"observed_at":"2026-05-13T01:52:06.277646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-11T03:27:47.028679Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:2858ee5deb2c396a3015a1795291fdf90629467c319dbfc877df0e1ee82a73a7","observation_id":"291ec63e-62cd-43b9-9d5e-69350b2893f7","resolution":{"observed_at":"2026-05-13T01:52:06.272279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lancet: Ac- celerating mixture-of-experts training via whole graph computation-communication overlapping","venue":null,"work_id":"6465346d-b2ae-4a51-8a77-722b9b67784d","year":2024},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:b83939f177a0ae3a3b4f184b19a27e59ed47fb921a44eebc684d993d2a3ccbf1","observation_id":"469beba8-fdb0-4bfa-ab62-388712c83e9f","resolution":{"observed_at":"2026-05-13T15:37:56.311364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-07-11T01:07:44.079601Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:b1347f07fdcf23034e9069afec159f6cde17f497a78671a97e46338c8387c34b","observation_id":"64e9bf8d-1191-42e3-8bf3-5331e5fc557a","resolution":{"observed_at":"2026-05-13T01:52:06.267382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effi- cient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"bb0d8ec7-e761-4934-a7f8-8ce24c817c6f","year":2021},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:1217bbca52a06b658d1f248012ee6c8936873add5796f33fd1d2144fb8ff98e6","observation_id":"d6d8e3c2-96c1-4d9b-9405-f224e717c459","resolution":{"observed_at":"2026-05-13T15:37:56.325404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34774e36-7e69-4c2f-a038-3a90395d10b9","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:3dd4410d54607da11ce8b35a9e4c2c3ac50db2c22be05436117a3c5279ba6d88","observation_id":"a71ff0ab-06ba-490f-9062-702bbad22494","resolution":{"observed_at":"2026-05-13T15:37:56.329776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpudirect","venue":null,"work_id":"f8d20458-d3b8-4d7b-b814-ac35ffbe87ea","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:0a2cafbfd2af21dfebd4042909207566a39288354bdabd68ff7c6d0d3619742d","observation_id":"e3b72b4b-e879-4d75-b947-8afbbf433e52","resolution":{"observed_at":"2026-05-13T15:37:56.319948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.6-Max-Preview: Smarter, Sharper, Still Evolving.https://qwen.ai/blog?id= qwen3.6-max-preview, April 2026","venue":null,"work_id":"f14b9df5-48a0-47b5-bbc0-f2030d41a1f5","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:29c6fdc2df4db4df40bd0a4c186f7da70e2d6ff262e08ce360ee1bb5809aa330","observation_id":"37455ec6-c554-4fda-b123-161ca2bd9e29","resolution":{"observed_at":"2026-05-13T15:37:56.321638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations to- ward training trillion parameter models","venue":null,"work_id":"2844e653-d6ce-4970-b77e-821593a43c95","year":2020},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:9c17525cd93ae8fe59a4dc14c1e1b5dab84bb820be2a540c6846488bbc63378e","observation_id":"52c09602-f2cc-4157-85dc-24756a24e5eb","resolution":{"observed_at":"2026-05-13T15:37:56.313069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed- moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"224b72de-0138-40b5-bdd5-32d015304ec9","year":2022},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:1b5736c6b498591204b50790990f246ce4898794821aa824f1517e42b36d29da","observation_id":"0e3c1a85-a240-4e36-aef7-4a68a2634908","resolution":{"observed_at":"2026-05-13T15:37:56.333609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimiza- tions enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"7efb5f6c-b477-4a43-9c7f-8608307e89d8","year":2020},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:9fce4575d5f5c3c0e59e1f439cb196b609e3278596c58725e1c6a80e096d7fcb","observation_id":"6c647e50-7c77-44a3-9442-323c1842a05e","resolution":{"observed_at":"2026-05-13T15:37:56.318384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-11T01:07:45.051014Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:29b093045fadbeb7c60beaf41f4c1d31ffd5e2ff9eb0a23bb293206942eaaebe","observation_id":"4c38a204-3f27-4a73-ae70-095a475b2331","resolution":{"observed_at":"2026-05-13T01:52:06.252088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-10T16:37:23.051852Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:27d8bfd4c48a5698d443e3718ab89e450488a50c5d66f638f3cf89b575f85be9","observation_id":"92273d03-1919-459f-ab1b-c8582ff96caf","resolution":{"observed_at":"2026-05-13T01:52:06.257115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c74df211-96cf-4843-acb6-c99c5dbe4be2","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:12ff2677e3f8300190ef032642a295eac471626d5ce535bbd204cb7519b376a5","observation_id":"5b00ccb4-b1bf-497b-8796-be7cb6477e33","resolution":{"observed_at":"2026-05-13T15:37:56.316616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:04.133294Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":"69bba8c6-3bf5-4659-8e8c-554621837811","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:9a2e3cfc4a55c24e98859f52d5d2161457727dc3a5175398fa69a49bad888817","observation_id":"3835351e-ca87-49cd-b9d7-c69c61818247","resolution":{"observed_at":"2026-05-13T15:37:56.331755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.19427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:57:51.403461Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding","venue":null,"work_id":"d7a679b9-43e8-471f-886d-74df09e8fab3","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:7fa1413b04e4a182bd53e0630393f86d524f4913483b50dea57f08bdd1293b35","observation_id":"fe4922be-c04c-4182-b474-c20a7d6b2731","resolution":{"observed_at":"2026-05-13T01:52:06.240580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03871","last_updated":"2025-04-04T18:55:52Z","snapshot_observed_at":"2026-07-06T21:04:38.019194Z","submitted_at":"2025-04-04T18:55:52Z","title":"HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs","version":1},"cited_work":{"arxiv_id":"2504.03871","doi":"10.48550/arxiv.2504.03871","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03871","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"HeterMoE: Efficient training of mixture-of-experts models on heterogeneous gpus","venue":null,"work_id":"d1a5f223-4c92-416a-8bdd-1545f0ca369b","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2504.03871","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:aac08294082c41f43fe5a74a1a47c09f2391db2122adb287f6793f94cde15342","observation_id":"f3d9f39d-42f0-4ce3-8b2b-310170deda5c","resolution":{"observed_at":"2026-05-13T01:52:06.246426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:0ad2f5c9fd6a93d5913706b8cae4a9701bf9b4806e63fedb377117145c405689","observation_id":"307c199e-9c62-4bb9-9766-259a6702aa66","resolution":{"observed_at":"2026-05-13T01:52:06.262175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ebd0f45a-7473-4b73-8e31-813098ae8513","year":2026},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:0222d86979b7858cc0db61e124e218700b7927908d4268dbc8e56fdfee8c7404","observation_id":"672894c3-8bfd-494b-8479-6e3d1980d680","resolution":{"observed_at":"2026-05-13T15:37:56.309595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19811","last_updated":"2025-03-04T09:54:37Z","snapshot_observed_at":"2026-08-04T19:58:12.786343Z","submitted_at":"2025-02-27T06:36:45Z","title":"Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2502.19811","doi":"10.48550/arxiv.2502.19811","metadata_source":"pith","pith_arxiv_id":"2502.19811","snapshot_observed_at":"2026-07-11T01:07:43.884735Z","title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts.arXiv preprint arXiv:2502.19811","venue":"cs.DC","work_id":"fd582629-4ba6-4562-ac30-4d015f0d1886","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2502.19811","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:01e586356e6794ccf4a35bf1129625115c75586ef5dc3eb472d5d917d1fb9868","observation_id":"8d9fa804-e7ad-4d8b-a705-c9d3bf5b0ede","resolution":{"observed_at":"2026-05-13T01:52:06.229386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:4494ea05e41d80ed5ae83a151a1963cf59af1376f22e23bd3e0c64d191cf5300","observation_id":"1e115d64-2bec-4eb5-bf32-d2fdb2272dad","resolution":{"observed_at":"2026-05-13T01:52:06.234637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-03T23:12:06.869265Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":"2504.02263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-07-11T01:57:51.799355Z","title":"In19th USENIX Symposium on Operating Systems Design and Implementation (OSDI 25), pp","venue":"cs.DC","work_id":"26883f2e-5380-48d4-bfe3-a68b38b39a08","year":2025},"citing_paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T01:08:45.674652Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2605.11005"},"observation_digest":"sha256:8d1f4dbd8de01ed8c2eb41c8a1a15042a1da018f019c081f1e4dcf8cd86b645c","observation_id":"503f1b1f-4b25-41c8-a928-54e506617e8d","resolution":{"observed_at":"2026-05-13T01:52:06.223867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11005","last_updated":"2026-05-10T05:57:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T05:57:05Z","title":"DisagMoE: Computation-Communication overlapped MoE Training via Disaggregated AF-Pipe Parallelism"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":3,"verified_exact":13,"verified_fuzzy":17},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2605.11005."}