{"as_of":"2026-07-27T17:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5e4fda8f350c25b4d949033b4dd7923cb7733eb7cba2ef9d65ef58c815cd341","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:20:00.625923Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-27T06:30:09.085275+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T01:06:46.426582Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:07:44.019959Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2605.23764","last_updated":"2026-06-01T05:30:13Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T15:35:23Z","title":"HyperParallel-MoE: Multi-Core Interleaved Scheduling for Fast MoE Training on Ascend NPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T02:49:09.109990Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2605.23764"},"observation_digest":"sha256:960c4a90ee8d8b2dc0018151d18341e0e58c3e7929100f33b0e41f05b77d34d4","observation_id":"d48fd47b-27d9-4071-ab35-5fcddb1f043f","resolution":{"observed_at":"2026-05-25T02:55:16.740757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2605.23764","last_updated":"2026-06-01T05:30:13Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T15:35:23Z","title":"HyperParallel-MoE: Multi-Core Interleaved Scheduling for Fast MoE Training on Ascend NPUs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T15:10:25.071087Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2605.23764"},"observation_digest":"sha256:035686e35dcccb320829cc61db2bea16e990ece000546c77f4c3e46c46b01bac","observation_id":"5aa9ec18-b6ca-4b5e-bed4-515bbe1a9efd","resolution":{"observed_at":"2026-06-30T15:14:46.920212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-11T23:18:22.023874Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-08T13:43:17.950000Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:15fcc6fcfc464974d9e194ad687df46604347c2b649d06c64e7e980698ab9f66","observation_id":"f3be937e-2cbe-441f-aba0-308989d8ae18","resolution":{"observed_at":"2026-07-08T13:44:54.959728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"cited_work":{"arxiv_id":"2604.19241","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19241","snapshot_observed_at":"2026-07-11T01:07:44.019959Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","venue":"cs.DC","work_id":"5d80549d-e185-40c4-9158-d616cb0d4c7f","year":2026},"citing_paper":{"arxiv_id":"2607.06202","last_updated":"2026-07-08T01:17:01Z","snapshot_observed_at":"2026-07-11T23:18:22.023874Z","submitted_at":"2026-07-07T12:25:16Z","title":"UBEP: Re-architecting Expert Parallelism Communication Library for Production Superpods","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T01:06:46.426582Z"},"links":{"cited_paper":"/paper/2604.19241","citing_paper":"/paper/2607.06202"},"observation_digest":"sha256:50dc41d3748beaed022553f6d5b77461b39c8fb3b76d0f28be483cfcff0e3849","observation_id":"a95939fd-7d5f-4ca2-a4a0-cfb70e2bfb7e","resolution":{"observed_at":"2026-07-11T01:07:44.052559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19241/citation-record","integrity":"/paper/2604.19241/integrity","json":"/paper/2604.19241/citation-record.json","paper":"/paper/2604.19241"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:58f290715784e4aa084a232902ccd901438b02850a1e4af72fe45888926b5c86","observation_id":"66da6c2a-8253-448c-90bc-d1da9e8aac1e","resolution":{"observed_at":"2026-05-11T13:06:05.187960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b57049357e37f4e6456def6a7624cda97f71b9176a1d69ba9ac8015cf2156fee","observation_id":"7b8c0ef6-f223-4c54-b625-3e2e11f521ed","resolution":{"observed_at":"2026-05-10T12:48:40.999279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f9662f0b0e05adbc43a72b1334487c72c30d86aaa798ff984955b2d8d87c0df1","observation_id":"ffe8079c-8fd9-4c9a-a816-aab4f65cdc85","resolution":{"observed_at":"2026-05-10T17:49:28.234076Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7801.344162","doi":"10.1145/3437801.3441620","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Sid-Lakhdar, Osni Marques, Xinran Zhu, Chang Meng, James W","venue":null,"work_id":"73714688-414c-4bae-96fe-9be1d689d045","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:6502f10a5e669b660ca1a54e1994e15a9279abd0cc4b7c58024d631dfda057ca","observation_id":"910f05ab-7cef-48c3-8bba-b180ff9a316a","resolution":{"observed_at":"2026-05-10T02:22:20.753701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-07-06T18:28:33.795339Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":"2406.06858","doi":"10.48550/arxiv.2406.06858","metadata_source":"pith","pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-07-10T16:37:23.032697Z","title":"Flux: Fast software-based communication over- lap on gpus through kernel fusion.arXiv preprint arXiv:2406.06858","venue":"cs.LG","work_id":"5d0e6adc-6dd2-49cc-8551-dc00433ed79f","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:52961ede25196681d47bb4c32d913d2467d8039446f2e14fb1eccfe73a573aef","observation_id":"07f0e3c7-1f59-4311-8ea7-3f5818b42a26","resolution":{"observed_at":"2026-05-10T02:22:20.756427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0666.365137","doi":"10.1145/3620666.3651372","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Dtc-spmm: Bridging the gap in accelerating general sparse matrix multiplication with tensor cores","venue":null,"work_id":"cef5f8d1-2227-425b-8638-704a0f51b889","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:d5d3470df45582a1845885692fb5838bc37288a1908d9b6b31029ca7be900ce2","observation_id":"771d797e-eda7-40e0-86a8-aae9ec9c5309","resolution":{"observed_at":"2026-05-10T02:22:20.748411Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yan, Haichen Shen, Meghan Cowan, Leyuan Wang, Yuwei Hu, Luis Ceze, Carlos Guestrin, and Arvind Krishnamurthy","venue":null,"work_id":"bf7548c5-23a4-4839-925d-6214b99a581a","year":2018},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:704a96375f12f7e4321372e889d485e8d13f52774edd864617c210caa1497d31","observation_id":"78b4c38a-26e9-4ccf-9da0-c33aca6dd0b3","resolution":{"observed_at":"2026-05-22T22:55:12.836724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11840","last_updated":"2022-07-19T21:02:48Z","snapshot_observed_at":"2026-07-06T12:32:03.397176Z","submitted_at":"2022-01-27T22:54:59Z","title":"GC3: An Optimizing Compiler for GPU Collective Communication","version":3},"cited_work":{"arxiv_id":"2201.11840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.11840","snapshot_observed_at":"2026-07-02T00:56:25.195580Z","title":"Gc3: An optimizing compiler for gpu collective communication","venue":null,"work_id":"b4cb043a-ed8e-4cae-a668-1047bd650abe","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2201.11840","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:488cd68f3fc467bb71bbfaeba27e15b169c44b747bdaa895bd14bd160f4091b0","observation_id":"f5d1cdc7-da21-4abd-8040-cb29f965e972","resolution":{"observed_at":"2026-05-11T13:06:05.130784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":"2205.14135","doi":"10.48550/arxiv.2205.14135","metadata_source":"pith","pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":"cs.LG","work_id":"efa96825-0830-4cfc-a250-fdaf6af302ab","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:bbc2e80ff587c9d3f1d3ab9c511592651f7cd4adad56ce7aedfbb665e217e26f","observation_id":"9910f007-77b5-4f4b-8e46-21b7e701b973","resolution":{"observed_at":"2026-05-12T16:22:09.323619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 3 pro: Best for complex tasks and bringing creative concepts to life","venue":null,"work_id":"5cd10c49-cdd7-4a0d-bfa4-d2ab2605ee6e","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f0cf28437755d81ce0b99a87fc578f2774e3f24eaf7b126326c4b9c38e539bac","observation_id":"47e2ec53-b33d-4dda-a4ee-7fceb129e196","resolution":{"observed_at":"2026-05-22T22:55:12.778932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek deepgemm.https://github.com/deepseek-ai/DeepGEMM","venue":null,"work_id":"50966009-788a-41cc-b32a-d0ab061efe3b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:7012534ecde879ead49d15734ce10572d5831f4b48886071a7f4684f46cc8f12","observation_id":"94199d36-dc3e-422c-a228-9b211b633178","resolution":{"observed_at":"2026-05-22T22:55:12.775098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EPLB: Expert parallelism load balancer.https://github.com/deepseek-ai/EPLB","venue":null,"work_id":"8614c155-81c4-4a73-89ab-5203fc33d492","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:cdf46ac8324ea00d52de604bde3d7ce92e6c4239d9c4793ba8574b5d3c1c3533","observation_id":"c9c0a81e-f413-4a95-a08f-a5f12a14cd8a","resolution":{"observed_at":"2026-05-22T22:55:12.829774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:fc63d8808cf0ecc35c255735b44c61c957fed95ca31a17ad282314eec0bc8c77","observation_id":"13b002bd-403a-4464-a425-b21586977825","resolution":{"observed_at":"2026-05-10T02:22:20.745599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:c5aa4ddbaa03145f11840cf631c807f1359462d5c48a1f6aa048c6df59932798","observation_id":"628cb1b5-64df-40d5-9e69-67b8842768e2","resolution":{"observed_at":"2026-05-11T05:36:27.707517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:6b05fec9f844d9c76589211b3c907f319021104fb9f4707eb588c258bb54ef1c","observation_id":"380db4b4-2128-4070-969b-2915da0c2679","resolution":{"observed_at":"2026-05-10T02:22:20.777223Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megablocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"45e62493-53dd-462d-9cb9-fb271d1748dc","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:0bf43e7a71a20b5743397fe715b0551111f463a1011318a809700a4d5efab78d","observation_id":"4b2e0c17-39bf-4900-9792-037f915bec17","resolution":{"observed_at":"2026-05-22T22:55:12.801668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"8d0e45d6-6c50-4bff-8812-1e9c8793be32","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:83bd932b8c46a66bd9e8e20e360e2f7d0b7669ab70216a04fd58e7395e6fd6c1","observation_id":"13d1e92c-5aad-42e2-8675-6aaec65d3323","resolution":{"observed_at":"2026-05-22T22:55:12.816689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3222.350777","doi":"10.1145/3503222.3507778","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ISBN 9781450392051","venue":null,"work_id":"a7bdb303-6f9e-48de-a5a4-2ab95f68f24f","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:1feea85c693c75ccc1c604c881cab1856be370be00168a3d98390f3b1d16831a","observation_id":"36a3c88b-7e5a-4c57-a0a4-36ffe714ffa5","resolution":{"observed_at":"2026-05-10T02:22:20.772321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11432","doi":"10.48550/arxiv.2505.11432","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:43.805821Z","title":"Megascale-moe: Large-scale communication-efficient training of mixture-of-experts models in production","venue":null,"work_id":"d2e5a111-b10c-463f-8ca7-b88ca8a6ff29","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ec4ecaa74a649f52380e681036f8d0908954c59e30e3c43e659894f8a74bf8ac","observation_id":"c8233072-779d-42b2-90e7-637e2e63a33a","resolution":{"observed_at":"2026-05-10T02:22:20.792865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:5bae652d6df36103c5f1571db6fe6e0bbc25d28f9e83dcb728b22bd2ca1b9acf","observation_id":"cdc58660-fb0f-4d37-8ca1-a3b6209b69d2","resolution":{"observed_at":"2026-05-10T02:22:20.785190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-07-06T19:30:09.298718Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":"2410.06511","doi":"10.48550/arxiv.2410.06511","metadata_source":"pith","pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Liang, T","venue":"cs.CL","work_id":"d5bcdcf7-c2fd-424d-899d-ee194fbc6266","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:bcf74c69808767c1c8bb106682ebf5f3716e1967b687877d061fef6162813c54","observation_id":"1175d644-e51a-49f6-a538-8ff8ed301a29","resolution":{"observed_at":"2026-05-11T13:06:05.145883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Netmoe: Accelerating moe training through dynamic sample placement","venue":null,"work_id":"2989296b-5a6f-4340-8553-032c5cc8dde4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f5f5949b7014c1ae4a64f0ddfd49495d5982710dd449e843a4af9f89a734e907","observation_id":"df5c352b-b3b6-4374-a2d2-eda39f20e0d2","resolution":{"observed_at":"2026-05-22T22:55:12.826544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:8fb9416e294bc9e04c144b45d5adfc627421493bc50086c8121338ae51972ccd","observation_id":"468dc8cd-76d3-4096-a1e4-0501c6f32fed","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large-scale language model training on GPU clusters using megatron-lm","venue":null,"work_id":"385a9a03-8525-4c2a-aa4e-2b8e95c452b8","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:f674c282d165d64b56afa8894d7e5a7ee43d7f59823464731a2115d3990168b2","observation_id":"8e6b96f6-3b73-4f09-bc9b-d6f8452dec97","resolution":{"observed_at":"2026-05-22T22:55:12.795542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8817.347620","doi":"10.1145/3458817.3476205","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =","venue":null,"work_id":"65666e92-1679-4e6b-831b-29afb00b2254","year":2021},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:89bd6379d4fc777212706185e859dcc6bc6ed50be18cf10fa8e2a4871158c918","observation_id":"c619b48e-c2da-44cb-9325-148fce09a6b2","resolution":{"observed_at":"2026-05-10T02:22:20.764122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"cuBLAS","venue":null,"work_id":"42c693b1-ab4c-4f45-a2de-429fbccfeba6","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:0f57deea41ab41c1d5c4f8271f72eb826f0c421e93b37a25cb03773e4c842834","observation_id":"ab7678e8-03c7-44cc-a8e9-ec61309cf81b","resolution":{"observed_at":"2026-05-22T22:55:12.798348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cutlass","venue":null,"work_id":"fa4b9877-af26-419a-b775-61d7c42d0117","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:7fe7bb7cc078af0044d3509d7e7f2495da028971df2fc1dd6dc788a9a6fa3efd","observation_id":"e148596f-810e-4815-bb3e-248b7bf567b9","resolution":{"observed_at":"2026-05-22T22:55:12.792629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer Engine","venue":null,"work_id":"6e488947-ec40-41d6-8ec1-b5868f7e0fa2","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:85d89727d05bcc8d411684fb768edaf1ecdc6658e31287187257eb1b595c45fd","observation_id":"094117ac-38db-4cea-b24e-266bfe990cbc","resolution":{"observed_at":"2026-05-22T22:55:12.785435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvidia collective communications library.https://developer.nvidia.com/nccl","venue":null,"work_id":"7abc84ab-698d-40cc-a047-35be93b57989","year":2024},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:5f54d8cba752d23559795624fd27d606aba63c5f6fa4dcac148a547e63b49071","observation_id":"46d1206e-8468-49f5-a5ba-ed06f8da8f1a","resolution":{"observed_at":"2026-05-22T22:55:12.833907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVSHMEM","venue":null,"work_id":"8b385ec5-7d92-46b6-aea7-391f8d12f786","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:74504dcab3001e513845fd20fac0733780b9a1b7a3f0ac5e124691c6abd97def","observation_id":"e8a0f742-0bce-4c4e-9b8d-1bfbd8a73121","resolution":{"observed_at":"2026-05-22T22:55:12.813695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cudnn","venue":null,"work_id":"a167c2b1-d3cb-4bcb-a649-bba9ab097823","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:e57fc7582eb2ca9d909d0ab647cbde91366f1560457401526100115b5ca315d5","observation_id":"951a7b2d-116a-4386-9b50-2517f7535b63","resolution":{"observed_at":"2026-05-22T22:55:12.820327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cutile","venue":null,"work_id":"3a21850d-5c4f-462a-a7a3-f510f666f0aa","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:491e78414c0503261f0178f6c3af1b9ef1fc3a055458b468aa686d0714de89a1","observation_id":"4658d62d-678c-48d1-8b22-29e16d82ef1f","resolution":{"observed_at":"2026-05-22T22:55:12.810611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1956.246217","doi":"10.1145/2491956.2462174","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In Proceedings of the 34th ACM SIGPLAN Conference on Programming Language Design and Implementation (Seattle, Washington, USA) (PLDI ’13)","venue":null,"work_id":"5fff4b76-ab05-4380-820d-d41e0e052e06","year":2013},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:eff889932375946de1593da84da2fa8d6eabc1ee46a8ece706d54265e95f7f38","observation_id":"75f7aef6-ff81-4635-b35a-57928430dca9","resolution":{"observed_at":"2026-05-10T02:22:20.769286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation AI scale","venue":null,"work_id":"94dff17c-09ac-45f1-9c71-0bfda63d2f81","year":2022},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:d0167ca08507bc576b255381a991fcf645454e4b71c3c5c467d869872c25bf33","observation_id":"42fd1dae-0226-49cf-99b3-58636af2d7fb","resolution":{"observed_at":"2026-05-22T22:55:12.823485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TACCL: guiding collective algorithm synthesis using communication sketches","venue":null,"work_id":"de90f3d2-de7d-4987-b754-9ebeb4ebe2f4","year":2023},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:d7cd0912b4f3e5aa18371091d77db80724710372678104c39ac52c69c49761e6","observation_id":"a89c9baf-3daf-43a5-91ab-27f9b8ac00d8","resolution":{"observed_at":"2026-05-22T22:55:12.782565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.09014","doi":"10.48550/arxiv.2504.09014","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"13 Msccl++: Rethinking gpu communication abstrac- tions for cutting-edge ai applications","venue":null,"work_id":"7a05854d-4064-4fef-902a-6ecb1680de1c","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:e2d71d1addd881b3e2fedc59ddcf9c05a849056ba196b3a3ccc83618829fdc71","observation_id":"ae709182-f79a-4b0d-bd49-57fd5248c1ba","resolution":{"observed_at":"2026-05-11T13:06:05.160837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:0aa780b6ccae36b0119d6a021bd15e1737cf2e718c431b98dd7f47fabe9cf4de","observation_id":"1fd23176-d698-4b43-b71c-2e2896b225dd","resolution":{"observed_at":"2026-05-11T13:06:05.091271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look ma, no bubbles! designing a low-latency megakernel for LLAMA-1B.https://hazyresearch.stanford","venue":null,"work_id":"bfa8f3e0-a500-49ef-a15a-f7f057a2c21f","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:952d8d9d85bbf7c4cde028397122e0a80950a9f1316b5aab843a68a63d538340","observation_id":"162f04d2-a0cf-4723-a9c3-dfae7f341d36","resolution":{"observed_at":"2026-05-22T22:55:12.840033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tilelang","venue":null,"work_id":"06813f55-1c5f-4613-b157-b781fb2c374b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:baaa276d3a107a6e67ca35f2f0df105c779d808e035dbc33b7788facc0d6c374","observation_id":"9c6593ea-dde3-49fc-bad7-71e36d02c808","resolution":{"observed_at":"2026-05-22T22:55:12.804445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5508.332997","doi":"10.1145/3315508.3329973","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"T., and Cox, D","venue":null,"work_id":"36502ac3-807e-4ab8-ac44-c87017160e32","year":2019},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:798dc9cff38c04a673eae2f4cef0d2be3f6afabaf181e080f94f37efaa757167","observation_id":"4d9a3f9d-d4b2-4089-8bc0-5145c73b963b","resolution":{"observed_at":"2026-05-10T02:22:20.782611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:49:01.192843+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.727485Z","title":"Deepseek-ocr 2: Visual causal flow","venue":null,"work_id":"9886dce9-776e-4ad6-b96c-fbf9037ca41c","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:3401c9490b35265111739ea9cc19cfb1e29ff355988c2ac05eb66ec38c8b14c2","observation_id":"70424c11-e580-4bfb-8637-cc2755e560e2","resolution":{"observed_at":"2026-05-11T13:06:05.154892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mirage: A multi-level superoptimizer for tensor programs","venue":null,"work_id":"99ec650a-994c-4473-9468-eb8d50f98dd4","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:96e94eaa606b77af597ceba7828584fe60ba4c5287fd5d9b686c19ab95dde85b","observation_id":"001275b3-50c1-4502-8acd-9c55eb7af1a1","resolution":{"observed_at":"2026-05-22T22:55:12.807709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03871","last_updated":"2025-04-04T18:55:52Z","snapshot_observed_at":"2026-07-06T21:04:38.019194Z","submitted_at":"2025-04-04T18:55:52Z","title":"HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs","version":1},"cited_work":{"arxiv_id":"2504.03871","doi":"10.48550/arxiv.2504.03871","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03871","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"HeterMoE: Efficient training of mixture-of-experts models on heterogeneous gpus","venue":null,"work_id":"d1a5f223-4c92-416a-8bdd-1545f0ca369b","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.03871","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:ada89dbfb6a8e2d73c5afbd8ec56cbe1cac270f7c7ea5c1b34e8c142db5ca1b3","observation_id":"8d7c778e-2d3e-43e1-a02c-b76f054756b3","resolution":{"observed_at":"2026-05-10T02:22:20.798325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:24:51.239515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:2c264cd98d7dabfcc9eed00128124f05ffbd3a4e80fc7ebb0632dbf29572d274","observation_id":"142864b2-7607-46bb-8820-533d0697d3fb","resolution":{"observed_at":"2026-05-10T02:22:20.787842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19470","doi":"10.48550/arxiv.2510.19470","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Hybridep: Scaling expert parallelism to cross-datacenter scenario via hybrid expert/data transmission.CoRR, abs/2510.19470","venue":null,"work_id":"1654cca3-5615-4233-9af6-809347833f2a","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:60e1513b5585559b2e8f64b2ef0bda116c99d905e9fc7d47fbb7d6010c1d903b","observation_id":"5dbe25a5-b271-4c12-b37a-bcb711a1a898","resolution":{"observed_at":"2026-05-10T02:22:20.780202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01005","last_updated":"2025-04-21T20:10:11Z","snapshot_observed_at":"2026-07-06T20:15:36.280948Z","submitted_at":"2025-01-02T02:02:20Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","version":2},"cited_work":{"arxiv_id":"2501.01005","doi":"10.48550/arxiv.2501.01005","metadata_source":"pith","pith_arxiv_id":"2501.01005","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","venue":"cs.DC","work_id":"a153885b-2460-4177-9053-8d0011adfcb9","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2501.01005","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b1d0c27ff76c9c337dc9b55ece5395cb9a69f7b9479971e00f3753cf57afa423","observation_id":"a56ece74-955e-488a-81e0-21a99ec07a7c","resolution":{"observed_at":"2026-05-16T13:26:34.840430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moeblaze: Breaking the memory wall for efficient moe training on modern gpus","venue":null,"work_id":"ac2916b2-7e80-4307-ac1e-54bc27ad57ae","year":2026},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:fe94faf6a51afac00c1bfeec7a7fa6a6b32393b9969d39d4fb5647e6327c7e5a","observation_id":"314cc047-63c7-4e6e-98a2-028d0fcc62fd","resolution":{"observed_at":"2026-05-11T13:06:05.100544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19811","last_updated":"2025-03-04T09:54:37Z","snapshot_observed_at":"2026-07-06T20:43:31.843946Z","submitted_at":"2025-02-27T06:36:45Z","title":"Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2502.19811","doi":"10.48550/arxiv.2502.19811","metadata_source":"pith","pith_arxiv_id":"2502.19811","snapshot_observed_at":"2026-07-11T01:07:43.884735Z","title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts.arXiv preprint arXiv:2502.19811","venue":"cs.DC","work_id":"fd582629-4ba6-4562-ac30-4d015f0d1886","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2502.19811","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:9c72feba6f8239527441eaf6cb2e55952ac20be9ce6ff75f102f60cd5833e9d6","observation_id":"a66710f6-37a0-466c-82b1-ea015a73c01f","resolution":{"observed_at":"2026-05-10T02:22:20.774941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-07-10T14:57:14.481929Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:1c763cc5813d091de8233fe7ca1306b2208942507d6780daa581a7eb7b4b5e4a","observation_id":"689b5af6-e7a3-48db-8b59-6c774e36567a","resolution":{"observed_at":"2026-05-13T23:49:11.451207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepep: an efficient expert-parallel communication library.https://github.com/deepseek-ai/ DeepEP","venue":null,"work_id":"b6554de8-b892-4333-8b51-f93d0e52f1ac","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:b40a669bf9a5f0c4a22b6e4fe5a0a33041f28b83f92896da0a81ba8f3b4e3adc","observation_id":"f33ca7f4-8bc4-40e8-94b9-493731ae88c2","resolution":{"observed_at":"2026-05-22T22:55:12.789393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19442","last_updated":"2025-06-05T05:48:26Z","snapshot_observed_at":"2026-07-06T21:15:30.520750Z","submitted_at":"2025-04-28T03:09:22Z","title":"Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler","version":3},"cited_work":{"arxiv_id":"2504.19442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19442","snapshot_observed_at":"2026-07-03T07:37:44.599691Z","title":"ISBN 9798331314385","venue":null,"work_id":"f063ecaa-699c-4559-bbba-cd25b4712df7","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.19442","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:213905ae69c73008b84e85e553efed55051ac453e68800dabbc5f1240b838c7c","observation_id":"3ad8e02c-cd63-41e6-a347-8849af033675","resolution":{"observed_at":"2026-05-11T13:06:05.137902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20313","last_updated":"2025-04-03T10:23:19Z","snapshot_observed_at":"2026-07-06T20:58:51.368223Z","submitted_at":"2025-03-26T08:25:12Z","title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","version":3},"cited_work":{"arxiv_id":"2503.20313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20313","snapshot_observed_at":"2026-07-03T03:37:35.982504Z","title":"Tilelink: Gen- erating efficient compute-communication overlapping kernels using tile-centric primitives","venue":null,"work_id":"376b5de0-d796-4431-bbd6-101693b92d95","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2503.20313","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:fed244c5771cdfa18798fdb3d1880688cc672c6d1aee2c5bba0716a6c7ab7a69","observation_id":"bcbaa556-f5f3-49e8-92a6-29a89e3e840b","resolution":{"observed_at":"2026-05-11T13:06:05.170224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-07-06T21:03:26.104352Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":"2504.02263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-07-11T01:57:51.799355Z","title":"In19th USENIX Symposium on Operating Systems Design and Implementation (OSDI 25), pp","venue":"cs.DC","work_id":"26883f2e-5380-48d4-bfe3-a68b38b39a08","year":2025},"citing_paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:20:00.625923Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2604.19241"},"observation_digest":"sha256:a098ebbfc6daac5b45cec898a6b95f4bcfc8c760ba88083c701a62a8e9686815","observation_id":"5ccfd899-b6aa-43a5-874e-954b84295ffe","resolution":{"observed_at":"2026-05-11T13:06:05.120260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19241","last_updated":"2026-04-21T08:49:27Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T08:49:27Z","title":"UniEP: Unified Expert-Parallel MoE MegaKernel for LLM Training"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":16,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":21},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"thesis":"As of 27 July 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2604.19241."}