{"as_of":"2026-08-12T05:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f3d2207a215ff78e6c0509a134a6be499e13f75eab2e98c6d7865379a53510b","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:42:39.573568Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.22541/citation-record","integrity":"/paper/2606.22541/integrity","json":"/paper/2606.22541/citation-record.json","paper":"/paper/2606.22541"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"https://www.mindspore.cn/tutorials/experts /en/r2.3.1/operation/op_custom_ascendc.htm l, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:cfc1373c55ba5b6dc9ee99ce0f00ce06ad599db6f74ef2db1f797942b694a961","observation_id":"4be7d489-df1a-4ba7-b089-ea4b2a5d56a9","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"https://www.hiascend.com/cann, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:69cc901e9dceace82bed88878324dc4b5f6a7ca61671277c9fe8ede19416c761","observation_id":"46952001-3ba0-4468-8b77-6914942ff88a","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"https://www.hiasce nd.com/document/detail/zh/canncommercial/8 3RC1/API/ascendcopapi/atlasascendc_api_07_ 0102.html, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:dc7f183d49c2fcd3f8d08eecbb60af92b16fb3278ccbbf53abb1d37cdc5816aa","observation_id":"35ecc77b-37c4-4f03-a616-725d857c5d5b","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"https://www","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:3018d49011575e6623977fcef52760e6802abacd2e6febc6b688209d7ab59a0a","observation_id":"3b596b1b-d4c9-4107-bf5b-a26d3232bc64","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":"2308.16369","doi":"10.48550/arxiv.2308.16369","metadata_source":"pith","pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","venue":"cs.LG","work_id":"3dbdd757-ca01-436f-acfd-12ffcd6f64c6","year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:2dfaad7553433d122b2ddb041c01f04a57cb808db72d6b1ad55e94109a057ce4","observation_id":"5a4533d2-5f58-4f84-aa5c-5b6e1c69650a","resolution":{"observed_at":"2026-07-04T09:39:46.785034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-10T09:51:12.852909Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":"2311.09431","doi":"10.48550/arxiv.2311.09431","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Striped attention: Faster ring attention for causal transformers","venue":"arXiv (Cornell University)","work_id":"7cc4e141-1418-4a62-bc6a-4e3270436eec","year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:30e24763af8acab934c58d6f9eced9790949522d280f8358a3d80c200fddfd30","observation_id":"7583702a-b018-4649-b582-ea1fa8804ad2","resolution":{"observed_at":"2026-07-04T09:39:46.802503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Characterizing cloud-native llm inference at bytedance and exposing optimization challenges and opportunities for future ai accelerators","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:2c5d101c3faa1364e0d861d3919ad82e29b8ee54f62082b40500b86a5a0cb1de","observation_id":"76cdb926-82c6-488c-8fd9-d9ef18c7b3f9","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Amali: An analytical model for accurately modeling llm inference on modern gpus","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:0ba586def199f047c411b54d7bb4bb3f257ab4144099f46f91aeaa5b8620e4bc","observation_id":"b9ece214-3270-4622-80a8-f4a374c28a19","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:48b0a508e00f4c2490173a104b221b11a266e03c9a9782f3c4037572619c0901","observation_id":"b7d6f262-50ac-4bf9-8823-25dafbf881aa","resolution":{"observed_at":"2026-07-04T09:39:46.829437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Lazy batching: An sla-aware batching system for cloud ma- chine learning inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:79b0f28f6a8d97f875b910643bbabd2e5078295d6b94f49f5f7068199990d4b1","observation_id":"d8d69d94-1d59-4810-8994-04f8cff8dafe","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Prediction is all moe needs: Expert load distribution goes from fluctuating to stabilizing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:583aa119a268b1914682107fec1cf291204dec26129b57daa670173494e48ed0","observation_id":"0acf6493-f839-4647-ab64-2e53476e2ff9","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":"2205.14135","doi":"10.48550/arxiv.2205.14135","metadata_source":"pith","pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","venue":"cs.LG","work_id":"efa96825-0830-4cfc-a250-fdaf6af302ab","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:23cee8fc0774e6228649da6462f72152b78f86b2a0ae2255680514f900274332","observation_id":"3f72e47b-de4b-4814-af1f-b1db31a7ade4","resolution":{"observed_at":"2026-07-04T09:39:46.819780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.534404+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Deepseek-v3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:a9e830cc55a5ed132af127291148fbc3e35954870d853752d5a31307a5a08a22","observation_id":"cb4737a2-5bb0-45e9-b72a-4fad63616e2e","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:d84fc2ffb46fd46fed60c39e2940a7ee772f479a1615432f8ecbda5eeea4bbe5","observation_id":"703825ae-cb2d-46d9-8535-07ccb01863ce","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":"2112.06905","doi":"10.48550/arxiv.2112.06905","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2112.06905 , year =","venue":"arXiv (Cornell University)","work_id":"34546f42-6cd7-499f-8af0-57d965de5408","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:71ecca72a1c1a8ad63d955437014064cb3bf28df5143ed8252714db5b8d238fa","observation_id":"3e2be5df-f02b-4fcb-84cb-790b57ddc27c","resolution":{"observed_at":"2026-07-04T09:39:46.809933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Switch transformers: scaling to trillion parameter models with simple and efficient sparsity.J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:ae0c5196c772aad65c2c02aee09ee1cf35bd8e29fdf6b1703c2dd686eeb20a88","observation_id":"edf51e26-9bc1-4bf6-b721-ba265cb41aeb","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01104","last_updated":"2022-10-10T06:41:52Z","snapshot_observed_at":"2026-08-09T04:37:24.892837Z","submitted_at":"2022-03-02T13:44:49Z","title":"Parameter-Efficient Mixture-of-Experts Architecture for Pre-trained Language Models","version":4},"cited_work":{"arxiv_id":"2203.01104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.01104","snapshot_observed_at":"2026-07-04T09:39:46.811036Z","title":"Parameter-efficient mixture-of- experts architecture for pre-trained language models","venue":null,"work_id":"5740b920-6a10-4909-9a9b-1c9acb47b6f8","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2203.01104","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:3ed8c9a9576380fdbfe7784d42d0e315c4405e827af3ecec1f5d7d95b4e57e24","observation_id":"57bb45f1-1410-4d86-96ba-796e23276792","resolution":{"observed_at":"2026-07-04T09:39:46.812502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11329","last_updated":"2026-05-01T12:16:47Z","snapshot_observed_at":"2026-07-06T21:25:08.411184Z","submitted_at":"2025-05-16T14:53:50Z","title":"TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference","version":5},"cited_work":{"arxiv_id":"2505.11329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11329","snapshot_observed_at":"2026-07-04T09:39:46.820947Z","title":"TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference","venue":"cs.DC","work_id":"9e60dedb-4a49-4ba3-9fac-5cb97f0826d4","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2505.11329","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:d14ed9859b056cded9c596ec0cfce82e36e6d9de332fdf1cec822cc74bccd23c","observation_id":"8fdd3057-98ec-426d-bf98-3a00b1799f2d","resolution":{"observed_at":"2026-07-04T09:39:46.822145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Past-future scheduler for llm serving under sla guar- antees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:06bfd69431bbce7ab1e9b35b3a26169131e4f18222e852cc4e87e917a79e7d68","observation_id":"cb28a707-1303-41c5-8403-1b2d4f7a93ed","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-10T11:43:00.160557Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":"2311.01282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-07-04T09:39:46.798667Z","title":"Flashdecoding++: Faster large language model inference on gpus","venue":null,"work_id":"9c60593d-b1da-4109-aefc-11fbd195cc6c","year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:f97e5e2a158e60bd0804edaa5cab853e3185ac02610972cf9b15bf1323aa306c","observation_id":"50cd2131-44bf-4af8-9404-d4bb2279ba9f","resolution":{"observed_at":"2026-07-04T09:39:46.800083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-08-11T06:18:26.517803Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":"2406.17565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-07-04T09:39:46.803577Z","title":"Memserve: Con- text caching for disaggregated llm serving with elastic memory pool.arXiv preprint arXiv:2406.17565","venue":null,"work_id":"51c7ec72-def3-42da-9410-c0152debc67f","year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:32cb6b6e71555f5fc75e43b7323f24cd7ac80af7f3fdbb25b5caa0a00b2be6a1","observation_id":"116ba9ea-3c2a-4e3b-8b0d-22aa9632bda0","resolution":{"observed_at":"2026-07-04T09:39:46.805074Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Deepserve: serverless large language model serving at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:571b3f4f72afb7c3c430541fafb0c832b39283647ccc8dac046f5e5f95acf8c9","observation_id":"4530887f-bca3-46b8-9a18-a835f7d32302","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Ad- vancing transformer architecture in long-context large language models: A comprehensive survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:5b829004e106946049692f5e7cba91a1e02cafd86c8925ca933a30e547886f81","observation_id":"99a5961b-40c0-4a6a-9690-de00f01a1bd8","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:cf81ee5d9da80829ce4bf855cf3b77af15091ca46c5fb9fc16279f5541016c56","observation_id":"5ebf2254-cd6c-4997-a6d5-6e83ad6d8079","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Efficient memory man- agement for large language model serving with page- dattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:853fe61f96bd69750f633bac2179fb661ad602634d11a3dcb75633f2a8551d20","observation_id":"1e972d62-124e-40de-a8b9-15103e96bfc5","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Lightseq: : Sequence level parallelism for distributed training of long context transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:80c0baddb687d7cc3f9d5c6c5b431af32bcb166739fde8fb36400b8879d4eace","observation_id":"204977dd-947f-455d-8da1-0a766ba8ca82","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:357c7fee49516ba6014ec82a80736570fa08409c7e510f0598c4cad3fb3d83fa","observation_id":"a02cb5f7-b5af-431a-a4ad-2b877e49476e","resolution":{"observed_at":"2026-07-04T09:39:46.807624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Ub-mesh: A hierarchically localized nd-fullmesh data center network architecture.IEEE Micro, 45(5):20–29, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:a387a13835905e8bb3b35e5dd8eb693655de0a27bd5cc922a4f2b3c772194073","observation_id":"805686ed-6088-4442-a425-2d0dba339105","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-11T00:55:35.992515Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:b79841de86dd3c554afd52cd118373cdabfed7642186b1265d265e109c30f1ff","observation_id":"5178e071-885e-44f4-8fed-b50993fa7318","resolution":{"observed_at":"2026-07-04T09:39:46.797595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:8451ea73fa6d76320a70030cf5ec1bd1a80e83bfd5d1ac830f4a370ee8a1dc9a","observation_id":"fa2864c0-9492-4731-a80c-3510d15ea2a7","resolution":{"observed_at":"2026-07-04T09:39:46.787355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09721","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.788404Z","title":"Revealing the challenges of attention-ffn disaggregation for modern moe models and hardware systems.arXiv preprint arXiv:2602.09721, 2026","venue":null,"work_id":"a7aa7172-7bc5-41d3-9444-d3f8489da471","year":2026},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:6ee3f83cb662b0196d8570e9e049adc619c9797ae7cbcd7cf3f15a161d96df82","observation_id":"20c1ff80-c833-4ead-a6a1-44a0ceb41827","resolution":{"observed_at":"2026-07-04T09:39:46.789810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Ring at- tention with blockwise transformers for near-infinite context.arXiv preprint arXiv:310.01889, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:e12c82f45eb41b279a1b3e75049f960b7598fbf10589617b62068b01ba2c269c","observation_id":"0a329dab-8576-44f0-a9e7-cfadcdc99fbe","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.790875Z","title":"2025.Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving","venue":null,"work_id":"b7454bc5-a9da-483c-9bc5-fe9e7b5383af","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:aedadf1b35f7249e1ecceb4e2a9925fb1232356730e8d4d24e46c43e9d0ca0c0","observation_id":"0f5b23ae-5053-4db6-8d7e-746955fdcb68","resolution":{"observed_at":"2026-07-04T09:39:46.792483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Moe-gps: Guid- lines for prediction strategy for dynamic expert duplica- tion in moe load balancing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:7522ba011f381cc8940b5be1727305a057e6a0df69b5d06b7032a5458a4f4789","observation_id":"03c1d626-c481-4ac6-af08-f10b825c6b8d","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07137","doi":"10.48550/arxiv.2503.07137","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.07137 , year=","venue":"arXiv (Cornell University)","work_id":"3a3f0889-f4ca-4b66-827d-8d33526f6ec2","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:825cee40ca5e13d506901925f0d2ad77ee25e7c748c5ce33e0549eb1502af66f","observation_id":"9be696ba-5347-4158-9e67-559b2a5bff77","resolution":{"observed_at":"2026-07-04T09:39:46.815037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Mar- coni: Prefix caching for the era of hybrid llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:150b66c9f255c531d118a900a773eeeb2e05fe0a23781272bf0325cf539b24ab","observation_id":"937fdc4d-98d1-4638-9c22-aa213a2491ed","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:81f407c926bc8d768ca9bb5fc4f2f3e1bcb80693089a16b68b10c7f4b84fcdec","observation_id":"5dd4124e-755e-4399-9a2f-e562c7b2b729","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric architecture for serving LLM chatbot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:b10fb6b6b0aaa7aceec8c6a37be4a8d1523249e4f51450f5691d806c9937e564","observation_id":"1ccbe570-388c-4600-8b89-ddc718145fc8","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"DeepSpeed-MoE: Advancing mixture-of-experts inference and training to power next-generation AI scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:98ec195b286fa155d394e7d5d0aca51c54bbcade5b22eed40faa866bc4a954c2","observation_id":"bc7cd991-c42b-453e-a73c-73526dfc7ad6","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:6f1749d3d394100fff9706fba565d611f7ae3b957be97ace7b92b2ab31a78659","observation_id":"67934f4f-057e-4cfe-a62e-336c97447677","resolution":{"observed_at":"2026-07-04T09:39:46.827089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Pangu pro moe: Mixture of grouped experts for efficient sparsity.arXiv preprint arXiv:505.21411, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:491a7743ba6e3c317b081a104607847ca42b0d5bd8d18cd34de188be00608cfd","observation_id":"a43b99f4-1f84-4397-8ddb-1be63e5f172c","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Kimi k2: Open agentic intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:ca90750315f351731b31fb2c49020cea06b548bd35bdf5c42f689c5b06e19840","observation_id":"cc4d953c-4c6a-4efb-8ef7-09eec864a669","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Thompson","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:52fd028efa5a1a2012bf9e062051ffa4f5bdf1929b1c9a9aea80ee27f2300363","observation_id":"a5f27282-9de6-4598-8372-eb78e266ecd4","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.19427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:57:51.403461Z","title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding","venue":null,"work_id":"d7a679b9-43e8-471f-886d-74df09e8fab3","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:91fc4c09f2804cc068daf6864b8ec64a179adee0c60dcb6fab069cb67fd106b9","observation_id":"dec2331c-7653-4b01-badd-d2332eab8495","resolution":{"observed_at":"2026-07-04T09:39:46.824708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Flexsp: Accelerating large language model training via flexible sequence parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:2660fdc7344caceccaaa51e3d284752fd58d00a2bda2c4c7df1b42e86e936c14","observation_id":"e5d240f6-2937-4b2a-b7b8-7aa5bde81c8f","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"{WLB-LLM}:{Workload-Balanced} 4d parallelism for large language model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:eb6792e56311adceef1f10f26e4009abb3f25341ad4e531ba16b2f15d11922c1","observation_id":"ff62471a-f5a9-4a92-8796-c1da20797600","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Loongserve: Efficiently serving long-context large language models with elas- tic sequence parallelism","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:575288d0ca3afdff1896db8b49da50067e6ff0dedf91aab93c787fa41c57931e","observation_id":"efbc5919-349b-4111-a6f4-99ccb0e1dbf7","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:5ddb7f01aff6bffa86839e67fdfb9b2130096554e2559050b2da1f53a5a1ed24","observation_id":"49da9fe7-4f1a-49a3-be4e-3b78367201ee","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Aegaeon: Effective gpu pooling for concurrent llm serving on the market","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:8198f9059d4ca72e07d32ade9e68bb43e7c19a358b33878e7c67171456b1a17c","observation_id":"886bb5a6-d07d-4679-86a9-c50c313822ca","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09999","last_updated":"2026-05-11T03:41:00Z","snapshot_observed_at":"2026-07-30T05:05:51.180006Z","submitted_at":"2025-05-15T06:24:08Z","title":"ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production","version":3},"cited_work":{"arxiv_id":"2505.09999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09999","snapshot_observed_at":"2026-07-04T09:39:46.830554Z","title":"ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production","venue":"cs.DC","work_id":"ee6b80ad-e8b6-49bd-a0d1-fb27ecf7b50c","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2505.09999","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:1743b18ec2ee55671771e436c1b446b5450934907938dc923104bbcf5ebdac24","observation_id":"1c195a77-a5ef-4408-8357-4db76eeabaa6","resolution":{"observed_at":"2026-07-04T09:39:46.831727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:0e2e5c3c0f2b771bcebde15724b451dc74c18f14a391bee078a59e7904059050","observation_id":"bf273d27-d1ec-4a3c-9a26-d35ce2ddbcc3","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Gonzalez, Clark Bar- rett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:039eaef765743daf0931cfd94d01424c587281a9bb2d84f30a36b88b92c5b469","observation_id":"57407930-470f-4da7-9341-e30756cfe0af","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.17120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:39:46.793577Z","title":"Bucketserve: Bucket-based dynamic batching for smart and efficient llm inference serving.arXiv preprint arXiv:2507.17120, 2025","venue":null,"work_id":"7b33960d-8f54-4e4f-9891-3fbb6f22495f","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:71397be5127662f19473c29816da307b878751c7c996ae8a11cf07a9f911024e","observation_id":"bb309625-d9bd-4e83-93d6-440d9cdf4534","resolution":{"observed_at":"2026-07-04T09:39:46.794999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:c6281c1159d2e8235ebed223e62d001aecb6302b48d5633e7548cedc67235636","observation_id":"f14d1e4d-49aa-47f7-85db-bf224efb8ad1","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Sampleattention: Near- lossless acceleration of long context llm inference with adaptive structured sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:35220497beffbf719ad1e55c7c34e376129cd92e422f4f87dab39805bcc994f2","observation_id":"02da2d4b-9545-4a50-a8b0-d8587fa031ee","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T09:42:39.573568Z","title":"Megascale-infer: Efficient mixture-of-experts model serving with disag- gregated expert parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:68ec8850e78bb671917930064ec23b5022a8077df68162d8fc25aad9c301d2c5","observation_id":"6337a5f0-1d91-46be-a122-6f9dae8f542b","resolution":{"observed_at":"2026-06-26T09:42:39.573568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12708","last_updated":"2025-06-19T12:27:10Z","snapshot_observed_at":"2026-08-07T00:41:26.353928Z","submitted_at":"2025-06-15T03:41:34Z","title":"Serving Large Language Models on Huawei CloudMatrix384","version":3},"cited_work":{"arxiv_id":"2506.12708","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12708","snapshot_observed_at":"2026-07-11T01:07:43.951069Z","title":"Serving large lan- guage models on huawei cloudmatrix384.arXiv preprint arXiv:2506.12708","venue":"cs.DC","work_id":"37cf160b-817f-4b02-9f59-aeb09fe886eb","year":2025},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2506.12708","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:f023a755093190edb8ca91fb6430d7c91399e4da8783aaadd88da8c9878cdb1a","observation_id":"18a90714-7375-4a52-a134-3460c469c5e5","resolution":{"observed_at":"2026-07-04T09:39:46.817497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":37,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2606.22541."}