{"as_of":"2026-08-10T12:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1733c6c1f91d7f12e9f68c83dbbcb4c9a21f3f793e26035ad50c16751991bbfd","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:53:31.121991Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:16:13.946445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:19:54.305666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"cited_work":{"arxiv_id":"2508.19373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19373","snapshot_observed_at":"2026-07-04T14:19:54.305666Z","title":null,"venue":null,"work_id":"05a713f3-823f-40f1-bac9-37755ed48247","year":2025},"citing_paper":{"arxiv_id":"2606.26607","last_updated":"2026-06-25T05:10:20Z","snapshot_observed_at":"2026-08-08T13:05:18.203440Z","submitted_at":"2026-06-25T05:10:20Z","title":"Moebius: Serving Mixture-of-Expert Models with Seamless Runtime Parallelism Switch","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T04:06:13.426379Z"},"links":{"cited_paper":"/paper/2508.19373","citing_paper":"/paper/2606.26607"},"observation_digest":"sha256:81b86002efcfefa7f1108b9a185adc233e2294a362662a98a95ea5a0e980e2b0","observation_id":"605ca0d3-c892-4868-8dad-b1eab5e2fa33","resolution":{"observed_at":"2026-07-04T14:19:54.307203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19373","snapshot_observed_at":"2026-08-07T19:16:13.946445Z","title":"Hap: Hybrid adaptive parallelism for efficient mixture-of-experts inference.arXiv preprint arXiv:2508.19373,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06025","last_updated":"2026-08-06T13:31:09Z","snapshot_observed_at":"2026-08-09T23:12:46.105172Z","submitted_at":"2026-08-06T13:31:09Z","title":"Hybrid-Adaptive Thread Tuning to Mitigate Simulation Execution Bottlenecks in High-Performance Reinforcement Learning Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T19:16:13.946445Z"},"links":{"cited_paper":"/paper/2508.19373","citing_paper":"/paper/2608.06025"},"observation_digest":"sha256:7980d218bfb531481d29d0ab6d86d5fc8f7aec0ebf3b0254680dc5641bc3122a","observation_id":"658b5d45-7a36-4a0d-8404-f8307c332c67","resolution":{"observed_at":"2026-08-07T19:16:13.946445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19373/citation-record","integrity":"/paper/2508.19373/integrity","json":"/paper/2508.19373/citation-record.json","paper":"/paper/2508.19373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-03T02:24:22.577450Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-05T15:53:28.504969Z","title":"Efficient large scale language modeling with mixtures of experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.504969Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:5b251795e8d8ea46493d28ec2a622ff62732ad52e522054c7e9410033e81206c","observation_id":"78aa2a76-a5c6-4126-907b-2a602040a306","resolution":{"observed_at":"2026-08-05T15:53:28.504969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-05T15:53:28.577800Z","title":"No language left behind: Scaling human-centered machine translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.577800Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:42217b5a3eeead7389446801c56173b679bf33203c6288f88b46fe65c546fea4","observation_id":"8df2bef5-66bd-425c-944c-7d07216a5636","resolution":{"observed_at":"2026-08-05T15:53:28.577800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:28.650393Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.650393Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:92afd3fcda9d12921be951561842df8ff7f15a9d313f6dc1820db8f7f24c0069","observation_id":"a84a559f-a641-4df7-897c-a4e92ed5c209","resolution":{"observed_at":"2026-08-05T15:53:28.650393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T15:53:28.788647Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.788647Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:8901fef4f72671f657ca63497f38dc29d897db1e8f4b65f08881bf8d87cfe083","observation_id":"2840d992-add2-4378-bd70-3d352bdd3536","resolution":{"observed_at":"2026-08-05T15:53:28.788647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:35.385154Z","title":"Scaling vision with sparse mixture of experts,","venue":null,"work_id":"a9cd9bf5-22bc-41f1-bc2b-644903b7f223","year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.889836Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:15da5cb98032b661bbafe7fc0f222a6711666d9958d39bb91ca5a48d23dfd75f","observation_id":"de6209a7-9317-4477-ae13-1488bb143802","resolution":{"observed_at":"2026-08-05T15:53:35.471837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:35.026862Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":"310686ac-db53-4f6c-adc0-8115a6fe9736","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:28.944744Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:883eeb4c50a15c5ead70fa1223a88ed2004a670f4ac04aed3b8d836725f406f3","observation_id":"1fe8b34c-17fa-42fa-bd32-2838f16b6e75","resolution":{"observed_at":"2026-08-05T15:53:35.213876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-05T15:53:29.009532Z","title":"Deepspeed- fastgen: High-throughput text generation for llms via mii and deepspeed- inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.009532Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:b5bcbdfd2f7a27056273a4c085ab8272e3789c0597318235b7d5edb5d8eb4cd9","observation_id":"804a2c0c-1dc3-47dc-a9f9-82497e7d3e21","resolution":{"observed_at":"2026-08-05T15:53:29.009532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.773241Z","title":"Moesys: A distributed and efficient mixture-of-experts training and inference system for internet services,","venue":null,"work_id":"26c33ef4-cc6c-46c1-9d83-05b04cfe444d","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.122972Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:151551f918b95c0b9513ba5fc1913d98c9900e7c5f8b9f6df774877bc1186908","observation_id":"2267c1e9-1983-472e-a626-811df387e571","resolution":{"observed_at":"2026-08-05T15:53:34.893015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T15:53:29.246910Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.246910Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:07b393f0b1f0af869ed14e3e16eaafc773acebe2f52e696eaa0b242c5358d5ba","observation_id":"d9a93d69-9e96-4857-b601-668103d04040","resolution":{"observed_at":"2026-08-05T15:53:29.246910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T15:53:29.303551Z","title":"Designing effective sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.303551Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:90754897cac73dc00a1401837ce34eae286a5de549110660c1d177fee8754522","observation_id":"0891a351-fee2-4949-8b0e-eadd58e3fc64","resolution":{"observed_at":"2026-08-05T15:53:29.303551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T15:53:29.456526Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.456526Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:4a4f6b17bb1cba72aa5c3d562fe0372840be819415b7c9825f998f6f39e0e17a","observation_id":"32bea133-c8ac-4fac-88ad-5fcaa90b9656","resolution":{"observed_at":"2026-08-05T15:53:29.456526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.522396Z","title":"Qwen1.5-moe: Matching 7b model performance with 1/3 activated parameters","venue":null,"work_id":"601bb141-9699-4a6c-9594-54797efa636d","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.581788Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:ef733b65c2007592e4e7b5ce21264f50a1ba3ccc29ce7a4b01be0cdd9cc08d2e","observation_id":"67d1fffb-a61a-40c8-a54d-fda1aebfd43b","resolution":{"observed_at":"2026-08-05T15:53:34.649050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.246734Z","title":"Qwen2 technical report,","venue":null,"work_id":"b41324ec-facf-4e02-ae1b-60e08eb148d4","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.683861Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a96615ef3e16380680e96093b4421620bf0b056fc57c280a55d072ceb71a51b4","observation_id":"b4145053-23c4-4042-9b99-8e4fbb40d428","resolution":{"observed_at":"2026-08-05T15:53:34.383939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:34.056989Z","title":"A tensorrt toolbox for optimized large language model inference","venue":null,"work_id":"eaad90da-2093-41c1-a9d0-740ad380da22","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.789935Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:2a9e4c68a5e49a4c95ca80c65818b455a5c4a1dd6ec1c4d1c25e8803070ab147","observation_id":"bebc2fe6-f70e-47f9-b054-42ebf961b062","resolution":{"observed_at":"2026-08-05T15:53:34.150158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.746135Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"27d47165-2cb5-4f09-99b0-c8eea27df15c","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.885147Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:6deef3c8757ce0504ba9e01e313c960cbaddcc3afaa77fcf13429fe2470f460e","observation_id":"7defcc0e-ab5d-4898-bf95-3bc49fd3b840","resolution":{"observed_at":"2026-08-05T15:53:33.863906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04964","last_updated":"2024-12-11T13:27:00Z","snapshot_observed_at":"2026-07-06T20:02:43.795985Z","submitted_at":"2024-12-06T11:29:32Z","title":"Flash Communication: Reducing Tensor Parallelization Bottleneck for Fast Large Language Model Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04964","snapshot_observed_at":"2026-08-05T15:53:29.967927Z","title":"Flash communication: Reducing tensor parallelization bottleneck for fast large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.967927Z"},"links":{"cited_paper":"/paper/2412.04964","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:df00444b32e09ceaccb2edc9fb0da716bcb5b88c60353049fe800110614331aa","observation_id":"8a2df785-e639-439d-b2dd-6cafd657326f","resolution":{"observed_at":"2026-08-05T15:53:29.967927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06182","last_updated":"2023-06-18T01:33:19Z","snapshot_observed_at":"2026-07-06T15:01:30.019542Z","submitted_at":"2023-03-10T19:30:15Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06182","snapshot_observed_at":"2026-08-05T15:53:30.143109Z","title":"Towards moe deployment: Mitigating inefficiencies in mixture-of-expert (moe) inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.143109Z"},"links":{"cited_paper":"/paper/2303.06182","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a83d67af3c7e9c27fc4a603e06b441f71165dce95fd391bd007122de325138b5","observation_id":"bf46c29f-504f-411e-800f-c48a25a3b836","resolution":{"observed_at":"2026-08-05T15:53:30.143109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.407062Z","title":"Deepspeed-moe: Advancing mixture- of-experts inference and training to power next-generation ai scale,","venue":null,"work_id":"bada6bb4-f606-4cb4-89e7-bc66cd477cbe","year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.284288Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:552981dbe27e2612bc0381759052d65e58205f985e703aee694b0ac7a9ac72cc","observation_id":"10fe3b85-88c6-4681-9a38-de8394dae73e","resolution":{"observed_at":"2026-08-05T15:53:33.554501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:33.145261Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture- of-experts training,","venue":null,"work_id":"6c0551d3-b3de-477e-9c1d-0258cc56d154","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.429204Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:38fe3db9e2fb8e7792c69ff4c365233fe37afc0198ecdf4bf51793274efa2402","observation_id":"80bbc26a-33c2-4fec-9cf4-ddeb9c3bd5f6","resolution":{"observed_at":"2026-08-05T15:53:33.247641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.802939Z","title":"Deepep: an efficient expert-parallel communication library","venue":null,"work_id":"79542eb4-bce9-44e3-bc58-b20dad040af5","year":2025},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.553332Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:80f8541f04d893e0b77ab7088430ea4a750a4c016ed6b15aee07915dfd2c89ec","observation_id":"d4006313-5169-4be0-93d9-b7a563c8e2de","resolution":{"observed_at":"2026-08-05T15:53:32.922786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.571679Z","title":"Alpa: Automating inter-and {Intra- Operator} parallelism for distributed deep learning,","venue":null,"work_id":"9aed9dd4-57e9-487a-a92d-b8d9f5b7cc77","year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.716371Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a9112adaf43006f87e9926ebbde77bc1c2a337a35c83221a36228405b50200df","observation_id":"abc71dfc-ed1b-48f9-8d2e-e53006875e2d","resolution":{"observed_at":"2026-08-05T15:53:32.709061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.325518Z","title":"Tutel: Adaptive mixture-of-experts at scale,","venue":null,"work_id":"a37211eb-3839-4798-b8b2-3aca19da4187","year":2023},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.782234Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:9a91777652bf7fc7f8792953422401c1df7de86148c173a6fce362a80cc4d82e","observation_id":"c9593ac8-d628-4788-b72f-54a186ca65ff","resolution":{"observed_at":"2026-08-05T15:53:32.422585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:32.054964Z","title":"Pcie gen-5 design challenges of high-speed servers,","venue":null,"work_id":"d1383149-6380-4f1d-a384-1b144cb9224c","year":2020},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.865671Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:85b805a65287fa0e981fb76b57ac8a516e5890ad1765be6d2586474b6f45c151","observation_id":"3184221e-1e66-418f-8983-9e307435cec1","resolution":{"observed_at":"2026-08-05T15:53:32.187333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:31.773234Z","title":"Nvidia a100 gpu: Performance & innova- tion for gpu computing,","venue":null,"work_id":"3e0aff92-e3c9-4e27-b2cc-597671332df2","year":2020},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:30.959463Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:a8cef42bfdf4676a453edea54170ce08b81c5a135788564c276e9704f29180cb","observation_id":"1bc0417a-b19b-4dc5-a8fc-f6eb5be375ca","resolution":{"observed_at":"2026-08-05T15:53:31.855990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:53:31.529533Z","title":"Bitsandbytes: a lightweight python wrapper around cuda custom func- tions","venue":null,"work_id":"f1a1037a-50b1-4115-aaff-c85959f24881","year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:31.050897Z"},"links":{"citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:06d729c7de0c2bc4cb3660f6652605f66aa974ea6262ac7d8b25a1e70040940f","observation_id":"e15fa19d-f1e5-42fe-8275-28e067506fe9","resolution":{"observed_at":"2026-08-05T15:53:31.652787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-02T11:19:40.664702Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-05T15:53:31.121991Z","title":"A white paper on neural network quantization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:31.121991Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:923b9aa8e3f9f75d5b0013dfe1491b8527c0c9cd374b3ca7d28ce36f872ac517","observation_id":"ddd5ed51-d969-4652-bf2e-66513c54a65a","resolution":{"observed_at":"2026-08-05T15:53:31.121991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-09T14:11:40.424384Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2508.19373."}