{"as_of":"2026-08-17T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c251f622a6df562d6d4472758a6d379165bb1a425d37bd90de7715f1a4351a85","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:53:58.740609Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:00:17.763102Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T23:00:19.435484Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"cited_work":{"arxiv_id":"2411.11217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11217","snapshot_observed_at":"2026-08-15T23:00:19.435484Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","venue":"cs.DC","work_id":"7d33d0fc-8af2-4c03-bc04-8049f1594a2c","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.763102Z"},"links":{"cited_paper":"/paper/2411.11217","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7f97a4a8857106c095504bd0084a26e54127180720e26462a9b02749bd9c429f","observation_id":"3ce825a4-85b8-4bf8-b9a9-d13331b3daf9","resolution":{"observed_at":"2026-08-15T23:00:19.443779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11217/citation-record","integrity":"/paper/2411.11217/integrity","json":"/paper/2411.11217/citation-record.json","paper":"/paper/2411.11217"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.206865Z","title":"Flashinfer: Kernel library for llm serving","venue":null,"work_id":"17f609f3-410f-44b4-b46b-db3c1a0a3d82","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.569013Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e33d07a1e6f8a83692ed1e4b592d5d141bb4c6a6aee55dea86ad7a495e7892d2","observation_id":"8da072c8-5949-4691-b6a2-fef7e5d32b8c","resolution":{"observed_at":"2026-08-12T18:53:59.210066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-12T18:53:58.572830Z","title":"Gqa: Training generalized multi- query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.572830Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:0506d97b5916a37066c5189624de625535e136f49fc48da216c9f509a4afa985","observation_id":"fa5341d7-fbc9-4a3d-bbef-2b1e985a54e5","resolution":{"observed_at":"2026-08-12T18:53:58.572830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.197896Z","title":"Llm in a flash: Efficient large language model inference with limited memory, 2024","venue":null,"work_id":"458477e9-8498-4eb8-93d1-e61faeaddff5","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.576262Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:85a67d39739c5458fe8d0a0e981c2dce1a1ada026535fd71d0d87f9d037ec5af","observation_id":"009a2d51-8c25-4fdc-a176-d01a4b12d137","resolution":{"observed_at":"2026-08-12T18:53:59.201165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.579622Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.579622Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:3b17e2ca8313e7e94511896736732961573f4c2c9eadf721f0f63c0261c140f5","observation_id":"9967325f-6af9-423a-b845-3c356f178664","resolution":{"observed_at":"2026-08-12T18:53:58.579622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.582688Z","title":"Accelerating large language model decoding with speculative sampling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.582688Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:680b27144bffddba3a54a0d42ddbc9e17c672134a550bc65030fec2eaae7a8f5","observation_id":"b0c8aec7-1d4f-4c0a-95cd-375f17aa571f","resolution":{"observed_at":"2026-08-12T18:53:58.582688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.178559Z","title":"Lifelong language pretraining with distribution-specialized experts","venue":null,"work_id":"07650f6f-1546-496c-ba88-e3c19af43d78","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.585827Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:1114bc30278c332ad7914a3aca6704f759bd4df2a7aa0fd29a0055287ce05b3a","observation_id":"6f2e38fb-5ad5-4bbe-ab60-b9f11d7fcc7f","resolution":{"observed_at":"2026-08-12T18:53:59.181927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.169119Z","title":"Spreadsheetcoder: Formula prediction from semi-structured context","venue":null,"work_id":"118c38c8-e38a-4215-b6a3-c6d6cee1324d","year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.589148Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:d74f3e22311876840691612435e5ab53c5857bb2f2884697647e183e76f26666","observation_id":"1a75a12b-1a28-4e22-ac01-7b08d93f3396","resolution":{"observed_at":"2026-08-12T18:53:59.172382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-12T18:53:58.592078Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.592078Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:09996ca9f5f57fd042efb591ed3faf57b1506b2a04aa330ee8e331f80988e470","observation_id":"cb96245e-f471-4cfe-8707-587d6323d85d","resolution":{"observed_at":"2026-08-12T18:53:58.592078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.595355Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.595355Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b679e2312e677036288d4b8a3c925dd754e5773ca699e1225634b9bcc23fe52f","observation_id":"8ce5be6e-b065-41b1-88db-eda92ce41cc2","resolution":{"observed_at":"2026-08-12T18:53:58.595355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T18:53:58.598074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.598074Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:fcebe2d2ea08d6e38b77a7658c44e54f5720d28ac99dc3f368b568e631e76a99","observation_id":"beb32e99-611c-4b2a-b42a-16685f72a4aa","resolution":{"observed_at":"2026-08-12T18:53:58.598074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.154816Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"d98a6110-de39-4a00-9b5e-d3f4c4183155","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.601425Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:ec13c43d10ec7a1ea7139635e3118e3541b0112f6a26bbfa7801879ba62a70a4","observation_id":"7a11b14a-0f39-440e-86f8-c9814b8fa096","resolution":{"observed_at":"2026-08-12T18:53:59.158305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.145903Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"368c3d93-e377-4c5c-817b-2777d30fcfbf","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.604536Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:975c25038145c9cd8795a06fcbb3f4895ab943857524c538e1d0b6b6b8f0a8ac","observation_id":"68aa2d8d-7e73-42d5-8009-6502458b876e","resolution":{"observed_at":"2026-08-12T18:53:59.149069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.137280Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"976f4275-3618-47dc-a64b-82480058911b","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.607616Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:34e52e1650b8b279ef79c27f477fe5be8106ccd4e83aa018059004dbebc84c83","observation_id":"7cb30671-87f3-47e3-a01a-61078df5b0cb","resolution":{"observed_at":"2026-08-12T18:53:59.140456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T18:53:58.610574Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.610574Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:07d0c2dbe4fe3557edf9eefa9a0cda5661a0e2fe2dd7c6fc3de7489896dc720f","observation_id":"41d24f27-b2cf-4e63-88ba-f6b921fbf4ff","resolution":{"observed_at":"2026-08-12T18:53:58.610574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.128432Z","title":"Fast inference of mixture-of-experts language models with offloading, 2023","venue":null,"work_id":"1a2cb14e-e122-484d-abe5-05eeee01aa60","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.613730Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:7db3ed32c779083c6204f69b95b11c3f816e51101650a02e0a9b458eefee3c97","observation_id":"5eac09d1-0975-4c86-9970-0e15d2df344a","resolution":{"observed_at":"2026-08-12T18:53:59.131718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.119667Z","title":"Dap- ple: A pipelined data parallel approach for training large models","venue":null,"work_id":"d199f643-8b6a-477a-b5c6-76857357ff0f","year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.616760Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e7ce6c50605f5d58d8b104520c6548e0b3f4aed916f381131b3cc3b4815f5385","observation_id":"8fe4204f-144d-4044-8fdc-8b1f16d15c1d","resolution":{"observed_at":"2026-08-12T18:53:59.122947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.110159Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines, 2024","venue":null,"work_id":"2f949ec2-c88a-47c8-9717-cb935dc5e991","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.619628Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:14694ab4673e0f32a2dd8fc4d9a6da849f58d45f1509b2b510b76065fc7c69c7","observation_id":"43ead05a-ff96-4587-b4b1-ce2d915667f8","resolution":{"observed_at":"2026-08-12T18:53:59.113719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.622530Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.622530Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:3f33c35594eed99966a869e17e18e147b10ac74e58bbb507e72043d740635f16","observation_id":"4e0e2679-1602-4ac0-a4db-611b73ba8ab5","resolution":{"observed_at":"2026-08-12T18:53:58.622530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.094740Z","title":"Hugging face accelerate","venue":null,"work_id":"a17e2589-5f1f-4088-97fd-8efc324f7edc","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.625275Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:bd98b6af8c4a228210843ef537884f4ab96f666fa32a2d558e6290ddb93215ed","observation_id":"eb5a6805-341d-47e0-ac34-f47d35eca29d","resolution":{"observed_at":"2026-08-12T18:53:59.098032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.085293Z","title":"Intel(r) oneapi math kernel library (onemkl)","venue":null,"work_id":"cc76a790-1081-49a1-af6e-f189df7cadea","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.628410Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:6680c95e38f998a1c09415eb52996afea332bdb059fc5bece7be4e9840f64733","observation_id":"42c246a0-b8cd-48f7-b8f5-c3d9d776cfe8","resolution":{"observed_at":"2026-08-12T18:53:59.088910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.076408Z","title":"Jacobs, Michael I","venue":null,"work_id":"14136ec6-92f3-44a7-b1a7-5f418127bdf6","year":1991},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.631285Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b18cd0ff985adc1fe913f908f8bc10105b829a019d7fcab28d4e1ba3ad40f3cf","observation_id":"ed49b8cd-f4f6-43d6-9ad9-1a9a7b7870d4","resolution":{"observed_at":"2026-08-12T18:53:59.079406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T18:53:58.634169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.634169Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:5ea2ca8a3b9d304a3a207c08ef7b1eb8387d0275ef5518d98a3b96e94373f002","observation_id":"2cddb5ee-09a3-4e40-a6ba-974e76d19948","resolution":{"observed_at":"2026-08-12T18:53:58.634169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.637627Z","title":"Hierarchical mixtures of experts and the em algorithm","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.637627Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:40fe3a290314b9e6d5be07a3b1fc36450c38ab0e2773daaae5a7024a2394a94b","observation_id":"d529eedc-00ec-4315-ba86-75a4ad3b9ed9","resolution":{"observed_at":"2026-08-12T18:53:58.637627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.061673Z","title":"Fu, Christo- pher Ré, and Azalia Mirhoseini","venue":null,"work_id":"d0fe1571-0404-4127-9dfa-e771ba44dbac","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.640464Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:c6480d1f043d6459205c4ce0b523072a3df1ca221fe6bc3cb094f377a0e57aa8","observation_id":"d2e2f8a2-b873-41f7-ae23-52fc6bd3699d","resolution":{"observed_at":"2026-08-12T18:53:59.064941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.052312Z","title":"Fiddler: Cpu- gpu orchestration for fast inference of mixture-of-experts models, 2024","venue":null,"work_id":"6610bbcd-a30c-4c55-af15-c459e3621dbf","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.643198Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:6eb9cba826982793fc42f6afabfbc7cd97d3642fd8a5166883320fc0950508a0","observation_id":"27c18c25-64a7-4d95-96f2-a8546200e836","resolution":{"observed_at":"2026-08-12T18:53:59.055522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.646145Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.646145Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a537a04850a88e959cb3625e6101c68773ecf1229ab00ee134584ee627862c28","observation_id":"bf8ed4c5-ecf2-4a2a-a662-4c00a31e70b5","resolution":{"observed_at":"2026-08-12T18:53:58.646145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T18:53:58.649016Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.649016Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:7ea9c59661ebdcd90f71d81f80cf1cec02fe6afaa6d9866f22d9ecb8e6d0fd7b","observation_id":"b60c6726-b44a-453b-8d85-dd8ad830cae8","resolution":{"observed_at":"2026-08-12T18:53:58.649016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.652418Z","title":"Fast inference from transformers via speculative decoding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.652418Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b39fcfc63f2f01b900c5d71a5487b5bab89357fcb81e458268422b8c41c8fca4","observation_id":"50cc8e15-4e9d-43c8-bd38-bf08e7a406a5","resolution":{"observed_at":"2026-08-12T18:53:58.652418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T18:53:58.655265Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.655265Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:f54b29bd52f8b1d1f0979ee065cf0cac971b999c1b1694c36fb59b84a5089339","observation_id":"854a1e9f-aa4b-4011-9d9e-4a05206611dc","resolution":{"observed_at":"2026-08-12T18:53:58.655265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.033255Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving, 2024","venue":null,"work_id":"abdda3fb-3ca2-4708-8b74-8e8c05b3263a","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.659136Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:6121e7b5516564eafede780289e8dae9b6cfbb32534095e38fabc1fc0ebbc96d","observation_id":"0c52fa16-3192-49a1-959a-6a51a5ec991c","resolution":{"observed_at":"2026-08-12T18:53:59.036481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.661945Z","title":"Gonzalez, Ion Stoica, and Matei Zaharia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.661945Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:f2e17a00368463c36a57dcfa0b2b201ac86b16b8369207a59c1072c8989b5713","observation_id":"ab0a877a-ac83-429c-9448-a8b5ceeeed51","resolution":{"observed_at":"2026-08-12T18:53:58.661945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.018850Z","title":"https://mistral.ai/news/mixtral-8x22b/, April 2024","venue":null,"work_id":"0e8ea6ca-ee53-49e6-8115-95b4ea48554f","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.664995Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:2de7f65695db6064ab5e6be0801babcc68ffc97af5f869d0650a9f80dd2690da","observation_id":"0ddcab18-85f7-4c14-b8f9-f58b2fed74fa","resolution":{"observed_at":"2026-08-12T18:53:59.022040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-16T16:59:01.430562Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-12T18:53:58.667936Z","title":"Can foundation models wrangle your data?arXiv preprint arXiv:2205.09911, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.667936Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:06d0aeaa48d59c8362bbad805a0ce576c14a1a60cc27272fa59413c7847bd4ca","observation_id":"98ae3737-33c3-4c1c-acb9-a09cb2ce5d7a","resolution":{"observed_at":"2026-08-12T18:53:58.667936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:59.010080Z","title":"Pipedream: generalized pipeline parallelism for dnn train- ing","venue":null,"work_id":"4fcf1694-c1c8-4de3-8823-ecf91724745b","year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.671082Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e01ab0f2d0748baf9d80776108d0911d95bdc87acf912a41dd80b16d63dc2c0f","observation_id":"caa36d69-df5c-4da8-ba84-fd06f4860082","resolution":{"observed_at":"2026-08-12T18:53:59.013260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.673854Z","title":"Efficient large- scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.673854Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:cef4d7e64e0f1411e5af44f6187eeb6d39f85f712ec4d148e2adb410f917b16f","observation_id":"0f061996-066e-48ae-b67f-4d82d6e4132a","resolution":{"observed_at":"2026-08-12T18:53:58.673854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.676884Z","title":"Pytorch: An imperative style, high- performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.676884Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:1d64b84876f62480a666385fbbed57dc4cf0dd6dcf9a7bf5ceafae8147386d46","observation_id":"bbcac705-de64-4bce-89a2-325d5c149bab","resolution":{"observed_at":"2026-08-12T18:53:58.676884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.991114Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"099eb52a-288f-4396-9b62-081811e4d2db","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.679584Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:29a353061dd8ced39b2e68af76f4f39c9c37741d646b3ca0cb6713d94b9e3d9b","observation_id":"a48a4139-6f90-4c9a-b9df-fa69800813b2","resolution":{"observed_at":"2026-08-12T18:53:58.994340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.982286Z","title":"Int4 decoding gqa cuda optimizations for llm inference","venue":null,"work_id":"b76ed2b3-c33f-4f06-a859-badca6c2f58a","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.682282Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a51956a9576d584dc34678a381240d0c48bdc93744013c935bda4b419cde5d9d","observation_id":"3c40886d-2f0c-49a8-ba95-f17e086b9b8d","resolution":{"observed_at":"2026-08-12T18:53:58.985437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.973298Z","title":"Accelerating transformer inference for translation via parallel decod- ing","venue":null,"work_id":"0ee4c4f0-815a-4c0a-86c4-5208a550bd14","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.685155Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:622d6925b2fa9e44093790f629ee734e62bb522b5b59bc3b5c2072177ed197ba","observation_id":"27ca07b3-ed1d-4218-815e-0adcd9ae4157","resolution":{"observed_at":"2026-08-12T18:53:58.976464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-12T18:53:58.688100Z","title":"Bloom: A 176b-parameter open- access multilingual language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.688100Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:0df151d9bf7d0c113d1a3491f0ca91eb3982c1df775ec27e0e2207ad2fa963fb","observation_id":"529a1180-301d-4b3f-b41a-d892698429ce","resolution":{"observed_at":"2026-08-12T18:53:58.688100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T18:53:58.691288Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.691288Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:5689edddf8669258e2a7ad535edb9630fc1a67102fb05f8b861a7135a5c29de3","observation_id":"c9d347d1-5518-461c-afb6-97737c26e6c1","resolution":{"observed_at":"2026-08-12T18:53:58.691288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.694423Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.694423Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e4afe8d82220a2987b9ed243a31913574a46df8a88895e1fdcb10305d072bca8","observation_id":"d3d95062-058a-4ec2-9761-03a9e6ee0b21","resolution":{"observed_at":"2026-08-12T18:53:58.694423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.958020Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu, 2023","venue":null,"work_id":"d6a04d77-a4cd-427d-8e2f-cfbdc543d802","year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.697301Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:962fd64fcf1120405ceb94b5156396a8cdf2b6bdf577227c9ee8e4939e33b2e1","observation_id":"fe41c939-776a-4a03-ab5d-d5bde01a1396","resolution":{"observed_at":"2026-08-12T18:53:58.961970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.948498Z","title":"Blockwise parallel decoding for deep autoregressive models, 2018","venue":null,"work_id":"1fcf41b9-d177-41bd-9023-1f5b17ba580c","year":2018},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.700423Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:69f182b91b6538a3185ac547994ee811deaf31dd45e2a7fe5d6ce4ebee6df427","observation_id":"01f3f65f-3a72-4fab-81e1-462b883fb1c3","resolution":{"observed_at":"2026-08-12T18:53:58.951762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-08-14T18:53:06.624928Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-12T18:53:58.703312Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.703312Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:404da0e96f8738dd2c5272ddc09cb105c1d5206b30efedd4ac516cad68190e4c","observation_id":"65f40479-2123-4938-a987-30448f8f6236","resolution":{"observed_at":"2026-08-12T18:53:58.703312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.939036Z","title":"Introducing dbrx: A new state-of-the-art open llm, 2024","venue":null,"work_id":"ea41e0d8-cac2-40b0-99f0-1545d364c70f","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.706692Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:47843e342b09558a62bef30ad45186b6384bb28abf1048038d413dfbbcf78339","observation_id":"bc4e239d-4295-49b9-a2d4-0f7d79d70e05","resolution":{"observed_at":"2026-08-12T18:53:58.942656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T18:53:58.709940Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.709940Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:45f97aff5f5ff993ec5264a725634ccface1452a577977df468f50a30496b6b1","observation_id":"8512b705-473b-4585-8a91-61a75c353df6","resolution":{"observed_at":"2026-08-12T18:53:58.709940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.930096Z","title":"Patterson","venue":null,"work_id":"cf3464b7-6a2e-4d3c-aa3f-1bcdc70e4631","year":2009},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.712972Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:b2986c84e7b93efff21a0c9945eaafb48ffa30246a675410391528409bc37348","observation_id":"82f6bb67-35da-44ff-9b32-512a4dd9306a","resolution":{"observed_at":"2026-08-12T18:53:58.933257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.920942Z","title":"Hetegen: Efficient heterogeneous parallel inference for large language models on resource-constrained devices","venue":null,"work_id":"07f0c365-e9c0-44da-a7b1-eeff3b6560a1","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.715786Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:a6a443cdc9a7226b28bc1a1f00d42cd12ad458cd0a02ea9e50d6cb8ddd3007d0","observation_id":"426a9ebc-8270-4434-89e8-8c451dcce4e3","resolution":{"observed_at":"2026-08-12T18:53:58.924325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.911271Z","title":"Moe- infinity: Activation-aware expert offloading for efficient moe serving, 2024","venue":null,"work_id":"d0777069-d95a-4ee2-affa-b541fda7fd5b","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.719047Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:43870ad718ba041328bb2e9070d9ce6de34cc3b068700f3c91858378df12e8d1","observation_id":"4d0a4246-cd10-47af-a22e-b2ef80cf4cbb","resolution":{"observed_at":"2026-08-12T18:53:58.914493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.722241Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.722241Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:6ccf825b67e8e7f77d2b59862383a5d490e7924383f1999942e62b6cbb4302c7","observation_id":"92fdc5f8-79f9-45cc-8fce-0ead5940fce9","resolution":{"observed_at":"2026-08-12T18:53:58.722241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.725433Z","title":"Llm inference unveiled: Survey and roofline model insights, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.725433Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:ac4f98e434ef147b2bbb1953ec31ba60fc926ef8acd9c25935b5fb54f0c897ef","observation_id":"091b585a-d928-4c63-9bef-ad4582ae5f35","resolution":{"observed_at":"2026-08-12T18:53:58.725433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T18:53:58.728292Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.728292Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:fac964f5d5199146d1c453d86833d0fab7c90e42062ccccf16c2dbb69f394a48","observation_id":"96114ba4-97b0-4a2e-82ab-d502a5f31661","resolution":{"observed_at":"2026-08-12T18:53:58.728292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.891180Z","title":"H2o: Heavy-hitter oracle for efficient generative in- ference of large language models","venue":null,"work_id":"6a59cd75-c305-4da5-8afc-35c152841be0","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.731529Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:7c6a4c4fb3ad087917e0e634a51bdc65d500610cff249217a22683b263fa3573","observation_id":"edf02297-787e-4ff1-b456-6570380d7f81","resolution":{"observed_at":"2026-08-12T18:53:58.894605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.882075Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"9f6069cd-a513-4bdf-818a-fc7a6bebf8a4","year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.734590Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:8595867b413be586f1c8464dc835d34f11266c6dd8f696ea1d3386d9f763c39c","observation_id":"91bdd8b7-1edd-4155-b51d-1767b4b4eae9","resolution":{"observed_at":"2026-08-12T18:53:58.885475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.737467Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.737467Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e347dfb967ccbd89fe78b865de476618cf0503d2b2892734df529e373ac69da1","observation_id":"07fb519d-789a-43b0-a989-ce9514a7e432","resolution":{"observed_at":"2026-08-12T18:53:58.737467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:53:58.865914Z","title":"Mixture-of- experts with expert choice routing","venue":null,"work_id":"cde60ce8-bab9-4e5b-971b-86c72ab92d73","year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.740609Z"},"links":{"citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:12df1113b4225098df7df3374e8bc717aa22458097b9f60d4909ca9dc2e2fd88","observation_id":"859ce6be-be1c-4784-b280-8697531af128","resolution":{"observed_at":"2026-08-12T18:53:58.870916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2411.11217."}