{"as_of":"2026-08-08T06:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3def4a04d9292816ba618d092de77613c2b4814233e572f6a434ed732b932372","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:51:37.745029Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:39.550340Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2508.12851","last_updated":"2026-04-15T14:22:25Z","snapshot_observed_at":"2026-07-06T22:14:25.511807Z","submitted_at":"2025-08-18T11:41:17Z","title":"Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T22:52:39.416575Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2508.12851"},"observation_digest":"sha256:e6ceed114569414ccdf600eabcb87412ef5afc580f11e87eb901f832e54354f9","observation_id":"07f98ea7-7877-4bc3-bf7e-72b0de36a718","resolution":{"observed_at":"2026-05-18T22:52:51.896416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-05T17:03:42.658889Z","title":"https://arxiv.org/abs/2401.14361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17137","last_updated":"2025-08-23T20:28:32Z","snapshot_observed_at":"2026-08-05T17:03:28.774673Z","submitted_at":"2025-08-23T20:28:32Z","title":"MoE-Beyond: Learning-Based Expert Activation Prediction on Edge Devices","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T17:03:42.658889Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2508.17137"},"observation_digest":"sha256:ed1f370c9a974529819da2aacc1658cb483c40d7236e179473fd0aef06a80978","observation_id":"94c46255-a666-451d-b290-ce5b4aa13816","resolution":{"observed_at":"2026-08-05T17:03:42.658889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2509.07379","last_updated":"2026-04-09T05:45:21Z","snapshot_observed_at":"2026-08-03T01:38:18.698775Z","submitted_at":"2025-09-09T04:00:43Z","title":"DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T18:33:55.795906Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.07379"},"observation_digest":"sha256:2650ca05ba7c2e9a1be53417c71de1ea15bbdc13c03ded2daba26e3436d31c70","observation_id":"ae163c1c-a6a1-43c3-b44a-7a64dd5ea6a2","resolution":{"observed_at":"2026-05-18T18:36:44.231748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-04T21:51:06.401918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07727","last_updated":"2025-09-09T13:28:41Z","snapshot_observed_at":"2026-08-04T21:51:02.865764Z","submitted_at":"2025-09-09T13:28:41Z","title":"MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T21:51:06.401918Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.07727"},"observation_digest":"sha256:0c0385bfb5331a7a4435ede337e3b6a1be895eceb6622291730366990ae5c564","observation_id":"7a2237d3-2723-437f-bcdc-a3fb5ea9870c","resolution":{"observed_at":"2026-08-04T21:51:06.401918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-04T20:55:19.584295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08342","last_updated":"2025-09-10T07:28:24Z","snapshot_observed_at":"2026-08-07T12:35:47.179422Z","submitted_at":"2025-09-10T07:28:24Z","title":"Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:55:19.584295Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.08342"},"observation_digest":"sha256:3f943a2512f14dbc71fb5e0bb69fde941132e357b7300fdd5bf89e5939ad32cf","observation_id":"16a1edf2-a8f0-4291-aec4-96a3df5d55e6","resolution":{"observed_at":"2026-08-04T20:55:19.584295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-02T18:57:31.493788Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:82b12066df659e8811eef489979755a2a8606f749b6e7a252c3d93efb60c911d","observation_id":"3696400c-f729-49d2-83b5-1c5d6cbeb036","resolution":{"observed_at":"2026-05-18T12:41:22.790153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2601.21198","last_updated":"2026-05-22T06:53:25Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T02:51:59Z","title":"ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T07:43:24.937953Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2601.21198"},"observation_digest":"sha256:29e99fe3836a234666d2e2bf5433b01bd5f938ee182d6277906f9342f3830e16","observation_id":"050f97cd-542a-4526-96d4-9f81eac3ebd9","resolution":{"observed_at":"2026-05-25T07:45:29.207159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.02715","last_updated":"2026-04-30T13:29:54Z","snapshot_observed_at":"2026-08-06T09:38:08.450828Z","submitted_at":"2026-04-03T04:16:01Z","title":"FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:16.466375Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.02715"},"observation_digest":"sha256:1f10c82d2b2d746654440bc17e8a00a8e6c405cce1070237f0f37deed0184008","observation_id":"da4e28d0-5ecc-43b7-a955-3f4bbfc5c878","resolution":{"observed_at":"2026-05-13T20:18:13.312025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.14626","last_updated":"2026-04-23T01:19:26Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:12:51Z","title":"ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T11:28:26.169161Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.14626"},"observation_digest":"sha256:dc0b08149853b8ade2b2ad0da0f07be49f5aac4953cf58fb34d4b81fe96060e8","observation_id":"0f51cc86-66b4-4384-adfd-2d1f08f02b43","resolution":{"observed_at":"2026-05-10T11:30:18.627584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.17182","last_updated":"2026-04-19T00:56:08Z","snapshot_observed_at":"2026-08-03T00:20:06.527897Z","submitted_at":"2026-04-19T00:56:08Z","title":"Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T06:46:52.811371Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.17182"},"observation_digest":"sha256:34c2099e624d5a4a6c3b53a043708c8dae205a7173182ef4d736fb2f034ae7db","observation_id":"4c43c914-c0c0-44b0-afd7-2ed143816c41","resolution":{"observed_at":"2026-05-10T06:51:46.447419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.18788","last_updated":"2026-04-20T19:52:56Z","snapshot_observed_at":"2026-07-31T18:40:43.182032Z","submitted_at":"2026-04-20T19:52:56Z","title":"Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:31:25.826205Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.18788"},"observation_digest":"sha256:a6e7df3ba99e71cc3cc71f46332acc3395662c3b354df2c31e6f85ff65e3b93d","observation_id":"5fbd1d3d-e3b1-4435-8059-2abfea64ee3b","resolution":{"observed_at":"2026-05-10T05:36:02.174701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.05899","last_updated":"2026-05-07T09:11:41Z","snapshot_observed_at":"2026-08-05T02:12:24.336765Z","submitted_at":"2026-05-07T09:11:41Z","title":"VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:22.588945Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.05899"},"observation_digest":"sha256:c9ea9f83a02bf9b88f8b12bb97ec61ce4d0952c6bad028f24949af05c03aaa5b","observation_id":"794d1f12-71e5-4b83-9186-1f73e578f0ab","resolution":{"observed_at":"2026-05-11T16:36:06.468196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.17889","last_updated":"2026-05-19T04:52:32Z","snapshot_observed_at":"2026-08-03T09:31:25.450040Z","submitted_at":"2026-05-18T05:54:30Z","title":"CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T12:07:53.045082Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.17889"},"observation_digest":"sha256:ab89100bfe2492c71af111efab1dcc7faf1357a4682c0854acfb02ae5bf65539","observation_id":"7a8d0425-079a-4154-afa6-63511dc03319","resolution":{"observed_at":"2026-05-20T12:08:15.396632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.19481","last_updated":"2026-05-19T07:34:08Z","snapshot_observed_at":"2026-08-02T01:46:46.351301Z","submitted_at":"2026-05-19T07:34:08Z","title":"C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T02:10:57.582345Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.19481"},"observation_digest":"sha256:5310c1dac516011866c28023b71ce652fc53c3a31609e96962c17ae36b4a4075","observation_id":"81743ddd-ab30-4031-9717-3c676997fcbc","resolution":{"observed_at":"2026-05-20T02:12:58.326430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-06T13:50:23.608176Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:baff577855c8c1d1ceff9e7ba3e1d00169d7a40732d352ab5d50d38d3d87fec8","observation_id":"b4175d1d-845f-4f1c-b391-4bfa1a17e30f","resolution":{"observed_at":"2026-05-20T05:13:03.693206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21428","last_updated":"2026-07-09T17:35:35Z","snapshot_observed_at":"2026-08-03T00:32:09.805300Z","submitted_at":"2026-06-19T13:45:45Z","title":"Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T12:30:55.628115Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21428"},"observation_digest":"sha256:12893c627fbffbf32b9b3e597559cd7a469acfc862f4b114f7a348d313f6e7c6","observation_id":"7b1639c6-c879-4556-8598-1c975e26c877","resolution":{"observed_at":"2026-07-04T07:59:39.552150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-12T13:05:17.273287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21428","last_updated":"2026-07-09T17:35:35Z","snapshot_observed_at":"2026-08-03T00:32:09.805300Z","submitted_at":"2026-06-19T13:45:45Z","title":"Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T13:05:17.273287Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21428"},"observation_digest":"sha256:707e8d9430260fdbadaf45682af04d07e203d0e816dc2b243cd0110bddfd9cfc","observation_id":"98e4b80d-de56-429b-b932-23f96c90d71d","resolution":{"observed_at":"2026-07-12T13:05:17.273287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21712","last_updated":"2026-06-19T19:56:21Z","snapshot_observed_at":"2026-08-06T10:39:09.239289Z","submitted_at":"2026-06-19T19:56:21Z","title":"BatchGen: An Architecture for Scalable and Efficient Batch Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T12:58:25.319255Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21712"},"observation_digest":"sha256:ca10cc9cdd88dc71ddda90065770b66495a7ef73b0f9b175e211bfc50045af8d","observation_id":"7feb9fdd-86cd-4459-b7ab-e676637d5b6d","resolution":{"observed_at":"2026-07-04T07:39:39.555548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21868","last_updated":"2026-06-20T04:10:34Z","snapshot_observed_at":"2026-08-06T05:17:32.033245Z","submitted_at":"2026-06-20T04:10:34Z","title":"WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:40:53.103233Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21868"},"observation_digest":"sha256:2260900aefd128d33f5ee33f4559391e57f95559b00fcaf30049f575ae6bee27","observation_id":"0586afed-f7b3-4eb8-9d54-1716a183b7d3","resolution":{"observed_at":"2026-07-04T07:49:39.570088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-14T13:40:50.742149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10183","last_updated":"2026-07-14T15:02:22Z","snapshot_observed_at":"2026-07-17T23:19:05.305876Z","submitted_at":"2026-07-11T08:00:05Z","title":"Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T13:40:50.742149Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2607.10183"},"observation_digest":"sha256:0f716f37ec30a7bbfa333d1f465fd03640e4d307b8282de75fd2cd83fb0ec661","observation_id":"6863ad4a-8a91-4c67-b247-f838f9f292f3","resolution":{"observed_at":"2026-07-14T13:40:50.742149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-31T15:02:37.574777Z","title":"2401.14361 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24434","last_updated":"2026-07-27T13:44:42Z","snapshot_observed_at":"2026-08-04T22:26:57.428934Z","submitted_at":"2026-07-27T13:44:42Z","title":"DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T15:02:37.574777Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2607.24434"},"observation_digest":"sha256:2a3846a2864b9b115b2e0c3601b43c3208fa16feb4ca581dc325cb2566503d95","observation_id":"43ad2203-067a-49c0-a69e-efe1f2f3fcfc","resolution":{"observed_at":"2026-07-31T15:02:37.574777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-05T00:37:29.052904Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00577","last_updated":"2026-08-01T10:30:01Z","snapshot_observed_at":"2026-08-06T23:17:28.736354Z","submitted_at":"2026-08-01T10:30:01Z","title":"HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:37:29.052904Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2608.00577"},"observation_digest":"sha256:2a8d42e455fc8eb661defb453ef000e9e6a0d5863eba860bddf5907d1ee56025","observation_id":"7dbd1280-86be-4709-a542-8d32f1fd8085","resolution":{"observed_at":"2026-08-05T00:37:29.052904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-06T23:51:37.745029Z","title":"doi:10.48550/arXiv.2401.14361 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04454","last_updated":"2026-08-05T05:09:20Z","snapshot_observed_at":"2026-08-08T06:11:45.276842Z","submitted_at":"2026-08-05T05:09:20Z","title":"Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:51:37.745029Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2608.04454"},"observation_digest":"sha256:d0474a5fa009111bac378c0d2134e9aa19ac64312078b4f29aa6fdf938adbef9","observation_id":"b5f181eb-5125-4db1-8aeb-b2973b4e5ba1","resolution":{"observed_at":"2026-08-06T23:51:37.745029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.14361/citation-record","integrity":"/paper/2401.14361/integrity","json":"/paper/2401.14361/citation-record.json","paper":"/paper/2401.14361"},"outbound":[],"paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T09:09:47.667294Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2401.14361."}