{"as_of":"2026-08-16T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d12642c6f279997c293d59458a9226c626703f255ffa09378d3a698792d90701","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:00:18.175589Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T10:32:50.809236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:36:25.890370Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"cited_work":{"arxiv_id":"2505.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05950","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a1d736a-ecc2-4036-877f-112890ba2864","year":2025},"citing_paper":{"arxiv_id":"2604.26881","last_updated":"2026-04-29T16:47:48Z","snapshot_observed_at":"2026-08-15T01:14:52.485209Z","submitted_at":"2026-04-29T16:47:48Z","title":"FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T10:32:50.809236Z"},"links":{"cited_paper":"/paper/2505.05950","citing_paper":"/paper/2604.26881"},"observation_digest":"sha256:7a3569e8216b5607e35fb1d562d5b1791f3e63e8c9c40085f1e5e2dc9e9d4f86","observation_id":"513369c9-9c91-4e0b-ad07-1138bdc3b9cd","resolution":{"observed_at":"2026-05-12T09:36:25.893028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05950/citation-record","integrity":"/paper/2505.05950/integrity","json":"/paper/2505.05950/citation-record.json","paper":"/paper/2505.05950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T23:00:17.731611Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.731611Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9ccbcd59020e9e82fa8bb657a4aa31785cb3dbd5013d82ca60b0eaa32e5b6f28","observation_id":"677af2a7-ab45-4cc1-a6cf-26fd2a0eb536","resolution":{"observed_at":"2026-08-15T23:00:17.731611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-15T23:00:17.739273Z","title":"J., Javaheripi, M., Kauffmann, P., Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.739273Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:018a3d43c7920469478de79f9089033665f9b63ad25f6d920fc17b728ccd87c8","observation_id":"bab1eeb2-937e-47af-a381-8421766f1a6b","resolution":{"observed_at":"2026-08-15T23:00:17.739273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-16T14:35:22.530960Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-15T23:00:17.745925Z","title":"C., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.745925Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:c12cadc88eec25b9bf7cc7bef1a10671c1562b692a03d6d2d2394fe812592888","observation_id":"3a684dc7-b459-4971-9310-dbc1ee9f3a79","resolution":{"observed_at":"2026-08-15T23:00:17.745925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.751415Z","title":"Y., Rajbhandari, S., Awan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.751415Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:bb265cc2a53bbdb63646e92ecbb702021978f92fcd23bbc11313114d574b89c1","observation_id":"e76686a2-ee19-4dfa-b3fa-d00fbaa16392","resolution":{"observed_at":"2026-08-15T23:00:17.751415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.216430Z","title":"and Shaji, A","venue":null,"work_id":"a6d8e382-b463-49c2-b2e2-2ce1bf6a544f","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.757214Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:465c05678ceee1c9ebc8483b36ce9b4b63f28eb5463d4b8e48047e7d43799a56","observation_id":"d76b3fe7-ac24-4bae-bad1-10d4219a1f68","resolution":{"observed_at":"2026-08-15T23:00:20.224588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-14T05:16:26.901405Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"cited_work":{"arxiv_id":"2411.11217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11217","snapshot_observed_at":"2026-08-15T23:00:19.435484Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","venue":"cs.DC","work_id":"7d33d0fc-8af2-4c03-bc04-8049f1594a2c","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.763102Z"},"links":{"cited_paper":"/paper/2411.11217","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7f97a4a8857106c095504bd0084a26e54127180720e26462a9b02749bd9c429f","observation_id":"3ce825a4-85b8-4bf8-b9a9-d13331b3daf9","resolution":{"observed_at":"2026-08-15T23:00:19.443779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.191098Z","title":"Active multi-task representation learning","venue":null,"work_id":"56fc214a-e8c4-4302-bbe9-233e41e3160a","year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.769821Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:bf713074b8604f66946c593ae1968b667465c9a9aec47be20da9d77feaa16230","observation_id":"c5e29aa8-6157-4dfb-9fbe-580f2760c38a","resolution":{"observed_at":"2026-08-15T23:00:20.199982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-15T23:00:17.775307Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.775307Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:eb64495fab615168d6f4c1c02b7545eec38928e74f2519f3b075d8196cc98d1e","observation_id":"bfe644cd-5cd9-4aa9-abd9-01ff6d4eabea","resolution":{"observed_at":"2026-08-15T23:00:17.775307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T23:00:17.782233Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.782233Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:00e4e4a5e4ef7e1d625ab5e796911285014d38133e036b3a65c120d8dabf2714","observation_id":"52f07ce0-f174-4036-9d54-5bba9f6fc698","resolution":{"observed_at":"2026-08-15T23:00:17.782233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.791097Z","title":"D eep S eek M o E : Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.791097Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:0486e32123b7cddf5d2cbec74274b1d8990e131c68f6277a0139b0932c557987","observation_id":"327c293c-9f4a-49ae-95b0-424966f745af","resolution":{"observed_at":"2026-08-15T23:00:17.791097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.799618Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.799618Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:d371e6442e384c4b09e7cf503be6b38da32466ac06c66867ba533b703f552933","observation_id":"727dac6a-b239-4e5c-b196-f08320653ecf","resolution":{"observed_at":"2026-08-15T23:00:17.799618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T23:00:17.806520Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.806520Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:678415262c5d5ed4b7a2c9f24aad181f5eccaf1db4ba2ab8e36f66fd065356f9","observation_id":"47029fd0-e2e1-477d-88f6-0b58449e6d6d","resolution":{"observed_at":"2026-08-15T23:00:17.806520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09434","last_updated":"2021-03-30T04:06:04Z","snapshot_observed_at":"2026-08-11T02:57:05.885018Z","submitted_at":"2020-02-21T17:30:00Z","title":"Few-Shot Learning via Learning the Representation, Provably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09434","snapshot_observed_at":"2026-08-15T23:00:17.816788Z","title":"S., Hu, W., Kakade, S","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.816788Z"},"links":{"cited_paper":"/paper/2002.09434","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:5bd2cf5f49adc279da6e4ca62f67403bafad8b1ce38dc39270e22c97c54f6de7","observation_id":"7a525660-27d3-4001-9f46-2fccff125050","resolution":{"observed_at":"2026-08-15T23:00:17.816788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T23:00:17.823318Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.823318Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:6ef4354cf222365556dcd73ac3ac0981ded0fc758bce3e0360a44db28df4ad93","observation_id":"cbdf6ffa-d052-4180-8de0-69afaa65e337","resolution":{"observed_at":"2026-08-15T23:00:17.823318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.140864Z","title":"mixtral-offloading","venue":null,"work_id":"67ac9d6a-83cc-49a1-9a50-0e03632eeae7","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.828971Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:f447e25411f772e670b08dba6721d6f9e20711e1cf99ba8e391e87fd735b99ed","observation_id":"725c3151-30e9-4283-8e9a-ce509f742b17","resolution":{"observed_at":"2026-08-15T23:00:20.148601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-16T14:31:04.390700Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-15T23:00:17.834440Z","title":"and Mazur, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.834440Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:c07f320f1f96c033d1240fba8883f718415e9593395fc6b996a4a7b0d0011038","observation_id":"24a75ecc-bda2-479a-a402-2e51d3870d32","resolution":{"observed_at":"2026-08-15T23:00:17.834440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.840069Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.840069Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:364333b74efa262a617ce2e7aa167336429eb1170eb4eafebfc0100efd3981ef","observation_id":"84ee202f-5eb4-4359-804f-d3be1ea19b8d","resolution":{"observed_at":"2026-08-15T23:00:17.840069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.097555Z","title":"and Alistarh, D","venue":null,"work_id":"ad998f8c-dd94-459f-8d61-a3eec4831ba2","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.846718Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:590c3eb3d58a093e17a73aaa5b1f2a65dbf5a5d41a04f5e95ff3882688be4144","observation_id":"c143d9d5-eff0-4231-8ad8-99bb8ed62d2c","resolution":{"observed_at":"2026-08-15T23:00:20.108972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.852078Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.852078Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:e4037e3e2d8b30ea0250106a718a5b5dde71cb1ff9545b05c99b662bdafc2781","observation_id":"bab7de65-c6fd-478b-9bbd-083636a3e1e6","resolution":{"observed_at":"2026-08-15T23:00:17.852078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.857019Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.857019Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:b3aaca179fdf5ab8cc8d6b3083ace8b3ae81dd658d1743bd39ffea83a6c45e66","observation_id":"90db61db-82a7-4a3e-83e0-43e8603c7159","resolution":{"observed_at":"2026-08-15T23:00:17.857019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.863141Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.863141Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:39f5a73a74626bbc0badf03e45b6ed0e7d1b4891ff99fd2024327243c2902690","observation_id":"28e977d2-584b-4820-88f5-c5ecb758d738","resolution":{"observed_at":"2026-08-15T23:00:17.863141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.035078Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":"7a51bcb3-1d8a-4bb3-b3b6-68bb1fbe2290","year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.869011Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:19ef06cdc2d1f18e55e5a91d047e1d18f552931f7a4896fba430e03c4e8d6267","observation_id":"bb5fd3d0-45d8-4e20-b9d1-6287cebae18b","resolution":{"observed_at":"2026-08-15T23:00:20.041897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01366","last_updated":"2024-12-27T17:49:34Z","snapshot_observed_at":"2026-08-16T13:22:00.890575Z","submitted_at":"2024-09-02T16:41:44Z","title":"CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification","version":2},"cited_work":{"arxiv_id":"2409.01366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01366","snapshot_observed_at":"2026-08-15T23:00:19.144757Z","title":"CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification","venue":"cs.CL","work_id":"d979e774-86ef-4044-a762-f8e469d2094e","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.875990Z"},"links":{"cited_paper":"/paper/2409.01366","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:0d9714755237fa1571318493626cebbce80763a1b1e34d68c702549ca0f47568","observation_id":"41ee817b-2f93-4290-b901-4f84ed2fac7c","resolution":{"observed_at":"2026-08-15T23:00:19.156537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T23:00:17.881727Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.881727Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:c2b9ab1661ab74926fe848017a43202519df72ea3227e93527785605ddefc27f","observation_id":"3b58a5f5-e855-4a40-b0c3-80347f028c66","resolution":{"observed_at":"2026-08-15T23:00:17.881727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.012402Z","title":"Pre-gated moe: An algorithm-system co-design for fast and scalable mixture-of-expert inference","venue":null,"work_id":"2b037a25-a68c-402f-88d4-7114ee0a7957","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.887270Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:68d55ef1319c807208a818f8961b41ae2dc54f707057fef16d969cb2a27251fc","observation_id":"0480f9b6-fb16-4211-b02d-6eb2c6daaf25","resolution":{"observed_at":"2026-08-15T23:00:20.020055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T23:00:17.896175Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.896175Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:92ae5c6b3fd43e92b3e2e058cbf457c58bc09a013a2f533376b2e34e2e1aec1f","observation_id":"86d25de5-e46b-41be-8515-7729a727dab2","resolution":{"observed_at":"2026-08-15T23:00:17.896175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.902621Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.902621Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:a43d1e233b509da863df2406b0bbdc14a9ccc1dcdc45c756336c57282bc24682","observation_id":"c6483c91-a401-4d11-a347-f66fe7148c14","resolution":{"observed_at":"2026-08-15T23:00:17.902621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-16T14:19:38.353904Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-15T23:00:17.909669Z","title":"Fiddler: Cpu-gpu orchestration for fast inference of mixture-of-experts models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.909669Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:21aab786c80d2ae32df5984c72ca131fb9d7bf07f6674879fc62433f8402b7aa","observation_id":"1ede6a3e-f848-411e-952d-fd84810af759","resolution":{"observed_at":"2026-08-15T23:00:17.909669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.954408Z","title":"S wap M o E : Serving off-the-shelf M o E -based large language models with tunable memory budget","venue":null,"work_id":"a2cabd8a-059e-437b-8723-13acd34336d3","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.918029Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:eac6c418972999501c7759d918ea64feefa328e26bbaece1ca85df244cb7c94d","observation_id":"b9869fc6-dd19-4af2-89c0-e12f69f572a6","resolution":{"observed_at":"2026-08-15T23:00:19.964733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.926214Z","title":"CATS : Context-aware thresholding for sparsity in large language models","venue":null,"work_id":"de30c521-edb8-4286-9426-ece73981dae1","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.923383Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ad30d7627e35d5dc17f20adddfa6cbef6284b375f1325b304ea42874e4876f48","observation_id":"2f39fe42-3c72-43c4-b54d-70ead58ce9c4","resolution":{"observed_at":"2026-08-15T23:00:19.937766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.903837Z","title":"InfiniGen : Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":"0f16f4b4-ea34-4bf1-8257-ce283dec6cc5","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.930729Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9d7f4590408bfbbffa067a627d96524be399b565fb9f1eac9eb4cc3f926ddea9","observation_id":"ccd9857e-4fa1-42d1-835d-18a12ca7d368","resolution":{"observed_at":"2026-08-15T23:00:19.910507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14690","last_updated":"2025-02-25T21:00:50Z","snapshot_observed_at":"2026-08-16T13:23:39.871672Z","submitted_at":"2024-08-26T23:30:15Z","title":"Training-Free Activation Sparsity in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14690","snapshot_observed_at":"2026-08-15T23:00:17.937817Z","title":"Training-free activation sparsity in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.937817Z"},"links":{"cited_paper":"/paper/2408.14690","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ca98a3959be44b4e13dc639de589c0972376f535058175e14e413be28856f128","observation_id":"721b679f-5e19-4d5b-8847-d32c9d840572","resolution":{"observed_at":"2026-08-15T23:00:17.937817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.873604Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"c8bbfdac-a30e-43e4-a1a4-cc99ca2aa2d3","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.944379Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:51092985117973ab874c157075a0aaaf2aeb6ccfeec4c120dd6ccd84503e391a","observation_id":"90acd159-9eae-44a2-be46-2df4ef83b4a5","resolution":{"observed_at":"2026-08-15T23:00:19.883330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.845566Z","title":"llama.cpp","venue":null,"work_id":"9ebeee57-45d0-4814-bf35-8bab19c37c2f","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.952242Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:e2f2113fa20ca588492c81cc8d417712dba73f61f00e9aa6bcedff6637901fcc","observation_id":"12c6a7b1-854a-4a6f-9f98-cd25bd05f0a2","resolution":{"observed_at":"2026-08-15T23:00:19.857973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.821081Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":"0ae6ee03-1f6c-4fbe-b8e7-c2bea966c79d","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.960800Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8f0b37ddd498e47f96476b619a74493f6a44f2b9eac6368b20e808c891850062","observation_id":"2e1be1af-7e6a-4334-80b9-d51fcc0d4362","resolution":{"observed_at":"2026-08-15T23:00:19.829297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.966839Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.966839Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:0d12fc0d716c72fb22336b8d3d45db3cbc3b25f38f656218ef4ab52c41c6ad51","observation_id":"fa720d6d-75bb-44eb-b3f7-6cdfe7b87cfb","resolution":{"observed_at":"2026-08-15T23:00:17.966839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.781100Z","title":"Deepspeed-mii","venue":null,"work_id":"3e4171b3-51dc-4a7f-9700-1acce6bfa96a","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.973800Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:48faec5445ef4c00f83b86091faf0d73e070e37884987b6454801a36ca5e83ba","observation_id":"8298ebcf-7fd1-4210-a33b-d5de6894be62","resolution":{"observed_at":"2026-08-15T23:00:19.787328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-13T05:55:10.276333Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-15T23:00:17.983480Z","title":"C., Tuzel, O., Samei, G., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.983480Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:fdf73f4455fe65aaef7546a1b8a8c81e3b555706b028f1f1de94cb8ee3c0b3b0","observation_id":"4996bea5-75f8-4329-9f3b-c6a878ea5b9c","resolution":{"observed_at":"2026-08-15T23:00:17.983480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T23:00:17.989790Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.989790Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:d5d358dbe8fd64de67010b5241befca7c1db2214199f174f92e9df2c429b98ca","observation_id":"cdc1ba83-bfda-4c95-86b3-d3ca038e1f71","resolution":{"observed_at":"2026-08-15T23:00:17.989790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.752394Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"da51540a-a1f2-4fb7-bba2-e8418d673f10","year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.995847Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ffdd8e911e24480948696080cbc27947bcef34e8900ee3532dbf987f0ff6cbd3","observation_id":"d91d0e5e-58af-4a06-8580-15f3e665cb1e","resolution":{"observed_at":"2026-08-15T23:00:19.759512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.005803Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.005803Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:de560459a30809ec6e10292b4469c904218f44fe19386b9f6b3c3b59952b2632","observation_id":"02c19407-6e5e-4461-b6bc-a9ab78ee0377","resolution":{"observed_at":"2026-08-15T23:00:18.005803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.015066Z","title":"Zero-infinity: breaking the gpu memory wall for extreme scale deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.015066Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:e7a04f435cb41d5ed97aa3f2aec882219996e1e1ce839ce5f8a3ecad5e4c0c6f","observation_id":"9a578f77-24fc-484b-916a-488691c6535a","resolution":{"observed_at":"2026-08-15T23:00:18.015066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-15T23:00:18.021867Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.021867Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:4726e00bf2fbd94689567d70aeb760ae8a5f4155244852aa29442ffbe24d33d9","observation_id":"247c01b2-1b5e-4d2e-a3be-0c67cf207d01","resolution":{"observed_at":"2026-08-15T23:00:18.021867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.710407Z","title":"Edge-moe: Memory-efficient multi-task vision transformer architecture with task-level sparsity via mixture-of-experts","venue":null,"work_id":"09139836-2224-47ac-9721-b31e445ea627","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.027790Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:63ad5483638996f6dab59345d0716d9977bb53a43f1471f32dd70fc17a1fefcc","observation_id":"379bb1b7-2012-488b-85e8-dd56140309c9","resolution":{"observed_at":"2026-08-15T23:00:19.716571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.684897Z","title":"Sharegpt","venue":null,"work_id":"98f1416a-9827-4a03-ac36-70f089400937","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.033475Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:3b3b3709b70d5b8264795042d3c73626c8e5e498b986bd4d308b92f0482cfdfd","observation_id":"743ac543-05d0-4955-94e1-eb0d5c5b87b2","resolution":{"observed_at":"2026-08-15T23:00:19.694207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-15T23:00:18.040770Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.040770Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:797206736cc5a6c3af71f98cbc3e8bef708cd28e813eddc871bcfebff658979a","observation_id":"3229b3bf-af95-4555-b7c4-e6dd604ab33e","resolution":{"observed_at":"2026-08-15T23:00:18.040770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.661938Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"57b54ace-18ec-44ea-ac37-40a5271a774b","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.046116Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:45f447b92405b826dc6da19597b526c7c76fefda8c9c1f733b0787dc5ef4fe77","observation_id":"6c7eeb3d-bca8-4529-b9cc-75833d975c4d","resolution":{"observed_at":"2026-08-15T23:00:19.670024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12692","last_updated":"2025-01-24T05:12:22Z","snapshot_observed_at":"2026-08-12T22:04:48.624816Z","submitted_at":"2024-11-19T17:59:12Z","title":"SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12692","snapshot_observed_at":"2026-08-15T23:00:18.053935Z","title":"Sparseinfer: Training-free prediction of activation sparsity for fast llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.053935Z"},"links":{"cited_paper":"/paper/2411.12692","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8e78f726ea04041c3f197ebb1b8d0bef9a932e647abeb3512001162253d0dcb9","observation_id":"79b653c8-7925-4814-85c9-3af318e79a75","resolution":{"observed_at":"2026-08-15T23:00:18.053935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13516","last_updated":"2025-01-07T05:26:54Z","snapshot_observed_at":"2026-08-16T14:16:44.568003Z","submitted_at":"2024-02-21T03:58:49Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13516","snapshot_observed_at":"2026-08-15T23:00:18.060634Z","title":"Prosparse: Introducing and enhancing intrinsic activation sparsity within large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.060634Z"},"links":{"cited_paper":"/paper/2402.13516","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1b2ff2218a36fb677006ce15c4588f2e1809e5b656ba65849ac757b8f628991b","observation_id":"020fa894-8bee-4aa0-81da-03f28f859508","resolution":{"observed_at":"2026-08-15T23:00:18.060634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22134","last_updated":"2025-09-01T03:51:09Z","snapshot_observed_at":"2026-08-16T13:04:55.724012Z","submitted_at":"2024-10-29T15:31:27Z","title":"ProMoE: Fast MoE-based LLM Serving using Proactive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22134","snapshot_observed_at":"2026-08-15T23:00:18.068102Z","title":"Promoe: Fast moe-based llm serving using proactive caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.068102Z"},"links":{"cited_paper":"/paper/2410.22134","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:37edc7364825c23713c6405e098ec2c3e4f3ec0a80f3ec5bb5c8a76181ff4cfe","observation_id":"c8f6bcbe-b074-4bbf-b084-00f63654d330","resolution":{"observed_at":"2026-08-15T23:00:18.068102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-16T13:44:42.217529Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-15T23:00:18.080046Z","title":"Turbo sparse: Achieving llm sota performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.080046Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:994f4c3daa8f7adf50ffcbd1f0d49688410e72f5a03bfcb64b3d9b5b0ce9a303","observation_id":"84f9b36d-d5ba-4aa4-8804-3ff60ef17578","resolution":{"observed_at":"2026-08-15T23:00:18.080046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-15T23:00:18.088388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.088388Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8f7efde4edf15775f33607e7e0f5db65cae2fb447caf82e7d4fc5b288f564199","observation_id":"fc400941-896c-477b-a247-7d5c13026a17","resolution":{"observed_at":"2026-08-15T23:00:18.088388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01433","last_updated":"2024-11-06T01:49:45Z","snapshot_observed_at":"2026-08-16T13:03:29.317209Z","submitted_at":"2024-11-03T04:25:46Z","title":"HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01433","snapshot_observed_at":"2026-08-15T23:00:18.099183Z","title":"Hobbit: A mixed precision expert offloading system for fast moe inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.099183Z"},"links":{"cited_paper":"/paper/2411.01433","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:77c5d2867caf414b310b39b8874dbd393001ed33faba565b573d48977948d612","observation_id":"020ce44c-6145-4969-b276-bd807a80f7a2","resolution":{"observed_at":"2026-08-15T23:00:18.099183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.105373Z","title":"Qwen1.5-moe: Matching 7b model performance with 1/3 activated parameters\", February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.105373Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1f0f0ba598e28e2b4e9602e21965ddf897ee930bda42d6d08c67e5adb0d97371","observation_id":"c5e2268d-4170-42b0-8a56-6860916b885c","resolution":{"observed_at":"2026-08-15T23:00:18.105373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08306","last_updated":"2021-05-18T06:46:48Z","snapshot_observed_at":"2026-08-12T21:08:24.924071Z","submitted_at":"2021-05-18T06:46:48Z","title":"Sample Efficient Linear Meta-Learning by Alternating Minimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08306","snapshot_observed_at":"2026-08-15T23:00:18.110331Z","title":"K., Jain, P., Netrapalli, P., and Oh, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.110331Z"},"links":{"cited_paper":"/paper/2105.08306","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:fc676fa5a3134eb82b2317fef5def9ab1ab8cc648fc8d08b08a57b77a73d9843","observation_id":"34b0b7a3-6ade-4a8f-bae6-82b815c30366","resolution":{"observed_at":"2026-08-15T23:00:18.110331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.117468Z","title":"T., and Cox, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.117468Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:c3c8feabf909e3829c0a698c29a391726f2b0425ac94c200bdcd003087ddc06e","observation_id":"9e445290-c782-4165-9ed4-658d4a891137","resolution":{"observed_at":"2026-08-15T23:00:18.117468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.617630Z","title":"On the theory of transfer learning: The importance of task diversity","venue":null,"work_id":"39a2540c-810b-4356-9660-ccab5940faa5","year":2020},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.125925Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:b32b3105c9da1e5f17356f844a1d1ed8b85726eb480a9c094ab46d77480cd71d","observation_id":"e16e6808-ffae-4924-abbe-99bd90483fdc","resolution":{"observed_at":"2026-08-15T23:00:19.626650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.593980Z","title":"Provable meta-learning of linear representations","venue":null,"work_id":"4fc0c14e-765b-4fc3-badd-fd32133617d6","year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.133442Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:e1aa84a8ee1d29af8879643deed4626a44434cb02283aed6a02c73d9c113dff2","observation_id":"ab80d049-fdd9-4250-8266-c4ec26090e30","resolution":{"observed_at":"2026-08-15T23:00:19.600418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.569721Z","title":null,"venue":null,"work_id":"6f2b24c0-be39-4773-9d16-1008e25220d4","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.140080Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:98b8468c42a8aeccd1568c20482d8ea38add9dfe05543b5472d9ef4be13039bf","observation_id":"2300d282-1841-401c-aa6a-b3c072c8df32","resolution":{"observed_at":"2026-08-15T23:00:19.577922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-16T14:24:28.560017Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-15T23:00:18.147537Z","title":"Moe-infinity: Activation-aware expert offloading for efficient moe serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.147537Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:cc7c49e7f380660aa5af93bc326bb9a4937c7df81ae584dd3993a0d03f7afc0c","observation_id":"adff6728-d4ce-4fc3-aca1-7179da0c7abd","resolution":{"observed_at":"2026-08-15T23:00:18.147537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-16T13:44:33.550467Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-15T23:00:18.153988Z","title":"Powerinfer-2: Fast large language model inference on a smartphone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.153988Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:dc60e8c4cc41247252bcd718494b87448210ade8ea93743754da6b59392b7b0c","observation_id":"fc9a2071-2c3c-4899-ad54-d6cbf007e740","resolution":{"observed_at":"2026-08-15T23:00:18.153988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.161527Z","title":"and Ananiadou, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.161527Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:37e634f825c6fbaba5c7668e6b59e0e095e7e9c36569921a4567c07a30c0bebf","observation_id":"9f415b45-5a5a-40e4-9337-3a562c093362","resolution":{"observed_at":"2026-08-15T23:00:18.161527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-16T14:21:06.240224Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-15T23:00:18.167395Z","title":"ReLU ^ 2 wins: Discovering efficient activation functions for sparse llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.167395Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ecdf003ab9fd0e39c751be31df2ef6d40e96b4688d2459d5a7c947701e076abe","observation_id":"cc91911b-4e65-4197-9ca3-932ce986b3eb","resolution":{"observed_at":"2026-08-15T23:00:18.167395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.175589Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.175589Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:0a6e080229a52772c9aca810d1e1eaff41835c434fde4e984e8efb328d5eb942","observation_id":"9ccd1920-6cc0-40bd-85c3-af1cdb5f9d27","resolution":{"observed_at":"2026-08-15T23:00:18.175589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:42:50.887857Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2505.05950."}