{"as_of":"2026-08-09T20:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:926c8b8ebd50691c636fe1f1511462727816354ac7c28333394205d9587fc887","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:55:54.179967Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:18:55.137694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06888","snapshot_observed_at":"2026-08-01T21:09:07.413164Z","title":"Klotski: Efficient mixture-of-expert inference via expert-aware multi-batch pipeline, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16184","last_updated":"2026-07-17T17:58:29Z","snapshot_observed_at":"2026-08-05T03:58:48.412708Z","submitted_at":"2026-07-17T17:58:29Z","title":"PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:07.413164Z"},"links":{"cited_paper":"/paper/2502.06888","citing_paper":"/paper/2607.16184"},"observation_digest":"sha256:38f5e69bcbbbdf61e38f34a6c6bec3e6935af830966115ff2fca51b8b4642339","observation_id":"b8cfa569-b997-4d2e-8566-6a2f79b8da59","resolution":{"observed_at":"2026-08-01T21:09:07.413164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06888","snapshot_observed_at":"2026-08-02T10:18:55.137694Z","title":"InProceedings of the 39th International Conference on Machine Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24787","last_updated":"2026-07-30T11:13:04Z","snapshot_observed_at":"2026-08-09T05:23:41.747289Z","submitted_at":"2026-06-24T04:53:00Z","title":"SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:55.137694Z"},"links":{"cited_paper":"/paper/2502.06888","citing_paper":"/paper/2607.24787"},"observation_digest":"sha256:edb5724238ee7d6dd8596451a102e5dc59bfa9782d20e8919aa71c9ff527c700","observation_id":"9200c61e-ff8a-4cbd-8ab1-6e017ec13f5d","resolution":{"observed_at":"2026-08-02T10:18:55.137694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06888/citation-record","integrity":"/paper/2502.06888/integrity","json":"/paper/2502.06888/citation-record.json","paper":"/paper/2502.06888"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:55:53.972786Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.972786Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5dfe0717a755f8b6aca8b3dd5c250770b8919bac723474e3bbfd7aaf0bc4b888","observation_id":"0ef96a6d-4d34-43b9-a9ab-1f8e344c297a","resolution":{"observed_at":"2026-08-08T17:55:53.972786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.835104Z","title":null,"venue":null,"work_id":"aa3a582a-a92b-4388-8930-40460cc720de","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.977428Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5020494b0b18afe30e419bd8e6d8f47e2e1b0be3807a4047699fd04dd4b5f3fa","observation_id":"1a94c703-675e-437f-925b-0f60fc184649","resolution":{"observed_at":"2026-08-08T17:55:54.839394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.821685Z","title":null,"venue":null,"work_id":"f76aad9c-0975-4298-ba82-9bc0979e9c4e","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.981537Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:8085cb489afc163fdc480e889263cbf22e740010290f4e71ea55f7785730b016","observation_id":"b7920495-143b-4492-97b1-9b1894a644ee","resolution":{"observed_at":"2026-08-08T17:55:54.825897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:53.985624Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.985624Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d03fc00bad358638381b9b138d7df57f3080ed331a696e24b2204524268e1b10","observation_id":"074346d6-7415-4129-878b-dd37582f0fc5","resolution":{"observed_at":"2026-08-08T17:55:53.985624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-08T17:55:53.989609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.989609Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:7c8bb8648003aa6016953d2412c26ce1274e4c1c6fa7e6a4f254be7bcf3fabeb","observation_id":"0c4c9ff6-f8e7-4997-a1e5-45a01bcc93b7","resolution":{"observed_at":"2026-08-08T17:55:53.989609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T17:55:53.994050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.994050Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:033b93ab997bbf80f356db399a3b8fcef99016e14427382892928ad3a4e260b5","observation_id":"3f1b0cd1-8d68-490a-884a-4d81a6bd0aa5","resolution":{"observed_at":"2026-08-08T17:55:53.994050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:53.998912Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.998912Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:ff8e07ae80dc63e888db530b024d4fa6b0ad2f6fc230b4d5ddb87db87050d6b5","observation_id":"7a23ba02-97f6-4c70-bbca-da1a1394d73e","resolution":{"observed_at":"2026-08-08T17:55:53.998912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18859","last_updated":"2024-05-17T23:33:23Z","snapshot_observed_at":"2026-07-06T16:40:00.062668Z","submitted_at":"2023-10-29T01:08:55Z","title":"SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models","version":2},"cited_work":{"arxiv_id":"2310.18859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18859","snapshot_observed_at":"2026-08-08T17:55:54.454031Z","title":"SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models","venue":"cs.LG","work_id":"01c9a486-6086-4aac-a4cf-27957fb2c534","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.006941Z"},"links":{"cited_paper":"/paper/2310.18859","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:70ecb43cd07af1ea41a6a88622c3670b9e8a7e9d428afdce4be412760fc331c2","observation_id":"b34b1bb8-ba6b-420f-a049-80e576840b72","resolution":{"observed_at":"2026-08-08T17:55:54.460747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-09T05:23:39.113435Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-08T17:55:54.011111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.011111Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:b009871c6f557775cd99af1416b20f76b46060c4af1fdac5900ea264b9bcf37b","observation_id":"f5067132-b344-48c8-9b72-3580ed10c4d3","resolution":{"observed_at":"2026-08-08T17:55:54.011111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.014987Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.014987Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:486652cde8d617e27a3656ce5f947deb047d4b217aa023fa54b77211c7cf61db","observation_id":"1d0d65fb-3ec1-41d5-83a5-50e04574865d","resolution":{"observed_at":"2026-08-08T17:55:54.014987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.782201Z","title":null,"venue":null,"work_id":"a88f298b-4ac0-4ac8-8dd6-bf288f46aba6","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.018729Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:c32214fed7823eab102eba77ce140976525483ab710c544db7f31ae849c1c837","observation_id":"853d811d-c72c-42c9-bba4-d5d43cdbb1be","resolution":{"observed_at":"2026-08-08T17:55:54.786223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-08T17:55:54.022408Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.022408Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:00ed6f30b2984e929a9eef2d3fbc10cc948ea335cb4018e33cd19902aab66790","observation_id":"ba7e8c3f-6f5a-4b56-a130-708c6edc4eef","resolution":{"observed_at":"2026-08-08T17:55:54.022408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.026213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.026213Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:cff226ff7c6473cac52328659f96802f8ea90e765409f0a1ec690ac41ebaa43c","observation_id":"50092783-68ea-4ced-b90f-c85bfe8f7477","resolution":{"observed_at":"2026-08-08T17:55:54.026213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.747716Z","title":null,"venue":null,"work_id":"c560e55a-59e7-4303-b8d7-a546adb75a82","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.034378Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:380790dfd3d2d4f126f29ce4bcb357e0720b5f1a93fb0978a732d03c076beb70","observation_id":"c2c1b2f1-3caa-4084-a0e0-a75a9791898d","resolution":{"observed_at":"2026-08-08T17:55:54.751724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.734622Z","title":null,"venue":null,"work_id":"e216bf7b-3c34-43c4-b28b-084a6522b71f","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.038149Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:28ba85da46909aae2f6c287ee3566d8a6fba30c2e3a49fa5dbc3331daa860481","observation_id":"7dc608f5-83e9-4876-a87d-9ae75b0b4bf0","resolution":{"observed_at":"2026-08-08T17:55:54.738882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-08T17:55:54.042509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.042509Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:3a4da66639ae700236338353c37f22c305333f19b0d5a98e48c0b7ff4ea1078e","observation_id":"cca8c0a0-3680-428a-9ec0-d540affbe1ac","resolution":{"observed_at":"2026-08-08T17:55:54.042509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.721127Z","title":null,"venue":null,"work_id":"51d1715a-1d52-4a23-97dd-2bba8df56f2c","year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.046993Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:240f31fecb5fc8d0571e0f7a483109245f4e763890496518d66ca7bfb1205b9b","observation_id":"f579edf9-58d3-4158-9784-dca19793ab32","resolution":{"observed_at":"2026-08-08T17:55:54.725625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.051424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.051424Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:dfd929320b0687e69ea602c2ecd6e85b7643baca075df9a1616e120bb6b3aa16","observation_id":"88ebd988-8df7-4a61-959e-bb7a0b28f68b","resolution":{"observed_at":"2026-08-08T17:55:54.051424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T17:55:54.055733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.055733Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:ed9fd494f277924288c039129c554ff07df4a4f9bbad574d1a9dd4b0916e59a8","observation_id":"9d0a20a1-2833-44cc-89dd-30f4d1403fd6","resolution":{"observed_at":"2026-08-08T17:55:54.055733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-09T13:36:43.757746Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-08T17:55:54.060149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.060149Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d071a6262fc511c3f6592fe18fcd62c624d8c3d0d035fd5b786ed156564eb1ac","observation_id":"9b9f8d09-ed6f-4bfd-bf6f-9d55235cdc6e","resolution":{"observed_at":"2026-08-08T17:55:54.060149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02410","last_updated":"2023-10-03T20:11:23Z","snapshot_observed_at":"2026-08-09T14:15:22.508517Z","submitted_at":"2023-10-03T20:11:23Z","title":"Mixture of Quantized Experts (MoQE): Complementary Effect of Low-bit Quantization and Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02410","snapshot_observed_at":"2026-08-08T17:55:54.064593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.064593Z"},"links":{"cited_paper":"/paper/2310.02410","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:29cd640d725389ac1df344ede8c2b0453f17df6bb9a57d7e513d8b194dcf3339","observation_id":"4ec2ac85-67b6-4824-9958-65a005ddc5a5","resolution":{"observed_at":"2026-08-08T17:55:54.064593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-08T17:55:54.069319Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.069319Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:47371630b6ba7466419fdb01d3f458b0bdd8fe1e90b18c52f37b272c914e1a5f","observation_id":"d9b0d394-7fd8-46d4-b558-4a100ba97f62","resolution":{"observed_at":"2026-08-08T17:55:54.069319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.699305Z","title":null,"venue":null,"work_id":"aa3e4b6f-3c7f-4615-9559-369e72bcdb73","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.073528Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:7b315b0b96ae1bcd4361c546b96fc030ed76ca06f607671ee9c7c3b19945fb04","observation_id":"04c39c6b-8dd7-4924-81e4-a83b86d9ca98","resolution":{"observed_at":"2026-08-08T17:55:54.703495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-08T17:55:54.077454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.077454Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:ebf73306c8babc9bc0b7bf46cb856cadd7adaac6a19761d22765bcf25f8c9ab1","observation_id":"a8635c0a-9891-4e9b-ae76-cfe348380a88","resolution":{"observed_at":"2026-08-08T17:55:54.077454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.685701Z","title":null,"venue":null,"work_id":"00949c5a-852d-4b0f-9a86-1eb733db321b","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.081513Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:62c0d102b70a7776baff67c2128a68728f06e93528a05190b50034b48c42fbea","observation_id":"9bad0993-f89f-43fc-ab0a-bcaa7334cf37","resolution":{"observed_at":"2026-08-08T17:55:54.689960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.085588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.085588Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:f84570a41de7dcb583a0766e0776a92b5991d8860ddf88455dc4998e2257e09e","observation_id":"ff5671d5-65f1-4049-811d-e4ef6b56e923","resolution":{"observed_at":"2026-08-08T17:55:54.085588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.089521Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.089521Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:fcb05b8bb3ca886bc10272cd73a4ea55040bfeac58997de069d11b88368aa11c","observation_id":"5baa16e9-5350-4773-8001-785260aa7968","resolution":{"observed_at":"2026-08-08T17:55:54.089521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.098055Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.098055Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:79162079461f9ca48e17be7c0f414fe2284993eaaa42da42a58b5d084ce7c990","observation_id":"24a5b005-7f9c-4ee3-8d9b-eb1aaf6bc9b2","resolution":{"observed_at":"2026-08-08T17:55:54.098055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.646160Z","title":null,"venue":null,"work_id":"ce4c3d73-233b-48a9-97d9-a323a4baf8ca","year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.101926Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:b47bf9beea14671737cbe5f13d230a77878a3496753e4d556ec08e811722ff86","observation_id":"cde6677a-eabc-4417-bcfc-7f48742e1d5b","resolution":{"observed_at":"2026-08-08T17:55:54.650309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.632315Z","title":null,"venue":null,"work_id":"0e0587dc-0ed1-45b7-b335-576ec818d568","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.105826Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:cb9689c3e144f7b41ceb8581deb1831dd059fa98480179f65ed710335f7a93be","observation_id":"caf2e6aa-d1a3-4f43-ad75-b1a6486d50a4","resolution":{"observed_at":"2026-08-08T17:55:54.636902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.109645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.109645Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:edfd136fa70641d2b27c58ed009bb477f6ef07b2267470005fd8f9caa8188ed5","observation_id":"9b3c4c51-ca3d-4d9d-8244-2fdf19e17d02","resolution":{"observed_at":"2026-08-08T17:55:54.109645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.113690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.113690Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:665c6feb485df20d83ea11166b9ce0f5646e81822460d900e046bfe5656cde07","observation_id":"03c07cf7-1cfa-4a5f-966b-42853903912a","resolution":{"observed_at":"2026-08-08T17:55:54.113690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-08T17:55:54.122296Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.122296Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:7f2baae872e645fcbdfb338df1f0b1c3bf74bef795d2bb8b2797633f1ddbd658","observation_id":"bfc40be9-2324-462d-bef0-697870358b35","resolution":{"observed_at":"2026-08-08T17:55:54.122296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.126488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.126488Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:148a7de5ae10a4981791cefc91611d8f136d90ce948ab37a6ab3642f27888484","observation_id":"15fb459e-cb42-4086-ab1e-b8bdd8d4b851","resolution":{"observed_at":"2026-08-08T17:55:54.126488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T17:55:54.130426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.130426Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:8bee0ef029664fb6a5290f16f675719de8be700cca93ae94c06896610e11fc80","observation_id":"c788a648-df29-4a4a-be3f-21ef38083d93","resolution":{"observed_at":"2026-08-08T17:55:54.130426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.134360Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.134360Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:ba8a5bdf9e3ad5ff19240b288d2e01e04fbf32ad0db21d3bda7dfc79c687d613","observation_id":"d8a05a24-72ee-4c79-a3ff-7105d6ef1eab","resolution":{"observed_at":"2026-08-08T17:55:54.134360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-08T17:55:54.138113Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.138113Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:c41ed36b944c1509b90f7e6df4cf7c61b0a3f29af3027305a2b453b2c66c7b55","observation_id":"730e154d-08d7-4eed-8022-d193452619f9","resolution":{"observed_at":"2026-08-08T17:55:54.138113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.142216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.142216Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:6821e70495a0dc9fd0e2f866e04aaf717613570bfc39f8c7543af6e17af00c3f","observation_id":"936bbc8c-1a5a-4ce4-ad59-f4fbb40eba25","resolution":{"observed_at":"2026-08-08T17:55:54.142216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-08T17:55:54.146007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.146007Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d65c2afb824caf447c73d419ab5a96efb1da48ce80d486a4ad5695fa3fd921aa","observation_id":"db234230-35b0-476c-bc53-c8227ea633ad","resolution":{"observed_at":"2026-08-08T17:55:54.146007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-09T14:18:39.128715Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-08T17:55:54.150115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.150115Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:e403e48323b3b8fc5a93e53642bc2f20eef5ae7a905a3fcf96792bf86d812fe2","observation_id":"f14b5346-b03c-4a31-a30c-b1521795488e","resolution":{"observed_at":"2026-08-08T17:55:54.150115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.561363Z","title":null,"venue":null,"work_id":"9a594732-ae92-40f2-8957-4b33243fcefa","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.154285Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:55cd4de9ccd5ed4927940e1ab080ecfc310737cf0adad24d81e75b7bbed6d223","observation_id":"e0da7699-1bc7-4bc9-81e5-ffacf4c2e358","resolution":{"observed_at":"2026-08-08T17:55:54.565525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-08T17:55:54.158078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.158078Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:159099f59034090b92764694a8a1cd4ffa886f8fbc334a40ae4aa8ca0a0efe9c","observation_id":"fc2d7ce5-5f3f-4b24-b6ff-ff36e2363d91","resolution":{"observed_at":"2026-08-08T17:55:54.158078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-08T17:55:54.162523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.162523Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:cbb52b2414359137ac7d50294fd7ec7ba41831ef9caf4e9774166027cb2db890","observation_id":"6e448380-db6b-4462-b9ba-53343266b24c","resolution":{"observed_at":"2026-08-08T17:55:54.162523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.547608Z","title":null,"venue":null,"work_id":"b8f11b55-d9ca-41a5-a7a8-f0245a2101e5","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.167004Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:4e8c4b3017af9e7474aa693a5bbae369dbea65efd6d066eed8b4c1741755f7be","observation_id":"5bbc055c-837b-4aec-9a16-c4dcf79bd7c7","resolution":{"observed_at":"2026-08-08T17:55:54.552208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.534115Z","title":null,"venue":null,"work_id":"6625ef0e-f4e2-4d7c-ad71-85716522ce4c","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.171246Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d2b75cd4008e14320bf483034997dded2ea56a3058404ec311d370dd8c1bdd1e","observation_id":"e75b8677-bad7-4f08-aef7-88ef2591d3f3","resolution":{"observed_at":"2026-08-08T17:55:54.538402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T17:55:54.175315Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.175315Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:1b16be60ff70d0ff759e279f0ddde016c6026bd33d7ea7fccee086788d5e5f51","observation_id":"a360eaac-b163-450b-a0f0-143441ed0a58","resolution":{"observed_at":"2026-08-08T17:55:54.175315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.179967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.179967Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:39e2a61e803ed57a24df3907b1cd510f910001ce180921605e68c5a56b25c38d","observation_id":"db854cf0-e973-445c-8fa5-f44a77bdb5e6","resolution":{"observed_at":"2026-08-08T17:55:54.179967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-08T17:55:54.093526Z","title":"arXiv:1609.07843 [cs.CL]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.093526Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:2cffe7e8877045a1934813a21aafd9b8ac87e560e595ffb12f9b44ca968323ea","observation_id":"99ddaae9-b482-4baf-ae7f-540e672ac6f5","resolution":{"observed_at":"2026-08-08T17:55:54.093526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:55:54.002913Z","title":"arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.002913Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:3dd36e10b78022ab290222ec33e5a51631f265b2560618223d2ec066392c7c14","observation_id":"817973ae-7511-4d09-80e6-b858b8fa326f","resolution":{"observed_at":"2026-08-08T17:55:54.002913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.600668Z","title":"In 2021 USENIX Annual Technical Conference (USENIX ATC 21)","venue":null,"work_id":"3301a126-0c7c-4e83-8704-e3baa2445952","year":2021},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.118426Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5edfd287387e98282c7ab8847a1f3d02cda02b8aec81e9b0c0ed4d5f78e084f7","observation_id":"138e7a76-e285-484b-a41f-cdca78d75b64","resolution":{"observed_at":"2026-08-08T17:55:54.605201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.760702Z","title":"https://github.com/huggingface/accelerate","venue":null,"work_id":"1cf775e5-8f8e-4d20-8010-235557bf08a4","year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.030119Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:1b5260648befbe5f64aa1ddbf124a36cb04e3c3f9a0722d5d2e3978ed3162e7c","observation_id":"60e909b1-8739-457f-b9bf-80e99fe233e9","resolution":{"observed_at":"2026-08-08T17:55:54.764905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2502.06888."}