{"as_of":"2026-08-09T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1a5dd05c175fac7d5df9b14c470fe1f3f9d5e9e721a98c435508dcbd88c0a7b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:52:07.475849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T10:47:02.152647Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":211,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:fce109ae409ee717cc36cd45d34b1baf1290191523457521e3b8dea1e206efac","observation_id":"c7019b44-4439-473e-9fe7-b5d9f57b046b","resolution":{"observed_at":"2026-05-10T22:46:39.997102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:52be1d5df036e6576a632c7cad1a4d6c810cdb6ccda4824a536e21ee814aa842","observation_id":"e463f93a-f277-4bcc-bbdd-44c1eb3066f8","resolution":{"observed_at":"2026-05-19T20:28:39.310778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-05-13T01:07:22.166595Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2309.14509"},"observation_digest":"sha256:93f32b3da074303b96871da72d2f482793ffa8bdf41512e7bb9ea0e1c3ab4ba5","observation_id":"3aed77df-0255-4bb4-a6b4-d1179ddc6545","resolution":{"observed_at":"2026-05-13T01:07:22.306886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2502.05564","last_updated":"2025-05-24T08:05:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-08T13:25:04Z","title":"TabICL: A Tabular Foundation Model for In-Context Learning on Large Data","version":2},"reference_index":218,"source":"arxiv_source","source_observed_at":"2026-05-20T13:35:02.018244Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2502.05564"},"observation_digest":"sha256:85b79ae84ef3af9796646fbf3d2eac5e24a29cbe78f7a69433d087748c6a979b","observation_id":"25c84bbd-c5fb-4cb7-a2a6-361beccaed4f","resolution":{"observed_at":"2026-05-20T13:35:02.311552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-08T14:52:07.475849Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06643","last_updated":"2025-02-10T16:34:36Z","snapshot_observed_at":"2026-08-08T14:45:37.203109Z","submitted_at":"2025-02-10T16:34:36Z","title":"MoETuner: Optimized Mixture of Expert Serving with Balanced Expert Placement and Token Routing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T14:52:07.475849Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2502.06643"},"observation_digest":"sha256:bf8225df0bd36d7b9682acbadc1bc8c90d21cd6c93ef2361229c43105627ba7d","observation_id":"6a27268a-ffa9-45a5-abaf-bc11ad728dae","resolution":{"observed_at":"2026-08-08T14:52:07.475849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:c687c4510a2bc49e4daa39d9b670151cfbe12a2f54d39e1006091fbb1289f1c0","observation_id":"caec5c3e-4025-450a-a09e-6bd5c6ccc09e","resolution":{"observed_at":"2026-05-13T01:36:23.955606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-07T12:57:43.646076Z","title":"Fastmoe: A fast mixture-of-expert training system.arXiv preprint arXiv:2103.13262, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23184","last_updated":"2025-05-29T07:22:43Z","snapshot_observed_at":"2026-08-07T12:49:02.532800Z","submitted_at":"2025-05-29T07:22:43Z","title":"Two Is Better Than One: Rotations Scale LoRAs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:57:43.646076Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2505.23184"},"observation_digest":"sha256:55ecdb5e0b4259ce231b6fcd1767b2d581a95acbc9ae86a370dad79ce44bdc17","observation_id":"d73357d5-c507-4370-9956-4e1199b6fa67","resolution":{"observed_at":"2026-08-07T12:57:43.646076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-07T05:41:39.404771Z","title":"Fastmoe: A fast mixture-of-expert training system.arXiv preprint arXiv:2103.13262, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07366","last_updated":"2025-06-09T02:32:09Z","snapshot_observed_at":"2026-08-07T05:33:16.668436Z","submitted_at":"2025-06-09T02:32:09Z","title":"MoE-GPS: Guidlines for Prediction Strategy for Dynamic Expert Duplication in MoE Load Balancing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.404771Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2506.07366"},"observation_digest":"sha256:743a1b07cf647e0e926bc7291b68a00ecb7c67a1b02bd9eecf351a10002e8cf1","observation_id":"22486253-f1f6-422c-88ad-715fb65d80bc","resolution":{"observed_at":"2026-08-07T05:41:39.404771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-07T00:57:32.858076Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.858076Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:ff04f25537173f7155eef31517ac1a0803abd5a143d604102c0748c46472cee4","observation_id":"d4340967-aa22-4a69-aad8-fd6b8cf1e4c5","resolution":{"observed_at":"2026-08-07T00:57:32.858076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-06T20:01:29.072590Z","title":"Fastmoe: A fast mixture-of-expert train- ing system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04123","last_updated":"2025-07-22T01:29:09Z","snapshot_observed_at":"2026-08-06T19:52:27.519882Z","submitted_at":"2025-07-05T18:28:04Z","title":"Towards Accurate and Efficient 3D Object Detection for Autonomous Driving: A Mixture of Experts Computing System on Edge","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.072590Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2507.04123"},"observation_digest":"sha256:e4cd215427f0f3a449777b94b02b690448f047ee9cae5fdfac3ac678b4873303","observation_id":"8e5341b7-536e-46e5-8b90-21ddb068f966","resolution":{"observed_at":"2026-08-06T20:01:29.072590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-06T18:20:00.189812Z","title":"FastMoE : A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-07T06:32:52.508610Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.189812Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:fea53752c033b516a7823f7004b936a8d64344094c62ccbeccdb85ab97cce182","observation_id":"8f82d564-9f3c-467a-876f-ff097377227b","resolution":{"observed_at":"2026-08-06T18:20:00.189812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-05T16:17:41.941220Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.941220Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:cf2a0f1f74659e260862e8aec27040ee232567c093c3dfa3184dae0d1cba8093","observation_id":"90764af7-1ac7-4b06-8082-f40da840398e","resolution":{"observed_at":"2026-08-05T16:17:41.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.00539","last_updated":"2026-05-11T15:02:38Z","snapshot_observed_at":"2026-08-08T14:53:50.203528Z","submitted_at":"2026-05-01T09:39:03Z","title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-09T19:46:13.015064Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.00539"},"observation_digest":"sha256:9b8b01e33fb7d929e7ae84bcd391b1fdfb840cd200ce2e7a0410e67ca2a6f1d0","observation_id":"79ae7997-4a84-4a1b-a01a-b522e7a2786d","resolution":{"observed_at":"2026-05-11T15:31:17.988693Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.00539","last_updated":"2026-05-11T15:02:38Z","snapshot_observed_at":"2026-08-08T14:53:50.203528Z","submitted_at":"2026-05-01T09:39:03Z","title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T05:17:09.793360Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.00539"},"observation_digest":"sha256:3429f883a124d45a25c83aa0503bd79b763d415c163db5f8d60f460706f9a7c6","observation_id":"8365c891-d4f8-42c2-a69e-9252d4686c31","resolution":{"observed_at":"2026-05-12T05:21:30.567351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.02960","last_updated":"2026-05-15T03:29:35Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T03:10:24Z","title":"MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T19:29:28.916831Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.02960"},"observation_digest":"sha256:a063006f5e3df70f056c595185573f14aa890508d618389cb8a781464278cd00","observation_id":"c7825e9c-b3cf-4d82-9b09-622930c946f0","resolution":{"observed_at":"2026-05-09T05:50:26.994223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.02960","last_updated":"2026-05-15T03:29:35Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T03:10:24Z","title":"MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T17:43:56.767714Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.02960"},"observation_digest":"sha256:9610cdaa0acab80619def4c774854fda4a2ae9d8006bd0d3f2cb4bd65bae673d","observation_id":"d14e1f5f-ceca-4087-8593-731afe4b1243","resolution":{"observed_at":"2026-05-19T17:47:41.970798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.08292","last_updated":"2026-05-08T09:21:46Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T09:21:46Z","title":"Hierarchical Mixture-of-Experts with Two-Stage Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:58:04.218139Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.08292"},"observation_digest":"sha256:03c811e43776fdc9107f5fc0c1ce9aee4a9e1978a88705a314c8f720e7a4f07c","observation_id":"bb418645-f69b-465f-aabc-c9edaeedf98b","resolution":{"observed_at":"2026-05-12T02:01:15.400906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.11537","last_updated":"2026-05-12T05:03:53Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T05:03:53Z","title":"Fast MoE Inference via Predictive Prefetching and Expert Replication","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T02:25:59.268868Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.11537"},"observation_digest":"sha256:5b26a214ad1e6f090d7fcd46ee88ed8a15c6fbe13e9a2e0137bfa07f734742de","observation_id":"39caa9a9-2175-4036-9aec-4f53d3543cf3","resolution":{"observed_at":"2026-05-13T02:27:06.992817Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.13247","last_updated":"2026-05-14T02:03:27Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:31:09Z","title":"EMO: Frustratingly Easy Progressive Training of Extendable MoE","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T20:06:33.816250Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.13247"},"observation_digest":"sha256:75d298e3c28f7b1f2be3dce0a3cd175f7272cbf7eff31d57ecb6196e54f8005d","observation_id":"18fcc67d-21a3-4bb4-978c-03ae259594ac","resolution":{"observed_at":"2026-05-14T20:07:53.589798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2605.13247","last_updated":"2026-05-14T02:03:27Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:31:09Z","title":"EMO: Frustratingly Easy Progressive Training of Extendable MoE","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T05:32:10.642355Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2605.13247"},"observation_digest":"sha256:e38059c6b89b81120ef4ecd9e9c6f81810b26a44773c93e4451db6ee0ba9382d","observation_id":"609fc325-8fc2-44b9-b51e-d6daba8d4007","resolution":{"observed_at":"2026-05-15T05:35:04.303635Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2606.00735","last_updated":"2026-05-30T13:57:09Z","snapshot_observed_at":"2026-08-08T08:32:25.145870Z","submitted_at":"2026-05-30T13:57:09Z","title":"ViBE: Co-Optimizing Workload Skew and Hardware Variability for MoE Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T18:07:52.038640Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2606.00735"},"observation_digest":"sha256:cfa948c8937acb71ca5deac098e0d38677cb24f8ba0da2975345eb1e03e2d1a1","observation_id":"f1bb5ced-086e-4759-8a61-6d9a87a84c41","resolution":{"observed_at":"2026-07-01T20:46:13.242761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2606.31363","last_updated":"2026-07-02T04:09:33Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:57:38Z","title":"Language-Assisted Super-Resolution from Real-World Low-Resolution Patches","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-01T05:49:20.689248Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2606.31363"},"observation_digest":"sha256:37aac35fd3a470509cfd88995d0650320170274c7e94abd5a9c3d10dcceb0dde","observation_id":"d4629689-ac79-4e57-82d9-f7b0836d5666","resolution":{"observed_at":"2026-07-01T10:05:41.498921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2606.31363","last_updated":"2026-07-02T04:09:33Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:57:38Z","title":"Language-Assisted Super-Resolution from Real-World Low-Resolution Patches","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-03T22:14:30.734906Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2606.31363"},"observation_digest":"sha256:8d64d20bea505a1695779702141d485fa7a2bba51b57724a9f8a407ff4bd1921","observation_id":"28101062-bbed-4856-a13e-525275d988c6","resolution":{"observed_at":"2026-07-03T22:18:59.533997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2607.00573","last_updated":"2026-07-19T08:18:26Z","snapshot_observed_at":"2026-08-06T12:35:28.387447Z","submitted_at":"2026-07-01T07:59:05Z","title":"BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-02T15:00:39.357350Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2607.00573"},"observation_digest":"sha256:14ead32484e85af811179c59026e2a19ed89862f57887501613e689f5c36615d","observation_id":"d503ead8-7bd4-46ff-b381-6b01c11a7451","resolution":{"observed_at":"2026-07-02T15:07:04.023990Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-02T09:20:43.421695Z","title":"arXiv preprint arXiv:2103.13262 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.00573","last_updated":"2026-07-19T08:18:26Z","snapshot_observed_at":"2026-08-06T12:35:28.387447Z","submitted_at":"2026-07-01T07:59:05Z","title":"BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:20:43.421695Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2607.00573"},"observation_digest":"sha256:f7916993dfd313f4d1dfcd9405719149416bef57e9eb5bd1b91659d66cd0d181","observation_id":"999c85a5-de8c-4ad3-bcdc-2ad0e354f571","resolution":{"observed_at":"2026-08-02T09:20:43.421695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:b510d6cca5a231c1fb9c2fa6e5bdfd227f6cb6487cab2e7785ca712770c29c6f","observation_id":"6152210c-84fd-4605-a866-bb8536a07119","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":"2103.13262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-10T10:47:02.152647Z","title":"Fastmoe","venue":"cs.LG","work_id":"6f8a9c7a-6412-48c3-ae67-7c51432b458a","year":2021},"citing_paper":{"arxiv_id":"2607.08250","last_updated":"2026-07-13T06:29:34Z","snapshot_observed_at":"2026-08-06T04:17:17.557787Z","submitted_at":"2026-07-09T08:54:46Z","title":"On the Design of Mixture-of-Experts for Dynamic Gaussian Splatting","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-10T10:37:15.252017Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2607.08250"},"observation_digest":"sha256:7b439c9b7dba49a06564f16c32ab7d7f1b245d3a3d7a809bf1c77d6795129714","observation_id":"0dd51e7f-3b5e-46f6-a27b-d4845e2ef976","resolution":{"observed_at":"2026-07-10T10:47:02.153873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-07-14T15:37:19.276654Z","title":"Fastmoe: A fast mixture-of-expert training system,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08250","last_updated":"2026-07-13T06:29:34Z","snapshot_observed_at":"2026-08-06T04:17:17.557787Z","submitted_at":"2026-07-09T08:54:46Z","title":"On the Design of Mixture-of-Experts for Dynamic Gaussian Splatting","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T15:37:19.276654Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2607.08250"},"observation_digest":"sha256:be0b1ffb7503ef82d2c6c5ee8d9d2cc6b204a7e3f0e9d9aab37fb84da06b2526","observation_id":"454c2b12-edc9-4083-bbb7-c81d2a7e2a93","resolution":{"observed_at":"2026-07-14T15:37:19.276654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-05T00:38:32.753301Z","title":"arXiv:2103.13262","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00574","last_updated":"2026-08-01T10:23:04Z","snapshot_observed_at":"2026-08-07T09:45:34.726642Z","submitted_at":"2026-08-01T10:23:04Z","title":"Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.753301Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2608.00574"},"observation_digest":"sha256:a0c3ab17e944ab9f02a836f3d1b64c72cbdbd62c2ed0816f0ebeef841ae253f9","observation_id":"e515c608-a980-4977-be24-17d305f175e5","resolution":{"observed_at":"2026-08-05T00:38:32.753301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2103.13262/citation-record","integrity":"/paper/2103.13262/integrity","json":"/paper/2103.13262/citation-record.json","paper":"/paper/2103.13262"},"outbound":[],"paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2103.13262."}