{"as_of":"2026-08-07T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:653a7209fc71eaed853aab601ea90eccdef9f667a4d9885a88e44675ecef322e","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:32.963734Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T04:31:11.271729Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T04:33:03.804063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"cited_work":{"arxiv_id":"2506.12417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12417","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HarMoEny: Efficient multi-gpu inference of MoE models","venue":null,"work_id":"109fcb4a-ff88-4b37-9040-81f001d543b6","year":2025},"citing_paper":{"arxiv_id":"2605.19945","last_updated":"2026-05-19T15:01:39Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:01:39Z","title":"GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T04:31:11.271729Z"},"links":{"cited_paper":"/paper/2506.12417","citing_paper":"/paper/2605.19945"},"observation_digest":"sha256:f1106fea15bf4052b55dcb28954b431d415926a9414dd8b84a0f22209fcaf140","observation_id":"0685dec3-b41b-42bf-afb6-58de81036b73","resolution":{"observed_at":"2026-05-20T04:33:03.808270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12417/citation-record","integrity":"/paper/2506.12417/integrity","json":"/paper/2506.12417/citation-record.json","paper":"/paper/2506.12417"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:57:32.813852Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.813852Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:7ff1d3a22af50222a748b35598f10e8e312301d3c4fb92d7c3b2e9256b5ab8ef","observation_id":"1b83d114-1784-493f-9690-744ac60e2df6","resolution":{"observed_at":"2026-08-07T00:57:32.813852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.500748Z","title":"Amazon EC2 update – inf1 instances with AWS inferentia chips for high performance cost-effective inferencing, 2019","venue":null,"work_id":"b0468393-fb99-4223-bee7-05420a44bd87","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.818850Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:cdfb8d8402e1cd2718d3a0fea060a63d4581ba0c3a16f5ee38a7ae32a59bff64","observation_id":"f80582c9-8953-4a5a-bc28-185de4c14044","resolution":{"observed_at":"2026-08-07T00:57:33.504866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.487886Z","title":"A neural probabilistic language model","venue":null,"work_id":"a73098f9-2675-4617-ae9e-bc0c8dbbd5a9","year":2000},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.822866Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:c5cdb31e2e0ee476d7c8c18060ea929085cba16c683012f9824ce5378ecf23d4","observation_id":"59dddad4-1d4c-4ed6-b0c5-62a42d571780","resolution":{"observed_at":"2026-08-07T00:57:33.491982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.474833Z","title":"Datacenter power and energy management: past, present, and future","venue":null,"work_id":"1bc4273a-ed1a-4a12-ac37-ad4c24b78165","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.827146Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d97c75cc889f14e03e69797d971ca18f890a3e0df0ebac01334603df44b9b34f","observation_id":"71b4bcfb-9f00-4e92-afa8-ad95ab622190","resolution":{"observed_at":"2026-08-07T00:57:33.479177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.831078Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.831078Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:907b6f6a3c1ef5ab3e03b85abd89ee271f62d95fafdb4ae098fc89178146eb3a","observation_id":"d8ead566-47c9-44d8-9279-225b98678ce9","resolution":{"observed_at":"2026-08-07T00:57:32.831078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.453557Z","title":"Large scale distributed deep networks","venue":null,"work_id":"0fba71f5-8165-4b1c-aeae-4cd793b9c51e","year":2012},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.834897Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:1fb0104e346f8e8856397c204cb2fcaa46c89b0727794b6641704ab5644e1fa2","observation_id":"2fe6c22e-b416-4b89-bbbe-cbcd728c75d7","resolution":{"observed_at":"2026-08-07T00:57:33.457504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.440883Z","title":"Quasar: Resource-efficient and qos-aware cluster management","venue":null,"work_id":"82fc9b71-a7e9-4ef9-91ea-45212ecaebf0","year":2014},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.839116Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:989ecf314f6e553a33a89ff569b5ed62074d9ba3d478ba30f3b945a7c004d31f","observation_id":"bf21b206-e2b7-45a7-a376-5c26f5da9c52","resolution":{"observed_at":"2026-08-07T00:57:33.444890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.427220Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"50a194e1-517a-4f12-880d-62d770a0c927","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.842730Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:9d3c5baa93525d19f768cd37152d8e44dfa0f9851e6c74bbe0239190af7d3309","observation_id":"bad8eb6c-46f3-481c-80fb-f768b78f85bb","resolution":{"observed_at":"2026-08-07T00:57:33.432026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.413809Z","title":"Acl 2019 fourth conference on machine translation (wmt19), shared task: Machine translation of news","venue":null,"work_id":"435c9f1f-9477-4649-8774-89a4521e2a46","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.846300Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:9c3cf31ec3f3f1a7553ee69971ca46c40248e3f3ac1e548a41006736ee887ab4","observation_id":"c1678eaa-a4de-4c35-b151-fd9c69584ff5","resolution":{"observed_at":"2026-08-07T00:57:33.417764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.401041Z","title":"Megablocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"9c2161b9-a854-4938-9ddd-b8cd69b8402e","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.850070Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:5e92c40ce770e1e3322b3b42ee3ded164cfff71c4a9eb8150742f28a1c12937d","observation_id":"46e54108-df6f-4716-a6b2-03918b500a69","resolution":{"observed_at":"2026-08-07T00:57:33.404964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04997","last_updated":"2019-11-12T16:32:38Z","snapshot_observed_at":"2026-08-02T11:26:23.169933Z","submitted_at":"2019-11-12T16:32:38Z","title":"Character-based NMT with Transformer","version":1},"cited_work":{"arxiv_id":"1911.04997","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.04997","snapshot_observed_at":"2026-08-07T00:57:33.080428Z","title":"Character-based NMT with Transformer","venue":"cs.CL","work_id":"29ae3d87-6e82-4d3b-836c-42814b5b7158","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.853759Z"},"links":{"cited_paper":"/paper/1911.04997","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:2405b3daabce48b50a07b61185c549d40e749fc2b9c7e9505e6fde66ae29d282","observation_id":"482cdcd6-4f65-4613-aab7-5327551c3ef7","resolution":{"observed_at":"2026-08-07T00:57:33.086400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-07T00:57:32.858076Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.858076Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:ff04f25537173f7155eef31517ac1a0803abd5a143d604102c0748c46472cee4","observation_id":"d4340967-aa22-4a69-aad8-fd6b8cf1e4c5","resolution":{"observed_at":"2026-08-07T00:57:32.858076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.388640Z","title":"Fastermoe: Modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"43f947e3-b9b9-4e42-87a4-fa6b9b5ca7cb","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.862163Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:de9b9f1771f83866033bcb043b41b23066544f1e1f9e268180423ef68c0f09dc","observation_id":"97e82041-bfbd-4914-b069-7b631afd185a","resolution":{"observed_at":"2026-08-07T00:57:33.392572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.375736Z","title":"Tutel: Adaptive mixture-of- experts at scale","venue":null,"work_id":"af28f41a-d2ca-4e0c-bc24-d9969ef8a8d1","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.865806Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:62f94a60247b4ffcf182e0bae9420849dfe7f0e87b1da951f623e98a55b448a2","observation_id":"5affdc3e-01fd-4096-a213-3589403847e8","resolution":{"observed_at":"2026-08-07T00:57:33.380243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.363050Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"4600cb2d-6c32-4f5f-b64b-ec9db598708d","year":1991},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.869364Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:5416da4592b7635b441d9415e86ffe52e9a60d70a1dfb18561a0ae2da53c37c5","observation_id":"eb3db8f3-6b32-46db-b5a8-175c2bbc2252","resolution":{"observed_at":"2026-08-07T00:57:33.367056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T00:57:32.872804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.872804Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:f8697184b57b5388101a287585c1c112d338ef8471bf3782860a6dbf9e5f491c","observation_id":"880a320b-7746-4f15-a62a-0d8f087a5101","resolution":{"observed_at":"2026-08-07T00:57:32.872804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T00:57:32.876451Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.876451Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:21c47ba79ba1fd5a2d66910f3a7b752c2a1de5cdb8de6a119a3cbf9332fd62b4","observation_id":"60a95c6e-66a4-40b7-ba63-0318e79fa7ca","resolution":{"observed_at":"2026-08-07T00:57:32.876451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.880325Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.880325Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:93222d03fb038f5b8d5ce1feee5d82c5803ef5524b96887a7c8b801f8a0c77ad","observation_id":"4915bd77-dafe-4b2c-8794-96d864e8cee6","resolution":{"observed_at":"2026-08-07T00:57:32.880325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.340973Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates","venue":null,"work_id":"292271c5-a3be-4bb5-aedb-7132040782ae","year":2018},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.883909Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:38613756ae48b53430ddd27ffc9de7f42868e36b48c30b6e0c38c3f739ffdd3d","observation_id":"899c9652-4ce1-4421-91cf-c81dd3cd9781","resolution":{"observed_at":"2026-08-07T00:57:33.344951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.328969Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"15cd5378-a91d-4da2-8b32-1b378f9cef33","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.887516Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:e46d85b7c46cf0d68fc73b284b1951cbdddf141510a2ac269ba6934d7aa380c2","observation_id":"9903387d-0a07-4e20-8ae6-13c96a2f4168","resolution":{"observed_at":"2026-08-07T00:57:33.332584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.316091Z","title":"AWS to offer nvidia’s t4 GPUs for AI inferencing, 2019","venue":null,"work_id":"4740629f-787e-472b-a677-8788e89633b3","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.891089Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:81a5531cedb511595e5b5871fa91b4eb8739407cd2680786c442ba46929b4049","observation_id":"a53ad049-1517-4573-a92b-deb66a80e2bb","resolution":{"observed_at":"2026-08-07T00:57:33.320398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.303578Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"b8686215-3ad2-4fec-998e-07fbad682600","year":2021},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.894473Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:08380f55bb3614a8b79574805099f7c0c527ee2279fe9ece3566e43413ed40ce","observation_id":"a1b134cd-08ca-4b04-9b4a-9d45491791e4","resolution":{"observed_at":"2026-08-07T00:57:33.307403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.291146Z","title":"Accelerating distributed MoE training and inference with lina","venue":null,"work_id":"aab36ea6-bd4f-4389-9001-fb719bcb1bd3","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.898045Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:ae8f6bb20c2022aa54a30a8427e20a99bd1a3007973dca75e2cec7fde32fc6cf","observation_id":"b49519fd-b6e4-4747-858f-eba378d20bbd","resolution":{"observed_at":"2026-08-07T00:57:33.295114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:57:32.902330Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.902330Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:8f2e2bc611db96d09d9e93290127a7441758b96637f23c3e3ae7c90ce82ac73d","observation_id":"d509d5f2-c70d-49d2-b1aa-6b4a4438f67b","resolution":{"observed_at":"2026-08-07T00:57:32.902330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.905968Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.905968Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:8f8353e0779e42e117f1761a85309234f0ece2aca9f3fb07ca56fa437fa840b9","observation_id":"434cd7b8-ca7e-4e57-98d7-209d76973cb4","resolution":{"observed_at":"2026-08-07T00:57:32.905968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.269640Z","title":"Deepspeed-mii: Mii makes low-latency and high-throughput inference possible, powered by deepspeed","venue":null,"work_id":"8bdabc22-73fc-4404-963a-050453dc5e37","year":null},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.909635Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:5b40711c8e817b22ab545475cf13dd867cf8b1fac468b552dedf5c8c71734441","observation_id":"ee18e1d9-862c-4881-b67c-c18d9894008d","resolution":{"observed_at":"2026-08-07T00:57:33.273719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.917296Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.917296Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:a17947003fcf3c3b77268663d96d48dbf3c3358866887189e1f383ae2f5c098a","observation_id":"95b2e0a3-21d7-4511-9f68-f2f545fc8063","resolution":{"observed_at":"2026-08-07T00:57:32.917296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.235980Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"f016fb05-24cd-4441-908d-a39ddc845eaf","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.920856Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d660412fe440425a65b55d5a048b1e2618deb4033e336c09dde86b5cb0877a74","observation_id":"3195126a-8790-45de-982a-aefa27955565","resolution":{"observed_at":"2026-08-07T00:57:33.239815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.223811Z","title":"DeepSpeed-MoE: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"3f8bc12a-ccee-486b-b8eb-cd9515717028","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.924343Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:21b58753c6c1a339923dc01a73ab7880eaeeecaaed13c33adc6757276247cf6a","observation_id":"797a5ad8-591e-4927-a66e-8fffdc192611","resolution":{"observed_at":"2026-08-07T00:57:33.227715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.210882Z","title":"Outrageously large neural networks: The sparsely- gated mixture-of-experts layer","venue":null,"work_id":"c411ad96-7224-4fd9-ad39-c3956754e24f","year":2017},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.927724Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:92a441ce0cf5c13ee45c46a8431e78176040df2d42bbab304cc1342f96742fd0","observation_id":"aef745bd-b596-4ae7-a9ee-7af36f6fdcb7","resolution":{"observed_at":"2026-08-07T00:57:33.215236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.198680Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":"45ee78e4-a987-46ac-b5b1-f47042b71e0d","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.931223Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:0adb0d47bcc803a7c855c340bf798011ea5b2106d0584644a9afa850f920d978","observation_id":"461ce789-0910-464d-b777-7519b71a159c","resolution":{"observed_at":"2026-08-07T00:57:33.202658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.186642Z","title":"Borg: the next generation","venue":null,"work_id":"e7c60222-cc70-4d3a-8b38-8922569029f7","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.934674Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:763edcbc51ff06aec18069f59a995fbcb1fede9f7d72679632d1854107567d95","observation_id":"a1711014-cffb-4582-8751-962448885974","resolution":{"observed_at":"2026-08-07T00:57:33.190565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.173566Z","title":"Attention is all you need","venue":null,"work_id":"6ed391dc-bd49-4d3e-809d-3b5b7540a74e","year":2017},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.938064Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:e22d604c3c93f8c9f6c1ab0b16244f0a34eb58e39751b4e49e50736c32d490c5","observation_id":"e3d7be92-1c27-4073-bfd5-2ddf0befb776","resolution":{"observed_at":"2026-08-07T00:57:33.177817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.160194Z","title":"Prophet: Fine-grained load balancing for parallel training of large-scale moe models","venue":null,"work_id":"0a02c384-fd48-4632-bc7b-a6ee92488617","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.941528Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:741328c5f145037be72878c9b8d6bd4cb06f9cd45fdeffdd841a9a63026dda08","observation_id":"b515975f-470e-4213-941d-a8e93a5a0525","resolution":{"observed_at":"2026-08-07T00:57:33.164132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.147532Z","title":"Resource-efficient algorithms and systems of foundation models: A survey","venue":null,"work_id":"83ef396d-dd5b-4dd1-a65b-b2683370f8fa","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.945320Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:3ffa74ef6ab43aec872300f96a41a4c76e0a8684e9b511c757c1dddc64037d88","observation_id":"09193130-6c13-4302-a06f-cbb3dbe6ed3c","resolution":{"observed_at":"2026-08-07T00:57:33.151534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:57:32.948934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.948934Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:b81b2b708ef8d159f8eb41ed3db5f7b1f9b6c5c64c2ff3a2e1fabc14043c991c","observation_id":"70c8a7b8-7217-4b16-a8ca-4bee9cf1fc76","resolution":{"observed_at":"2026-08-07T00:57:32.948934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.135032Z","title":"Harnessing the power of LLMs in practice: A survey on chatgpt and beyond","venue":null,"work_id":"c00d903f-b87b-413a-8e71-542873810261","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.952538Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:a007bfef485658c4d43b4205b57e98104a5f8636c8d699483446b558721d761d","observation_id":"f13c2bcf-08ac-4428-969e-df9c5f0bc56f","resolution":{"observed_at":"2026-08-07T00:57:33.139056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.122284Z","title":"Exploiting inter-layer expert affinity for accelerating mixture-of- experts model inference","venue":null,"work_id":"c94fbf55-0966-4b18-9c4e-3af615066f3d","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.956355Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:3a8ecea93e80b8dc0cba5e7d86e12d1680f4e33198ef7278a148680747cd6f49","observation_id":"33d07119-e7e6-4e3f-a417-77c4e826e6de","resolution":{"observed_at":"2026-08-07T00:57:33.126477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.109840Z","title":"SmartMoE: Efficiently training Sparsely-Activated models through combining offline and online parallelization","venue":null,"work_id":"02944f73-3bfb-4469-8c76-7719fe8fb032","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.959823Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:07d80078eb45874d5326243c1e0fb9fddaa2c5c82c2d6586b26ff53a3241d8b8","observation_id":"25f8865e-cbd2-42ad-909a-9a5eeac9efb0","resolution":{"observed_at":"2026-08-07T00:57:33.113747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.06724","last_updated":"2015-06-22T19:26:56Z","snapshot_observed_at":"2026-08-06T16:37:38.107677Z","submitted_at":"2015-06-22T19:26:56Z","title":"Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.06724","snapshot_observed_at":"2026-08-07T00:57:32.963734Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.963734Z"},"links":{"cited_paper":"/paper/1506.06724","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:4a992bcc59823fc5f464583efc2a6975d2639a83393997ebe1169f82d4ed39ab","observation_id":"c367ef27-b1e2-4b77-9f1f-ef08e899122a","resolution":{"observed_at":"2026-08-07T00:57:32.963734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.257095Z","title":null,"venue":null,"work_id":"90286696-f6b0-48bb-91f2-dd996c110049","year":2025},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.913583Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:cb114b222d359978020d977195f45d9a310148640b4e1173e00ad57a85a88483","observation_id":"32e082bc-2146-42df-8ca6-c3ee6fb2de9b","resolution":{"observed_at":"2026-08-07T00:57:33.261045Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T01:49:58.847410Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.12417."}