{"as_of":"2026-08-19T03:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69139f75daeb599737faf20923177e4e5836bd4c535343cb64f80b92db3baa0c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:45:12.253030Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06481/citation-record","integrity":"/paper/2505.06481/integrity","json":"/paper/2505.06481/citation-record.json","paper":"/paper/2505.06481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:45:12.108866Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., 9 QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.108866Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:aa337e1f0b22ed2b0d992ac8bc3d08c746368e52d4782f81d6f650ef109210d0","observation_id":"3cb88a68-5a9c-499f-a41d-47a13801a8cd","resolution":{"observed_at":"2026-08-15T22:45:12.108866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09497","last_updated":"2024-07-12T15:45:57Z","snapshot_observed_at":"2026-08-16T14:18:36.751517Z","submitted_at":"2024-02-14T15:47:46Z","title":"Instruction Tuning for Secure Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09497","snapshot_observed_at":"2026-08-15T22:45:12.140853Z","title":"URL http://dx.doi.org/ 10.18653/v1/D19-5409","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.140853Z"},"links":{"cited_paper":"/paper/2402.09497","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:c246f7a88821e937d3990cbaab5a75bc909d26665146e8776f2914d3ea58a4a4","observation_id":"2977fc75-2541-4c08-9382-1b5a6ebbfae7","resolution":{"observed_at":"2026-08-15T22:45:12.140853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14417","last_updated":"2024-09-09T16:34:00Z","snapshot_observed_at":"2026-08-16T13:32:40.204198Z","submitted_at":"2024-07-19T15:42:49Z","title":"Mixture of Experts with Mixture of Precisions for Tuning Quality of Service","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14417","snapshot_observed_at":"2026-08-15T22:45:12.154979Z","title":"Mixture of experts with mixture of precisions for tuning quality of service","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.154979Z"},"links":{"cited_paper":"/paper/2407.14417","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:651433998b23aac6eccf1ae057f07cf6db11fb15e38e7c85c19f4896e2b17884","observation_id":"926e7fdb-af0b-4f6d-a7fd-264c558c3acf","resolution":{"observed_at":"2026-08-15T22:45:12.154979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-08-14T19:36:09.254749Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-15T22:45:12.159574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.159574Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:a3ce2f7c447ad6585649278642c5e8c08d4000aa91e379a6d504bd7d721ca3a6","observation_id":"0ad6bc08-7f39-478d-90c6-43f97f14df6f","resolution":{"observed_at":"2026-08-15T22:45:12.159574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09849","last_updated":"2025-05-21T23:53:00Z","snapshot_observed_at":"2026-08-16T16:07:30.940052Z","submitted_at":"2022-12-19T20:46:43Z","title":"Dataless Knowledge Fusion by Merging Weights of Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09849","snapshot_observed_at":"2026-08-15T22:45:12.168712Z","title":"Data- less knowledge fusion by merging weights of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.168712Z"},"links":{"cited_paper":"/paper/2212.09849","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:db9c9a34639a25f03e5716dafa3beef653e2208132e353816404ac67a565aff7","observation_id":"67993dd1-3c23-42bc-81de-66d53d5ebf02","resolution":{"observed_at":"2026-08-15T22:45:12.168712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-08-19T02:04:46.689869Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-15T22:45:12.177984Z","title":"J., Awan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.177984Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:bde615839e2d4eb2753bc5a0d51e78f013af2618da9bf7c320f17bcde44d0f4d","observation_id":"180a2d0f-3b78-4c18-a98c-20115a7492bd","resolution":{"observed_at":"2026-08-15T22:45:12.177984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.972094Z","title":"K., El-Araby, E., and El-Ghazawi, T","venue":null,"work_id":"345bdffd-a0c0-4baf-8088-95f70761bd76","year":2011},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.182655Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:a359ed0c315a6256900fcb8c5d493ec0318cccdcb8730d0ec877651e771c9fef","observation_id":"bd693f6d-3a48-4236-8e8e-3dc39cbb3c5f","resolution":{"observed_at":"2026-08-15T22:45:12.977588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-15T22:45:12.191723Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.191723Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:e8a346708bd7c2aff3c110b1824bdc71b9cc7994f41a0d77404669056b4b6e00","observation_id":"1fc3f0ee-fe10-4aa9-a96a-fa192e03b7b9","resolution":{"observed_at":"2026-08-15T22:45:12.191723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.956632Z","title":"A., MacIntyre, R., Bies, A., Ferguson, M., Katz, K., and Schasberger, B","venue":null,"work_id":"f0ed885d-4ca8-4071-afa2-08ce95ea9d39","year":1994},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.196486Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:0bf7cc01bdf5fa91f02bb25d7de81a54a04f7b982b057f1606a12bc19624b6d4","observation_id":"e50477da-2adb-4129-8311-01b9b4a8f7cb","resolution":{"observed_at":"2026-08-15T22:45:12.961418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-15T22:45:12.201264Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.201264Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:8aa06a61e9c6a67ce15ba827bd61c9607f554724125ab0c64ce8c599dfa50a71","observation_id":"e75e35e0-ff73-4501-ab77-ae34bc89b0ca","resolution":{"observed_at":"2026-08-15T22:45:12.201264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11530","last_updated":"2024-05-19T11:55:48Z","snapshot_observed_at":"2026-08-16T13:51:32.893188Z","submitted_at":"2024-05-19T11:55:48Z","title":"Learning More Generalized Experts by Merging Experts in Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11530","snapshot_observed_at":"2026-08-15T22:45:12.210312Z","title":"Learning more generalized experts by merg- ing experts in mixture-of-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.210312Z"},"links":{"cited_paper":"/paper/2405.11530","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:014a915bfbcf7138334fede009f67c004ac90b23feb19bacff1208f5dcbcac6a","observation_id":"f706776d-9051-4c0e-9b59-a2ef268d3098","resolution":{"observed_at":"2026-08-15T22:45:12.210312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T22:45:12.214771Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.214771Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:9e000cc3220284fa3db9a2868f569a3744006994ee864d4a6b3be2fe3e8d5390","observation_id":"28b23937-7fa0-437e-a296-b90d895a38f0","resolution":{"observed_at":"2026-08-15T22:45:12.214771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1220.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.553357Z","title":"Wortsman, M., Ilharco, G., Gadre, S","venue":null,"work_id":"888d72a2-828a-4be0-9e28-2e7cdf63912e","year":2024},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.228731Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:05f6236b5ab7634838d0cffc9006988aaaccac47185e9cc9a897aad2f2a12bc8","observation_id":"675643da-3237-4297-8020-47c5b86e76c0","resolution":{"observed_at":"2026-08-15T22:45:12.562004Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-18T20:34:58.140464Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-15T22:45:12.233874Z","title":"Moe- infinity: Activation-aware expert offloading for efficient moe serving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.233874Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:340b501a3dc7b2be3fab40684868590576d033b449e22aed891abc882c0cbb64","observation_id":"97984be8-d51f-433c-b35f-b5b268f12e12","resolution":{"observed_at":"2026-08-15T22:45:12.233874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-16T20:27:57.883150Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-15T22:45:12.238873Z","title":"Resolving interference when merging models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.238873Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:6e088e7bf02f00242f01fd4fc49557b9ded926c60df44be0672b614619d70540","observation_id":"90bcabaa-a40b-4ee2-80a9-1e0eaeb73d1f","resolution":{"observed_at":"2026-08-15T22:45:12.238873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01016","last_updated":"2024-11-01T20:37:58Z","snapshot_observed_at":"2026-08-16T13:03:40.201366Z","submitted_at":"2024-11-01T20:37:58Z","title":"MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01016","snapshot_observed_at":"2026-08-15T22:45:12.243625Z","title":"Moe-i2: Compressing mixture of experts models through inter- expert pruning and intra-expert low-rank decomposition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.243625Z"},"links":{"cited_paper":"/paper/2411.01016","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:586f63f0e7e1d0028ebf62f8a1db6e2542813d25d4b2b88dd62f8119a87d41df","observation_id":"4635aa8b-5752-4e4d-be90-438bdaba0c1d","resolution":{"observed_at":"2026-08-15T22:45:12.243625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14389","last_updated":"2024-10-18T11:49:40Z","snapshot_observed_at":"2026-08-18T21:12:38.128880Z","submitted_at":"2024-10-18T11:49:40Z","title":"SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14389","snapshot_observed_at":"2026-08-15T22:45:12.248175Z","title":"Surgeryv2: Bridging the gap be- tween model merging and multi-task learning with deep representation surgery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.248175Z"},"links":{"cited_paper":"/paper/2410.14389","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:af0739b2b39207b6f3108cb578c6669ce077a8235581a3b348b9139ed4c2f7ee","observation_id":"51732976-2fb8-4f82-a106-ec094726bdf9","resolution":{"observed_at":"2026-08-15T22:45:12.248175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-08-16T17:50:47.632734Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-15T22:45:12.253030Z","title":"J., Hassan, H., Zhang, R., Zhao, T., and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.253030Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:274695f153a56c9c5080c0de4500dfcdb7b9116a4ec2a76ac938476e84cde8c8","observation_id":"4cbcd22f-5233-4ee4-ac32-627f4265ded2","resolution":{"observed_at":"2026-08-15T22:45:12.253030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T22:45:12.164099Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.164099Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f6dc04fef37efe3a2566542f26df2aa3d86cd7a2a4345937155465280422c613","observation_id":"d90afda7-6451-4fa6-a7cc-66e96165ae23","resolution":{"observed_at":"2026-08-15T22:45:12.164099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-16T14:19:38.353904Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-15T22:45:12.173343Z","title":"Kamahori, K., Gu, Y ., Zhu, K., and Kasikci, B","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.173343Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f53a81b2deee55c5334b96f4bd93f84a050885c95babf246ee4691ab9846aba7","observation_id":"ebd18d54-e81c-405d-a247-9128159767ba","resolution":{"observed_at":"2026-08-15T22:45:12.173343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-17T17:41:53.701156Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-15T22:45:12.135322Z","title":"and Mazur, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.135322Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:6dace5404ab95ca5ccb0f18090eaa20ba0d313f786b8cca0f73d4d5363e3aaf8","observation_id":"1e9d518d-105e-415c-bf48-de4c9ac13204","resolution":{"observed_at":"2026-08-15T22:45:12.135322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-16T14:21:05.484802Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-15T22:45:12.150327Z","title":"Billm: Pushing the limit of post-training quantization for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.150327Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:2624adb4c55590a9799bc9605c85ad8dc35ee4cc6ae0ed7590554092e9bf2fb9","observation_id":"e560976b-51aa-4a73-8b09-283b64fb4c1c","resolution":{"observed_at":"2026-08-15T22:45:12.150327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03888","last_updated":"2021-10-25T06:24:41Z","snapshot_observed_at":"2026-08-16T17:50:57.432238Z","submitted_at":"2021-10-08T04:24:51Z","title":"M6-10T: A Sharing-Delinking Paradigm for Efficient Multi-Trillion Parameter Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03888","snapshot_observed_at":"2026-08-15T22:45:12.187026Z","title":"M6-10t: A sharing- delinking paradigm for efficient multi-trillion parameter pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.187026Z"},"links":{"cited_paper":"/paper/2110.03888","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:8025fee5e096da301cf3a36dbec3b61a06576a1abc3253122dccaf81e47db9c9","observation_id":"1c64c3ed-d511-460e-a6db-c20dfd1dabe7","resolution":{"observed_at":"2026-08-15T22:45:12.187026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05089","last_updated":"2024-04-07T22:13:43Z","snapshot_observed_at":"2026-08-17T08:37:02.021951Z","submitted_at":"2024-04-07T22:13:43Z","title":"SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05089","snapshot_observed_at":"2026-08-15T22:45:12.205697Z","title":"Seer-moe: Sparse expert efficiency through regularization for mixture-of-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.205697Z"},"links":{"cited_paper":"/paper/2404.05089","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:c5dde942c8449a3d0e936ace3845bba51c663e274e23fce5e790c5ad89bc381a","observation_id":"58335d6e-ac25-4847-819c-062afed78d62","resolution":{"observed_at":"2026-08-15T22:45:12.205697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21804","last_updated":"2024-10-29T07:16:31Z","snapshot_observed_at":"2026-08-16T13:05:04.886415Z","submitted_at":"2024-10-29T07:16:31Z","title":"Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21804","snapshot_observed_at":"2026-08-15T22:45:12.219620Z","title":"Efficient and effec- tive weight-ensembling mixture of experts for multi-task model merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.219620Z"},"links":{"cited_paper":"/paper/2410.21804","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:136fb192e3e207392ee15744483b3504f2eea49be9fe1350a1ab85b63a247a5f","observation_id":"2f83e62e-312f-41df-b7c3-fb75f1f40703","resolution":{"observed_at":"2026-08-15T22:45:12.219620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.940267Z","title":"Exploring in-memory accelerators and fp- gas for latency-sensitive dnn inference on edge servers","venue":null,"work_id":"c8432f55-e524-48dd-8c49-a2ec86a9182f","year":2024},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.224258Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:d6a6d1bcc2f23806f12bbeab76180bbebe861c1523e44b4c6877bab74aec39e7","observation_id":"7000e4ab-0d46-4197-a195-5babe867c87d","resolution":{"observed_at":"2026-08-15T22:45:12.946045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16646","last_updated":"2024-05-30T17:30:42Z","snapshot_observed_at":"2026-08-16T13:49:17.360174Z","submitted_at":"2024-05-26T17:52:58Z","title":"A Provably Effective Method for Pruning Experts in Fine-tuned Sparse Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16646","snapshot_observed_at":"2026-08-15T22:45:12.119688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.119688Z"},"links":{"cited_paper":"/paper/2405.16646","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:35758c6af03ee8eb3db831a51baa5926f1a91c5b2f49853856932f930c317c40","observation_id":"a47a333e-07c6-4081-a2f7-b1d752c1d7cd","resolution":{"observed_at":"2026-08-15T22:45:12.119688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-15T22:45:12.125138Z","title":"Dettmers, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.125138Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f4a5ba986ec9dcbe5938f370a17bebd30ef7b041ec83e834275e491a149ea1e6","observation_id":"fcd730d3-e048-4e14-97a4-e59d216fa2a9","resolution":{"observed_at":"2026-08-15T22:45:12.125138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02396","last_updated":"2024-10-03T11:17:58Z","snapshot_observed_at":"2026-08-18T21:12:07.984829Z","submitted_at":"2024-10-03T11:17:58Z","title":"Parameter Competition Balancing for Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02396","snapshot_observed_at":"2026-08-15T22:45:12.130419Z","title":"K., Tang, H.-K., He, D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.130419Z"},"links":{"cited_paper":"/paper/2410.02396","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:607e663cf857f57bbdef7de2b7167aa61b5da9414312b87df98c3b04dca74dba","observation_id":"b72950c3-4cfe-439e-af6d-2931c5b715e3","resolution":{"observed_at":"2026-08-15T22:45:12.130419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T22:45:12.145498Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.145498Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:23ea9ff61b347ebbc88d38d54c88a5652697a244f5323459a6311b27f9f8dd93","observation_id":"5ac90b88-ef90-4698-8c4e-5138cb000122","resolution":{"observed_at":"2026-08-15T22:45:12.145498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-08-16T16:56:06.467083Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-08-15T22:45:12.114554Z","title":"Chen, T., Huang, S., Xie, Y ., Jiao, B., Jiang, D., Zhou, H., Li, J., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.114554Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:ed9e84b2cc65d4159bc61965f87d4fa69791df4a9084b65561e828f5bbd8f3ad","observation_id":"3b4c9814-32b5-4088-869a-dafd627ad67b","resolution":{"observed_at":"2026-08-15T22:45:12.114554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:18:37.982340Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.06481."}