{"as_of":"2026-08-14T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27ab9fc213706e7cec661e36bfb3c86a09d8d56e5710c2b76b770c329fc6a82e","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:08:06.927680Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10605/citation-record","integrity":"/paper/2608.10605/integrity","json":"/paper/2608.10605/citation-record.json","paper":"/paper/2608.10605"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T21:08:06.423069Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.423069Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:27969049d4e3a4826e3366b24b18e045b81215c03e2c88a2f537cdd6fec3e052","observation_id":"6b237031-4666-4a67-b242-bf83f0093fcd","resolution":{"observed_at":"2026-08-12T21:08:06.423069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T21:08:06.432109Z","title":"arXiv preprint arXiv:2203.15556 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.432109Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:ed834ec5b0bc3202415d0df09ea62da8240faedc2aae7f076345f100eee47e31","observation_id":"47491c81-8d8c-428b-afb0-e3be82c0b184","resolution":{"observed_at":"2026-08-12T21:08:06.432109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.437768Z","title":"OpenAI blog , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.437768Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:0bc5db484fb05736e28ef534d933dfafc39c2f5306f2c2c867b1b98570c3e50c","observation_id":"fde08990-4081-40a3-84c2-fe5d6d5fedf7","resolution":{"observed_at":"2026-08-12T21:08:06.437768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-08-12T23:55:55.131975Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-12T21:08:06.445085Z","title":"arXiv preprint arXiv:2405.18392 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.445085Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:934da4b144bef6f98d0192344dfb61dcb08ed664e04f311fd825a4ae929b4cf9","observation_id":"861e5366-811d-4e69-be36-4504f6cc5566","resolution":{"observed_at":"2026-08-12T21:08:06.445085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-13T04:20:21.968880Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-12T21:08:06.453774Z","title":"arXiv preprint arXiv:2402.07871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.453774Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:7b9378179aba67807fd203ad0b68d0b87b283adb1e84be5bc1dd465de969d842","observation_id":"f82952f8-c475-4040-87f5-21e42320667a","resolution":{"observed_at":"2026-08-12T21:08:06.453774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.468088Z","title":"The Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.468088Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:eb14c693cf1a34ed3237ae939c64d0d5e9b5def1528467753dde175e91982fb1","observation_id":"3e9a04ba-a6c0-4ffc-ab1b-bf1478f0881b","resolution":{"observed_at":"2026-08-12T21:08:06.468088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.476414Z","title":"arXiv preprint arXiv:2602.17004 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.476414Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:2418a932a4f925b3f0ae99f3f3e6f90c4408f672f48d1456c133379a7b96ab2f","observation_id":"e732c600-88a4-45be-9c2e-75e1102e1db1","resolution":{"observed_at":"2026-08-12T21:08:06.476414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T21:08:06.482664Z","title":"arXiv preprint arXiv:2401.06066 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.482664Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:3fcb588df1eb85cdf0e730b27c4b3400ea0b8b9382e0b66206350ae7fcb5ce2e","observation_id":"90adece7-a22a-4597-8feb-36a4ad71bc70","resolution":{"observed_at":"2026-08-12T21:08:06.482664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-12T21:08:06.491904Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.491904Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8dfcde0ebc633bdabf69bd5fa3642dbef50c31e990eb6b2a2c297dfe263b233b","observation_id":"1080a66c-5564-40be-8bd3-2f1bb83852a0","resolution":{"observed_at":"2026-08-12T21:08:06.491904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T21:08:06.499520Z","title":"arXiv preprint arXiv:1701.06538 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.499520Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:57daf718c6897436719c76c7842278f439ce01170d7dc11d86993e5efcfb188d","observation_id":"7696dc40-8288-4176-876c-614dbc9e2618","resolution":{"observed_at":"2026-08-12T21:08:06.499520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06182","last_updated":"2023-06-18T01:33:19Z","snapshot_observed_at":"2026-08-13T12:27:26.154745Z","submitted_at":"2023-03-10T19:30:15Z","title":"Towards MoE Deployment: Mitigating Inefficiencies in Mixture-of-Expert (MoE) Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06182","snapshot_observed_at":"2026-08-12T21:08:06.509818Z","title":"arXiv preprint arXiv:2303.06182 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.509818Z"},"links":{"cited_paper":"/paper/2303.06182","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:61cf7da38e921cdbfad05184357930df96ef178f7ed32becde8e231a1af5a988","observation_id":"1b8dfd78-0887-4ef0-8656-8b152fcca41d","resolution":{"observed_at":"2026-08-12T21:08:06.509818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01483","last_updated":"2024-09-02T22:35:03Z","snapshot_observed_at":"2026-08-12T22:52:47.648145Z","submitted_at":"2024-09-02T22:35:03Z","title":"Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01483","snapshot_observed_at":"2026-08-12T21:08:06.516918Z","title":"arXiv preprint arXiv:2409.01483 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.516918Z"},"links":{"cited_paper":"/paper/2409.01483","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:002af6e65a244744f80f5b7df9fd27855c6ea1c426d01e129e963077860b0a2d","observation_id":"a8c1dbfc-90ea-4c17-aac4-7fa0e64eaade","resolution":{"observed_at":"2026-08-12T21:08:06.516918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-12T21:08:06.522212Z","title":"arXiv preprint arXiv:1712.00409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.522212Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:00ea1da5fd938c282efd6997f9c70f08858aedbcf4318543de75878c56013f61","observation_id":"9871cdd8-c02c-4d43-a1a5-40b83cea89cd","resolution":{"observed_at":"2026-08-12T21:08:06.522212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.523251Z","title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24) , pages=","venue":null,"work_id":"d94e1f62-806a-49a4-8bc2-bb913b3216a1","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.532469Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:85e6f7a703c4b6fec53952e90245830db1c319ea3a26f117c02cabbccdd093b6","observation_id":"e966b2f0-c44c-401f-a2d4-b0cf9dc2c31c","resolution":{"observed_at":"2026-08-12T21:08:08.528755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.505098Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"d31dd71f-3b5a-4da9-b06c-e72b3f6ca022","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.539609Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8007e5168396adb5e0a91259f49d74ec4fc0943587fba2ee8bc9d23ece6b1f7f","observation_id":"279fba2c-7251-4635-937a-4a6803670712","resolution":{"observed_at":"2026-08-12T21:08:08.510849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03745","last_updated":"2024-05-13T16:20:29Z","snapshot_observed_at":"2026-08-13T11:23:21.274497Z","submitted_at":"2023-06-06T15:04:31Z","title":"Soft Merging of Experts with Adaptive Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03745","snapshot_observed_at":"2026-08-12T21:08:06.547274Z","title":"arXiv preprint arXiv:2306.03745 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.547274Z"},"links":{"cited_paper":"/paper/2306.03745","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:10dc8027047097579bdd1bb27e408fe3a239b8c581f04230f424dcb752d91635","observation_id":"c87a1f04-715e-4808-ac78-43a805473548","resolution":{"observed_at":"2026-08-12T21:08:06.547274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.554427Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.554427Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9537404c59548d89c12acf2857b29b073482919f25306e469aac2dd85b7d6673","observation_id":"23f54b16-ca69-4c39-9c8f-3524ca1fb631","resolution":{"observed_at":"2026-08-12T21:08:06.554427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-12T21:08:06.563306Z","title":"arXiv preprint arXiv:2202.08906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.563306Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8bb07805a6a78882e6c60a0d118c1d143869a7f4db4f1de6fdf7a317626a2097","observation_id":"d328b382-a377-4683-9ee5-93f5861a7488","resolution":{"observed_at":"2026-08-12T21:08:06.563306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-13T03:40:31.715335Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-12T21:08:06.569375Z","title":"arXiv preprint arXiv:2010.11934 , year=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.569375Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:aab3fd7e2e9cc03df441974970aad3abadb9ad0197bba34b79a6ab51a50aa051","observation_id":"180b8c83-5844-4a82-a2f3-7387ea466ace","resolution":{"observed_at":"2026-08-12T21:08:06.569375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T21:08:06.577582Z","title":"arXiv preprint arXiv:1711.05101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.577582Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:84276a6a7cd704c5e1c2ca91c80f4bc88688a2ea06fb82a4d5e300aabf4cbd09","observation_id":"f518dc8b-0d3d-46ed-8094-0ada1d9a1239","resolution":{"observed_at":"2026-08-12T21:08:06.577582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.585378Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.585378Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:39e7464dd7b0bf2cf6d2ebdee82cbbe97922b883a4622a28cbda18f3ec770dd9","observation_id":"3e6274c2-2655-4793-81a4-f6ab3e552ccd","resolution":{"observed_at":"2026-08-12T21:08:06.585378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.591968Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.591968Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:bc2aecb2b2f1729bce0b271b977c4654696044b41e0c50ebdb0ca61c4b304992","observation_id":"4da4ec42-e680-45ce-a964-70da5d2d60d5","resolution":{"observed_at":"2026-08-12T21:08:06.591968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.454054Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"68f21655-acb2-492c-bdea-d168e02cda34","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.603038Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9b5aae933b6be05f8d5f264d487af714dc2b7f5918d743f095c42aa7c0c4cd59","observation_id":"4956d621-53c3-4deb-9a73-9c60ee34f75f","resolution":{"observed_at":"2026-08-12T21:08:08.459310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-12T21:08:06.610506Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.610506Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:5e5849a0651a8f46ed55a2a868fe7372fd837ec7424efd822914b2ed72132806","observation_id":"95909ba1-571c-4750-908c-a6bacbad924f","resolution":{"observed_at":"2026-08-12T21:08:06.610506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-12T22:27:39.491552Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-12T21:08:06.618512Z","title":"arXiv preprint arXiv:2410.06511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.618512Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:235097107298910520b7e967284b544aef4c2509fb23357f96c6e4a71e33bf4e","observation_id":"b330c79b-3ab7-43f9-adfb-b8cfff00a7ec","resolution":{"observed_at":"2026-08-12T21:08:06.618512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.436245Z","title":"Proceedings of the 37th International Conference on Supercomputing , pages=","venue":null,"work_id":"8911ac53-713b-4b6f-9036-747aea2b4f5b","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.627467Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:f7d25e76d55c00f834d27810739e6287a5adeef1ca7f4b82acd8e3f9b241690b","observation_id":"2db3621f-72dc-441d-9a87-43bf15884b26","resolution":{"observed_at":"2026-08-12T21:08:08.441684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.634827Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.634827Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b1be0ca2b675c76b05c734d0b1870b3842107c8900ef01224e72242259204759","observation_id":"ddac6e36-ac01-4d02-87b6-98eef57438b9","resolution":{"observed_at":"2026-08-12T21:08:06.634827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.641066Z","title":"arXiv preprint arXiv:2512.16248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.641066Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8304c3ea97bcf220cda00bfd4106015c6b148026443a4b209eb12800aa3438b2","observation_id":"77f763c1-36c8-4566-be38-58849a6bffff","resolution":{"observed_at":"2026-08-12T21:08:06.641066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.406772Z","title":"Proceedings of Machine Learning and Systems , volume=","venue":null,"work_id":"402d1223-6747-4713-98ac-0cb956cefbab","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.647620Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:dd83ce2eb9611574a9ea547884dbce42575658d8a775c563b5bd272b613789c2","observation_id":"1c8a86d5-b17a-40d5-ab96-fa4a01bd3183","resolution":{"observed_at":"2026-08-12T21:08:08.411548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.388572Z","title":"Sparse Backpropagation for","venue":null,"work_id":"ec4cb634-73bf-4e1f-a663-67b44a01d4a6","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.655242Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:9e3cea9877f092cc08b0693796168f16260bb1a1d208fafa649a8285ba318927","observation_id":"a5bd3903-2a3d-4555-93c5-8ec1ac3ea360","resolution":{"observed_at":"2026-08-12T21:08:08.394469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.372954Z","title":"International Conference on Learning Representations (ICLR) , year=","venue":null,"work_id":"c56a8497-3efb-4598-8d10-1c2473659a1e","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.663348Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8c1a3f74f695576afc0a9e8a3ad14696c1185cf80423313803d6b95f7051f8a4","observation_id":"79fb29b2-7267-4aea-ab3c-8ec0215c5399","resolution":{"observed_at":"2026-08-12T21:08:08.378260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.355748Z","title":", journal=","venue":null,"work_id":"24469175-ec68-4193-b74c-15e5d7b815b0","year":1977},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.672459Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:eb4958fc84e51b3e03aeeb11b10c26ad5fa7669774f3ab89b17b5066fb531b0e","observation_id":"f6b20c4f-038b-4fac-93fe-81f5dce1414b","resolution":{"observed_at":"2026-08-12T21:08:08.361176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.334466Z","title":"Stochastic Beams and Where to Find Them: The","venue":null,"work_id":"3142f810-5a20-44c9-9b57-69636f61d1fb","year":2019},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.679677Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:34f9f7eaf832493818fdce9236511dd3f2e0651cf16363fc5be28c7756169af1","observation_id":"d3a1d671-822b-4d98-a8ee-48160e81cfa5","resolution":{"observed_at":"2026-08-12T21:08:08.341498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.317170Z","title":"Parameters vs","venue":null,"work_id":"f1fe826b-0478-489e-9183-7722fe4e234d","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.686122Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:05c6ec4939dfc8a9568145b48dec01079ebb4dd4323b4aae745b4c1c34c29c30","observation_id":"25a6391b-18bb-46dd-a4ca-72266ad9a46b","resolution":{"observed_at":"2026-08-12T21:08:08.322797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.297679Z","title":"Optimization and Engineering , volume=","venue":null,"work_id":"f421caa1-fea7-4868-91bb-01f5b73bfa06","year":2007},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.695408Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:e64e00608f60eb7e741b9b8b353617f77d387460c9a1a3f9b438b62581f2159e","observation_id":"dd158be4-d9fe-486e-bc92-1ac282baf021","resolution":{"observed_at":"2026-08-12T21:08:08.303510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13055","last_updated":"2025-04-12T19:46:24Z","snapshot_observed_at":"2026-08-12T16:50:37.700290Z","submitted_at":"2024-11-20T06:05:11Z","title":"Hardware Scaling Trends and Diminishing Returns in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13055","snapshot_observed_at":"2026-08-12T21:08:06.703997Z","title":"arXiv preprint arXiv:2411.13055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.703997Z"},"links":{"cited_paper":"/paper/2411.13055","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:a87cac64f537bc4bcbcab13e17685a6b4104a864fd0f422c26c754a8c6000807","observation_id":"a0f4deb9-0b83-40f3-85b5-0ccb76c475eb","resolution":{"observed_at":"2026-08-12T21:08:06.703997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.277064Z","title":"Proceedings of the 53rd International Conference on Parallel Processing (ICPP '24) , year=","venue":null,"work_id":"1aaa2c12-3cd6-485a-a39f-b1b9bbd6c98c","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.711100Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:22fc95c3b9c50511a3ff1ea0d0fcd5fb87eb92b0a5c50e3833b478ebfd80127e","observation_id":"1a9e5656-4d2f-41ce-a555-973240e861ce","resolution":{"observed_at":"2026-08-12T21:08:08.282981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06589","last_updated":"2025-06-19T06:06:08Z","snapshot_observed_at":"2026-08-10T20:54:48.735590Z","submitted_at":"2025-01-11T17:06:30Z","title":"Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06589","snapshot_observed_at":"2026-08-12T21:08:06.717332Z","title":"arXiv preprint arXiv:2501.06589 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.717332Z"},"links":{"cited_paper":"/paper/2501.06589","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:8fe2a97373eb195884f472e6c22f5c517ec22dd184978b3cbe9d2bd7d72a05b9","observation_id":"1f65d64f-35b8-4e10-a7fb-773266371e79","resolution":{"observed_at":"2026-08-12T21:08:06.717332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-12T21:08:06.722936Z","title":"arXiv preprint arXiv:2408.00724 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.722936Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:5e4b912686994697176366a6301022338c29d1327ff5cfad60ff2fefbd3b9cae","observation_id":"4feff81c-8e56-4db7-a1ce-7eb0ad1fc118","resolution":{"observed_at":"2026-08-12T21:08:06.722936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.256244Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis (SC) , year=","venue":null,"work_id":"3ab78187-74a0-42a2-bc3c-96a7d0f11014","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.733754Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:f101ca03e9a4256314ac92d6a6679a3745a3cbc158a416013d824bddd4a15208","observation_id":"93423d63-cddb-4e3f-aa36-c6a940914633","resolution":{"observed_at":"2026-08-12T21:08:08.261822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.236913Z","title":"2024 57th IEEE/ACM International Symposium on Microarchitecture (MICRO) , pages=","venue":null,"work_id":"4ec0a691-f682-4df0-9b18-7f95952519cb","year":2024},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.742426Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b885fd6eda84219d1ab86a254f9c26621ed8b108ed6782de27d3896520b4794d","observation_id":"449a3ae6-aed0-4dfe-82f8-7be2cdeca79e","resolution":{"observed_at":"2026-08-12T21:08:08.243661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-13T19:29:56.924741Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18107","snapshot_observed_at":"2026-08-12T21:08:06.751426Z","title":"arXiv preprint arXiv:2501.18107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.751426Z"},"links":{"cited_paper":"/paper/2501.18107","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:5cdf481f585e4d73834e67ae1733e191ac9f56ac794a486c81198599fb367103","observation_id":"58850515-0fa4-454f-b1c8-916159b0c19b","resolution":{"observed_at":"2026-08-12T21:08:06.751426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.213557Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient","venue":null,"work_id":"5d4248a2-c172-4f20-b8dc-2ed0e9aaf7f8","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.769078Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:55ee1307b2835d28c9803625a9fe876d0625dd05a092e32011e2c52c1f80dbe7","observation_id":"f0ee2933-cfee-4a90-8d9a-a4220749136a","resolution":{"observed_at":"2026-08-12T21:08:08.221653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.192464Z","title":null,"venue":null,"work_id":"fc77c84d-563b-4904-bd92-612d1ab0c174","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.779225Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:487bf14cd758deddec94f51f8ae611ca406380142bc76367660f8e28a673bf00","observation_id":"60ff314d-10eb-405d-be45-99a8e95fd263","resolution":{"observed_at":"2026-08-12T21:08:08.198270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.174694Z","title":"What Language Model to Train if You Have One Million","venue":null,"work_id":"87baa5c8-9880-4914-8b1e-effbcef26451","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.786185Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:ef19cdd2a707b55c6c5d31c3323e0cf899e9da68c1db3404aab47f7b53900ae5","observation_id":"609d2c17-df99-463d-8f5c-aaf46b44a079","resolution":{"observed_at":"2026-08-12T21:08:08.180191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01640","last_updated":"2026-05-02T23:14:20Z","snapshot_observed_at":"2026-08-14T03:13:24.583119Z","submitted_at":"2026-05-02T23:14:20Z","title":"Prescriptive Scaling Laws for Data Constrained Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01640","snapshot_observed_at":"2026-08-12T21:08:06.794872Z","title":"arXiv preprint arXiv:2605.01640 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.794872Z"},"links":{"cited_paper":"/paper/2605.01640","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:f8901e807e00b8a04b546f68b5e7e1a57c6a14783e300c1592a48d9326c20313","observation_id":"1b3e09af-ea8a-4bc3-996c-aa414ca16d3d","resolution":{"observed_at":"2026-08-12T21:08:06.794872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04800","snapshot_observed_at":"2026-08-12T21:08:06.805052Z","title":"arXiv preprint arXiv:2510.04800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.805052Z"},"links":{"cited_paper":"/paper/2510.04800","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:ea7fc18a2aa9e0a7c8eb6da86e7ae34a2b9162df054c663d111d89fd768e44e7","observation_id":"84ca1d38-a2d4-4d68-91f9-0eabbd6abe40","resolution":{"observed_at":"2026-08-12T21:08:06.805052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.154425Z","title":null,"venue":null,"work_id":"77acf246-b9e4-4956-88c9-e0a4b96ee52f","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.820167Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b3ddba42260833671714120ee48c1d94fca996911047b8a2748efcf2e5d846a9","observation_id":"9083bc53-b9b8-4188-b023-70bcb6f7707b","resolution":{"observed_at":"2026-08-12T21:08:08.159756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21862","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:07.296134Z","title":"arXiv preprint arXiv:2603.21862 , year=","venue":null,"work_id":"4926edd8-afb7-48c6-9dba-e1f71b251f3e","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.833575Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:b93919c483a72ca1d2cb3a83b1e3bc0deaf444a3f760ddf18ac5b619658d71a9","observation_id":"f3766a08-927a-4c1c-b9be-a1cdcbc3fd23","resolution":{"observed_at":"2026-08-12T21:08:07.308329Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.133085Z","title":"Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device","venue":null,"work_id":"1e289c3b-ec3c-4fd7-86d9-65bcf2cfe6e3","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.840506Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:026b79552664d34e91fb68972feae6fdad149f2c1498366c2d9b8a39610ebbaa","observation_id":"f62370e6-1b8b-4a82-b630-b3e5a55a2682","resolution":{"observed_at":"2026-08-12T21:08:08.140674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.109178Z","title":null,"venue":null,"work_id":"13da5a71-d6f7-4bd0-9dac-4f5a3117bdd2","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.847152Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:c355b67858ad315d607f6cf4f7265985a52829bf75f130d29c0cd819ffa92e41","observation_id":"e56bed54-749c-4a9a-a535-93c8abb5bfe6","resolution":{"observed_at":"2026-08-12T21:08:08.117496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.858721Z","title":"arXiv preprint arXiv:2502.06857 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.858721Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:cc0732d03aac76d5808b78eb61a25c059eda6310a1ebe746cff921a72e654444","observation_id":"78feed03-83dd-4332-997d-ec02b47a65b2","resolution":{"observed_at":"2026-08-12T21:08:06.858721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-12T21:08:06.867144Z","title":"arXiv preprint arXiv:2505.06708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.867144Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:622c306b39611e86bd758759c5a1f4dc565fb5a445d9e1e8541a1e460ae541f1","observation_id":"d64de1ae-e263-476f-9f40-f3cf22e128d3","resolution":{"observed_at":"2026-08-12T21:08:06.867144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-12T21:08:06.874115Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.874115Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:c5553d18159e0d56b999cb8408f75d7f723a390762dee12ce0db01b786130de5","observation_id":"c63cd9ad-4e5c-4fa7-959b-c7c60cca800a","resolution":{"observed_at":"2026-08-12T21:08:06.874115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20205","last_updated":"2026-05-21T16:25:08Z","snapshot_observed_at":"2026-08-08T00:53:05.460185Z","submitted_at":"2026-01-28T03:02:30Z","title":"Hyperparameter Transfer with Mixture-of-Expert Layers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20205","snapshot_observed_at":"2026-08-12T21:08:06.883270Z","title":"arXiv preprint arXiv:2601.20205 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.883270Z"},"links":{"cited_paper":"/paper/2601.20205","citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:c9c7dfa6d94d1e73b824a2b198c5881dc87df497772a0c13b7dbb2722c13a445","observation_id":"f6255afb-ffab-4fd7-9aae-e43673a7f8ca","resolution":{"observed_at":"2026-08-12T21:08:06.883270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.895399Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.895399Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:110809e0e7cc47393bfd9cb8ceaf7cd91d46efb1172399fb3a661ae274bfda8b","observation_id":"6b4c7453-91e9-4953-b27b-1697467ad407","resolution":{"observed_at":"2026-08-12T21:08:06.895399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.908926Z","title":"arXiv preprint arXiv:2603.05451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.908926Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:246c2c79ce22a5ce2bcb568f69a6f8f2b8ddce037f2661b2e645dc0c6b94e153","observation_id":"356a404e-2158-4d02-894c-0369c44ee890","resolution":{"observed_at":"2026-08-12T21:08:06.908926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:06.922488Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.922488Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:237762743b23dcb7c9bb49df941fc32e25a43fd3d10583d227bc5d42677be130","observation_id":"2056925c-6285-471d-85d7-73ba10d0eb8f","resolution":{"observed_at":"2026-08-12T21:08:06.922488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:08:08.050322Z","title":"Proceedings of the 52nd Annual International Symposium on Computer Architecture , year=","venue":null,"work_id":"f74a34d3-cccd-4c13-9451-0048397176ce","year":null},"citing_paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T21:08:06.927680Z"},"links":{"citing_paper":"/paper/2608.10605"},"observation_digest":"sha256:477e839f752abf3459ae3540736ee68b3ecc9d9db74481e8a8bac62cca62130e","observation_id":"a46d8889-f46d-4051-b381-b021bfe68bd6","resolution":{"observed_at":"2026-08-12T21:08:08.059996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10605","last_updated":"2026-08-11T07:49:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T07:10:36.753503Z","submitted_at":"2026-08-11T07:49:00Z","title":"Compute-Optimal Is Not Cluster-Optimal: Systems-Aware Scaling for Sparse Mixture-of-Experts"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2608.10605."}