{"as_of":"2026-08-08T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:939acda6fa8109ff9a24b543a5aeafcac2b768aa82f2bccbc21fa8af0320f186","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:19:02.406641Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02890/citation-record","integrity":"/paper/2506.02890/integrity","json":"/paper/2506.02890/citation-record.json","paper":"/paper/2506.02890"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T11:18:57.605069Z","title":"arXiv: 1911","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.605069Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:58338ea0a49f9868e83acb24ffccfb5816a8b8fdee40152652c8645864bafd4d","observation_id":"23d42a33-69a1-42d0-9044-f9b7cb5f1412","resolution":{"observed_at":"2026-08-07T11:18:57.605069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01169","last_updated":"2022-02-09T11:07:21Z","snapshot_observed_at":"2026-08-06T06:53:10.381665Z","submitted_at":"2022-02-02T17:58:52Z","title":"Unified Scaling Laws for Routed Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01169","snapshot_observed_at":"2026-08-07T11:18:57.728870Z","title":"arXiv: 2202.01169 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.728870Z"},"links":{"cited_paper":"/paper/2202.01169","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:77702e51ea11fe7dab1a841029c0925ed87281d00d7cebf931c68882ad4c5837","observation_id":"6c5c04c0-114f-4b1d-b2e7-e13f50b7573b","resolution":{"observed_at":"2026-08-07T11:18:57.728870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:18:57.847592Z","title":"arXiv: 1803.05457 [cs.AI]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.847592Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:c06af73c74cf9d9baccfca89c38460d6998239ef724621d07147a607230318ad","observation_id":"490955d4-d1fa-4eae-925c-960bfbf0357b","resolution":{"observed_at":"2026-08-07T11:18:57.847592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T11:18:57.953340Z","title":"Wu, Zhenda Xie, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:57.953340Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:9e261eef54d21a090e7ec9edc24e1b84538a380b4abf8158d9d08fdf4e4edb6d","observation_id":"cf6215c0-8604-43ad-88a1-1ade11843c52","resolution":{"observed_at":"2026-08-07T11:18:57.953340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08968","last_updated":"2024-11-13T19:02:36Z","snapshot_observed_at":"2026-07-06T19:50:01.724540Z","submitted_at":"2024-11-13T19:02:36Z","title":"Sparse Upcycling: Inference Inefficient Finetuning","version":1},"cited_work":{"arxiv_id":"2411.08968","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.08968","snapshot_observed_at":"2026-08-07T11:19:03.499126Z","title":"Sparse Upcycling: Inference Inefficient Finetuning","venue":"cs.LG","work_id":"520286c1-1155-4caa-88c4-f158b77bfcb9","year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.094528Z"},"links":{"cited_paper":"/paper/2411.08968","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:55b4a5ed7c96fc2666489eb61aa49de7987fd3184fab9ad7d617b0627fdd8239","observation_id":"7e5135d2-3a1a-4c4a-ab67-87ee6e3f6d41","resolution":{"observed_at":"2026-08-07T11:19:03.596040Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-07T11:18:58.233961Z","title":"arXiv: 2112.06905 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.233961Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:10ef6c42e04bfc674da7f5537e6c92499751796804ef44028207546884115a65","observation_id":"ac690ccf-7837-4ab3-86b4-91ad969c3ef0","resolution":{"observed_at":"2026-08-07T11:18:58.233961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:18:58.354384Z","title":"(2024).The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.354384Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:76afdc2b713ec56fedc0314913c4e43b78d31cfea905a84936488ec94fe0e7f7","observation_id":"cbcf660c-bf90-4ac9-9fdc-e8586bda8110","resolution":{"observed_at":"2026-08-07T11:18:58.354384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14393","last_updated":"2024-01-19T17:33:44Z","snapshot_observed_at":"2026-07-06T16:23:30.533693Z","submitted_at":"2023-09-25T14:50:04Z","title":"LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14393","snapshot_observed_at":"2026-08-07T11:18:58.457714Z","title":"LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.457714Z"},"links":{"cited_paper":"/paper/2309.14393","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a1025cf88716f60dbc63481e2884f2a6e999a1fcddb29179ff79d41e107e7949","observation_id":"bfaf3d68-9e6d-41b0-9a53-a672eee2a5ab","resolution":{"observed_at":"2026-08-07T11:18:58.457714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-07T11:18:58.610575Z","title":"arXiv: 2101.03961 [cs.LG]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.610575Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:418289cc845eea3cf96c8113fd0ec85504761a7974e211657a9614c8ae1ca564","observation_id":"07219901-bb44-4405-a9b3-810c78fad12b","resolution":{"observed_at":"2026-08-07T11:18:58.610575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-03T23:24:43.956833Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-07T11:18:58.768850Z","title":"arXiv: 2211.15841 [cs.LG]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.768850Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:bff4ffb3a3e518dda490bb512222478e48d3b05b31ec8cf8a03a902a43f24405","observation_id":"55dafae2-588d-4e18-b4ee-64b9a1a0224f","resolution":{"observed_at":"2026-08-07T11:18:58.768850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07524","last_updated":"2025-06-16T02:29:18Z","snapshot_observed_at":"2026-08-07T07:47:25.930763Z","submitted_at":"2024-10-10T01:36:03Z","title":"Upcycling Large Language Models into Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07524","snapshot_observed_at":"2026-08-07T11:18:58.896820Z","title":"Upcycling large language models into mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:58.896820Z"},"links":{"cited_paper":"/paper/2410.07524","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:e735175ffaa345c6d01d831989b53b87f315741fd43acd8b565ad65291e78fdd","observation_id":"429f91ef-ec6b-419b-85c8-820860df9c47","resolution":{"observed_at":"2026-08-07T11:18:58.896820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:18:59.031902Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.031902Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:cd2ead14ee3929ccafba86222879882dae01a334ccba4fb4dbce004b6de534b7","observation_id":"64cd1e7f-79d9-4754-8811-bcb8c29a1841","resolution":{"observed_at":"2026-08-07T11:18:59.031902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T11:18:59.176409Z","title":"Rae, Oriol Vinyals, and Laurent Sifre (2022).Training Compute-Optimal Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.176409Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:beb0a85a836f26cf93017424586d20de14f5ae8a65e4632af45c7527647cfbb2","observation_id":"f5bb8d47-9b68-4ab0-8272-085aaed78c67","resolution":{"observed_at":"2026-08-07T11:18:59.176409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T11:18:59.337088Z","title":"arXiv: 2401.04088 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.337088Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:eda85e301406fdd40fc894d76b8edaa29de151180b187098e1505c7b9fb0271f","observation_id":"3cc6b99b-984c-4575-914f-684b0cc97be5","resolution":{"observed_at":"2026-08-07T11:18:59.337088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:18:59.465287Z","title":"arXiv: 2001.08361 [cs.LG]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.465287Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:0b108a7aa4b56acfe9e114b9aefadcda52e8b6fbd19cce355dbf2e483338c2f9","observation_id":"25d45c05-03e1-421c-92cb-edc25657d8e0","resolution":{"observed_at":"2026-08-07T11:18:59.465287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-07T11:18:59.617737Z","title":"arXiv: 2402.07871 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.617737Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:83a84e520f622c86bb53b6babc2528f4e8e96fc484740de967a002f4052f822a","observation_id":"49c2378d-5ed7-4d2f-a1f9-9e08474a9558","resolution":{"observed_at":"2026-08-07T11:18:59.617737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-07T11:18:59.705154Z","title":"arXiv: 1704.04683 [cs.CL]","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.705154Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a737b4e5f8d270afd741014c6c24a8547eb1905a98c927ea94ea004d43665695","observation_id":"c31a50cf-a3bb-49af-ae73-2a2b94cca90a","resolution":{"observed_at":"2026-08-07T11:18:59.705154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-07T11:18:59.866309Z","title":"arXiv: 2006.16668 [cs.CL]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.866309Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:81b35964318aec692591378e7a98e081f91591d16168346e8af51c494dc4076d","observation_id":"efaed30b-9103-4d35-8666-f46d2d19fbf2","resolution":{"observed_at":"2026-08-07T11:18:59.866309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-07T11:18:59.970756Z","title":"arXiv: 2109.07958 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:59.970756Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:72b91776cd937687c45fc03a189e6cf53a9c87f306a7a000488e4d21a2fbae97","observation_id":"8af221aa-1615-432b-8715-36b997b7a23a","resolution":{"observed_at":"2026-08-07T11:18:59.970756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:19:00.070619Z","title":"arXiv: 1711.05101 [cs.LG]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.070619Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:bcbc2668f8e58481a5d2dd66ae2972dfad76ea7b15fdfb82fc91811cd7be73a4","observation_id":"6cda30c3-4cf6-4df1-84aa-8c83da93f4b6","resolution":{"observed_at":"2026-08-07T11:19:00.070619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T11:19:00.187903Z","title":"arXiv: 1809.02789 [cs.CL]","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.187903Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:e42b6ab2146390a1540652e353076f2b99e07ba628fffbd2ff2b08c7aca5f3d3","observation_id":"440298cf-05a8-4c27-9f66-92bad5874d99","resolution":{"observed_at":"2026-08-07T11:19:00.187903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-07T11:19:00.317285Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.317285Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:78352f6d2f6dacb13f39f424b6ff3cf7da10f5593cd3e63f8284ae3c5806a98e","observation_id":"09650bda-ab84-413a-ae5a-07c044a036b9","resolution":{"observed_at":"2026-08-07T11:19:00.317285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16819","last_updated":"2024-02-27T15:22:57Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:43:45Z","title":"Nemotron-4 15B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16819","snapshot_observed_at":"2026-08-07T11:19:00.444605Z","title":"arXiv: 2402.16819 [cs.CL]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.444605Z"},"links":{"cited_paper":"/paper/2402.16819","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:527c365d9669811dc45b013408ed1020f37c379886a19d47f32d54a8a2823119","observation_id":"8b7bce40-c419-4b8b-8405-e67e9b3de5c6","resolution":{"observed_at":"2026-08-07T11:19:00.444605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-07T09:28:48.845112Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-07T11:19:00.551984Z","title":"Reuse, Don’t Retrain: A Recipe for Continued Pretraining of Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.551984Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:170d2a73597b2eb7a019f5b6477fd3962435ff958cff33e0d23f7fb7dc6d61fc","observation_id":"93099af7-621f-4c4d-adcb-63637862ad55","resolution":{"observed_at":"2026-08-07T11:19:00.551984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T11:19:00.673638Z","title":"arXiv: 1907.10641 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.673638Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a5fe2516aeb49eb88cf19a3c6b57e99c11826694da0f64e8bc99afc9d552bc6f","observation_id":"10dac4b0-507a-471a-bde5-a808b18e13b8","resolution":{"observed_at":"2026-08-07T11:19:00.673638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T11:19:00.786422Z","title":"arXiv: 1904.09728 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.786422Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:56cbbaff2b493da4cde4ddb3c8462bd9cccd40d14b8fa0fd8dadfe1d3e896824","observation_id":"203ac900-8af4-4aaf-a6bd-317fba9b1f18","resolution":{"observed_at":"2026-08-07T11:19:00.786422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T11:19:00.898089Z","title":"arXiv: 2002.05202 [cs.LG]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.898089Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:457ee6fbd5cf011bd80c410959b297d97fc3b891d3edd62cf65738296e9a0364","observation_id":"4f5a9f30-f350-446d-8f03-53eb866f7a82","resolution":{"observed_at":"2026-08-07T11:19:00.898089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-07T11:19:00.953255Z","title":"arXiv: 1701.06538 [cs.LG]","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:00.953255Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:18fd671948271a338baa5fdd1f0709613fdac3c3f4290376ee294f76e2290809","observation_id":"5e5fe9c0-cf6c-4447-83a7-26d75f2bbccd","resolution":{"observed_at":"2026-08-07T11:19:00.953255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T11:19:01.053899Z","title":"arXiv: 1909.08053 [cs.CL]","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.053899Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:f7b84617ed20c0a73e598a168628ae2ae14c9d6cf0a265b41486003778dabcb5","observation_id":"50cdbd4e-1a64-417c-8797-e52818ce1cc7","resolution":{"observed_at":"2026-08-07T11:19:01.053899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T11:19:01.172988Z","title":"arXiv: 1811.00937 [cs.CL]","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.172988Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:d54b3635b02155eb6fc5b5ba7c6305c855610aa23d83a96334c12cad1f2dda50","observation_id":"9df312bc-e8dc-4c7b-b8f8-e54611c79b15","resolution":{"observed_at":"2026-08-07T11:19:01.172988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08245","last_updated":"2024-10-04T03:44:02Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:00:23Z","title":"Scattered Mixture-of-Experts Implementation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08245","snapshot_observed_at":"2026-08-07T11:19:01.275789Z","title":"arXiv: 2403.08245 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.275789Z"},"links":{"cited_paper":"/paper/2403.08245","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:8544c22c2fb6c93644b882f1e499cd3b2c8c2449f10321067a03c0024480d543","observation_id":"78708258-bb64-4aec-a720-da550fee9539","resolution":{"observed_at":"2026-08-07T11:19:01.275789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:19:01.417409Z","title":"(2024).Gemini: A Family of Highly Capable Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.417409Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:cf6133d7786bedec642c7cd773305c6921c452773bfe79f70beb230fd65108fb","observation_id":"8bbe1ebc-a25d-4c7d-b1eb-2a4650f36c6d","resolution":{"observed_at":"2026-08-07T11:19:01.417409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:19:01.521645Z","title":"arXiv: 2302.13971 [cs.CL]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.521645Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:9885cc519f2905b65526994842295da7034870697ae33f1680cd62a2641ad5ce","observation_id":"880eabab-d2fe-4fb5-93c1-b37eec1aab11","resolution":{"observed_at":"2026-08-07T11:19:01.521645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:19:01.657198Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.657198Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:15723f7d72b48242d6afc16da6c090a2c0edb38d93c5348e78f1b9817e58d3e1","observation_id":"a206d79e-3f9a-4d15-a308-51b65b513df5","resolution":{"observed_at":"2026-08-07T11:19:01.657198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T11:19:01.798731Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin (2023).Attention Is All You Need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.798731Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:b78c60508e81eea499df292a6c01ec843689f77d871384cbf469196aab66bef3","observation_id":"38a7c2ea-f04f-4928-9c37-c87943b8b149","resolution":{"observed_at":"2026-08-07T11:19:01.798731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09952","last_updated":"2024-12-13T08:22:19Z","snapshot_observed_at":"2026-08-07T06:34:06.946381Z","submitted_at":"2024-12-13T08:22:19Z","title":"Llama 3 Meets MoE: Efficient Upcycling","version":1},"cited_work":{"arxiv_id":"2412.09952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09952","snapshot_observed_at":"2026-08-07T11:19:02.624051Z","title":"Llama 3 Meets MoE: Efficient Upcycling","venue":"cs.LG","work_id":"d1ff4c97-878c-42ba-991f-3ad851f07864","year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:01.925356Z"},"links":{"cited_paper":"/paper/2412.09952","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:ad89dd0ab883b8d44f1dc9f0ca453fe0bb4c547ab2a37330352f8a13245f6566","observation_id":"d5f06785-f366-42a5-b461-a7885a63d744","resolution":{"observed_at":"2026-08-07T11:19:02.688225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-03T02:22:36.564849Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-07T11:19:02.046781Z","title":"arXiv: 2408.15664 [cs.LG]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.046781Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:a3cfb8c45200c13fa26be77a6b9bf8b2b949b27642f21e3d627e31a880022c3a","observation_id":"5a460349-b136-4297-89aa-e38da0ad669f","resolution":{"observed_at":"2026-08-07T11:19:02.046781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-07T11:19:02.147861Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.147861Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:5755a57520bbd96269d595437f6f806b3512ed89b27ebd02eba1af845bb670f3","observation_id":"b2b7a143-d814-4e89-a644-396b9c2b1c69","resolution":{"observed_at":"2026-08-07T11:19:02.147861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T11:19:02.275720Z","title":"url: https://arxiv.org/ abs/1905.07830","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.275720Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:c673387ab8cceb5459d9fa5ce58898525902e6d38547b71127ea3d7e0c0e5565","observation_id":"d1927ad0-145f-4822-88e1-84c942b07e31","resolution":{"observed_at":"2026-08-07T11:19:02.275720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-07T11:19:02.406641Z","title":"arXiv: 2202.08906 [cs.CL]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:02.406641Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2506.02890"},"observation_digest":"sha256:e0aad867d9751010abc44a926f3cdcd21e55c49f4f282f48bdc52ad6814efcfc","observation_id":"eeecb256-2e9e-4c02-8725-7200254ac798","resolution":{"observed_at":"2026-08-07T11:19:02.406641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02890","last_updated":"2025-06-03T13:55:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:10:47.394264Z","submitted_at":"2025-06-03T13:55:48Z","title":"Scaling Fine-Grained MoE Beyond 50B Parameters: Empirical Evaluation and Practical Insights"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2506.02890."}