{"as_of":"2026-08-09T23:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b48736fe7a85d8e0fc9396e835d62ccb1c89f3241b867f0576b6e2722ff6fd0c","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T10:21:00.944082Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:03:02.654035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T02:06:15.344429Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":"2502.03009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03009","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for upcycling mixture-of-experts language models","venue":null,"work_id":"2398cf0e-815c-4568-85a7-f83715846c4b","year":2025},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:16.555166Z"},"links":{"cited_paper":"/paper/2502.03009","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:1dc4653149ca2087419f9cdd6e347e0ab3fcf827ef601c6bb7aee2391df64f7f","observation_id":"a66c818a-7cbf-4daf-8efb-cc02b96989f7","resolution":{"observed_at":"2026-05-10T03:29:21.480155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":"2502.03009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03009","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for upcycling mixture-of-experts language models","venue":null,"work_id":"2398cf0e-815c-4568-85a7-f83715846c4b","year":2025},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:03:02.654035Z"},"links":{"cited_paper":"/paper/2502.03009","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:6f7454db2ce33ad9d771e0025f76b4ed6e165501c9d19105134075473db4b259","observation_id":"ada55683-84c5-462b-a6ac-97427250ae1b","resolution":{"observed_at":"2026-05-12T02:06:15.346925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03009/citation-record","integrity":"/paper/2502.03009/integrity","json":"/paper/2502.03009/citation-record.json","paper":"/paper/2502.03009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.617897Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.617897Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:162aab4edbdc14bcb0f33e4b0d1059fc1230fdb8ce60429edc82d1ac78c435c7","observation_id":"85da0116-e440-45da-9b37-6451776f526e","resolution":{"observed_at":"2026-08-09T10:21:00.617897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T10:21:00.625802Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.625802Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:bb563c08c4b097ca2fa0eac2cafd6beb562c136d25b6d7a75d1251828f7d87cd","observation_id":"a65fcdad-47f3-467c-b873-bb3ceeb51c9a","resolution":{"observed_at":"2026-08-09T10:21:00.625802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.304687Z","title":"Explaining neural scaling laws","venue":null,"work_id":"bbbb31cd-319e-4332-a0ea-537b6ea812c5","year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.631698Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:070f12f185a5fd9e3a3e984c056d8fbecb64ced247291d2ac7395e35b36f5fbf","observation_id":"47c36e10-15d0-4875-8aea-3400615cb5c4","resolution":{"observed_at":"2026-08-09T10:21:02.309774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-09T10:21:00.636556Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.636556Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:d71fe084df2788b68d0be176b2fc97800642ec6e8f7f34962eec121c695f6533","observation_id":"b8a2c956-b33b-42f2-9e52-67bae9d3752b","resolution":{"observed_at":"2026-08-09T10:21:00.636556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-09T10:21:00.641993Z","title":"Deepseek llm: Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.641993Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:74cc97f1a8b44815c093e5510a1cb76100b52d6e516f4ee85f0e246a217e7bc2","observation_id":"87b7a5ac-8255-4fb7-8bb3-19f496aea454","resolution":{"observed_at":"2026-08-09T10:21:00.641993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.289531Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":"27dfa047-3d35-4044-ba42-33c6c00dd0a1","year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.647339Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:b3989b8727af14b8b485be78d293fc919241269b6d139366d7fb1ef7723540f7","observation_id":"eda704f4-73e9-4697-9b78-1a0f8a949dd2","resolution":{"observed_at":"2026-08-09T10:21:02.294206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.652424Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.652424Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:df6cb0f43ab853f2ebb50809667d0f782b2fcbaa898716180cc8d1f1687b08df","observation_id":"4729b4da-ba19-4475-ba84-e1897fd071eb","resolution":{"observed_at":"2026-08-09T10:21:00.652424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.265799Z","title":"A dynamical model of neural scaling laws","venue":null,"work_id":"7fcc2a03-a9f9-462a-96d5-7980adfd6fb4","year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.657831Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:2001bf156008894368f08ae3a760e4d9bd86dff8f32551ed1212c850f9c648cc","observation_id":"53b3d6b3-ade0-4e68-86da-341a02cd031d","resolution":{"observed_at":"2026-08-09T10:21:02.269975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-09T10:21:00.662324Z","title":"A survey on mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.662324Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:8b3c757e526ef18b9087981b1d426eec059b40769996d16fe7cd304fd74d9abc","observation_id":"33224728-8591-4d2a-8024-1a4b53e80b2a","resolution":{"observed_at":"2026-08-09T10:21:00.662324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05641","last_updated":"2016-04-23T23:14:39Z","snapshot_observed_at":"2026-07-06T04:36:52.555912Z","submitted_at":"2015-11-18T02:09:20Z","title":"Net2Net: Accelerating Learning via Knowledge Transfer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05641","snapshot_observed_at":"2026-08-09T10:21:00.667613Z","title":"Net2net: Accelerating learning via knowledge transfer","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.667613Z"},"links":{"cited_paper":"/paper/1511.05641","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:90e31764d459edef603451e17c167360f5d264545ba36fbaf031180f8d6a52fa","observation_id":"7cb399b9-10f1-4eef-a836-8f9184ab22d9","resolution":{"observed_at":"2026-08-09T10:21:00.667613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.672484Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.672484Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:6fa9da812e14b64fc4df1ade1442cb2017c12284c1952a653c81cb2b0608a25c","observation_id":"883287d9-ebfe-4c77-99bf-7a90a331fba5","resolution":{"observed_at":"2026-08-09T10:21:00.672484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.233220Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"2543ba3e-b353-45f3-b74c-a133b38e059d","year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.677087Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:5ab3f4e55909427fe8143b293d2c9a5578ca76e2bd001575dca508049375dc60","observation_id":"c4567530-195c-4bec-9dce-4af996636eca","resolution":{"observed_at":"2026-08-09T10:21:02.244755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-09T10:21:00.681881Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.681881Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:538cdf5fca86e803204ed76ffdb3aca06e155963b30177d5e55bfe765d189108","observation_id":"5fd4668b-d383-4d62-a2d4-d3c3dc6075dc","resolution":{"observed_at":"2026-08-09T10:21:00.681881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.196965Z","title":"Redpajama: an open dataset for training large language models, October 2023","venue":null,"work_id":"fc94342d-cafd-45da-adda-549b15934695","year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.686705Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:00b52abec8074b04cae2326d0a804f728b723af0fe0e7082ab237c1d5754159c","observation_id":"a1bb4647-828f-44e9-bedb-d218e06b35db","resolution":{"observed_at":"2026-08-09T10:21:02.210857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-09T10:21:00.691362Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.691362Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:92f493225ebf05782ab020c70544a7e631f906908ca4a29edb59bcfb97666a09","observation_id":"6b07a1c1-4c52-4f7a-bc3b-29f2dd701fcf","resolution":{"observed_at":"2026-08-09T10:21:00.691362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.696339Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.696339Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:0277e6d9db0d533836f139e3d6fe5037a9750231a96cb572d726436a2d7af59f","observation_id":"fda904c6-dc05-4204-95cd-fcc9d1026e5e","resolution":{"observed_at":"2026-08-09T10:21:00.696339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15319","last_updated":"2024-10-22T10:31:59Z","snapshot_observed_at":"2026-08-09T15:00:56.565785Z","submitted_at":"2024-05-24T08:00:00Z","title":"Stacking Your Transformers: A Closer Look at Model Growth for Efficient LLM Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15319","snapshot_observed_at":"2026-08-09T10:21:00.701046Z","title":"Stacking your transformers: A closer look at model growth for efficient llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.701046Z"},"links":{"cited_paper":"/paper/2405.15319","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:01db632a19e516f4bb23a6c11d95c7fe0566192af0e8e8182936be3a3ad13aea","observation_id":"2a90d32c-9fd5-4821-a316-a649dcc32ee8","resolution":{"observed_at":"2026-08-09T10:21:00.701046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4314","last_updated":"2014-03-09T20:15:03Z","snapshot_observed_at":"2026-07-06T03:30:57.897408Z","submitted_at":"2013-12-16T11:15:10Z","title":"Learning Factored Representations in a Deep Mixture of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4314","snapshot_observed_at":"2026-08-09T10:21:00.706164Z","title":"Learning factored representations in a deep mixture of experts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.706164Z"},"links":{"cited_paper":"/paper/1312.4314","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:175fd496d9a3ba0055fde0c8084b4ebdf1360ea50add115a6daaea1611aac170","observation_id":"87e5af3c-c95e-4256-a545-24f066e8d2df","resolution":{"observed_at":"2026-08-09T10:21:00.706164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.711390Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.711390Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:719191d1c50f35658c126a2404b45a5ea95459baf71f329a5bc8ec30dd6a323f","observation_id":"3f3fdee1-9260-4c4f-a023-e5dbee9e29e9","resolution":{"observed_at":"2026-08-09T10:21:00.711390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.716108Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.716108Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:67917d0d570bf5f25a93c759e3735887f7ff7efe87b789ac0ca336ca14ace197","observation_id":"13336a41-e767-4b52-8e44-3e9a29b8e27f","resolution":{"observed_at":"2026-08-09T10:21:00.716108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.159010Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":"e5892192-76cd-4489-a7ee-45f7a2f9b132","year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.720812Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:d909b1a67f19bb0ee980c8cd9d9cd7755c415e5a34067ae36e43ed9d3d871d5c","observation_id":"ffa0b637-a104-430b-b604-a831ef976192","resolution":{"observed_at":"2026-08-09T10:21:02.164114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07524","last_updated":"2025-06-16T02:29:18Z","snapshot_observed_at":"2026-08-07T07:47:25.930763Z","submitted_at":"2024-10-10T01:36:03Z","title":"Upcycling Large Language Models into Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07524","snapshot_observed_at":"2026-08-09T10:21:00.725253Z","title":"Upcycling large language models into mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.725253Z"},"links":{"cited_paper":"/paper/2410.07524","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:2606020e0c3b0746a7617bfb78242657291f7d13b949427d9f8305636b5246c9","observation_id":"08b928ef-fcaa-4d83-8a1b-653c58669297","resolution":{"observed_at":"2026-08-09T10:21:00.725253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-09T10:21:00.730107Z","title":"B., Dhariwal, P., Gray, S., et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.730107Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:570b65fa1449750d287e22a2a130a983cfee11032c289c154119c224a1c87f34","observation_id":"5b185aa1-0e58-4ccd-b21a-9a70429a31b7","resolution":{"observed_at":"2026-08-09T10:21:00.730107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-09T10:21:00.735319Z","title":"Scaling laws for transfer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.735319Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:9ceb5ecf9ba9daf991424e185be8e658c14f49720131adcb4c6b6c9d2fe380a4","observation_id":"9f7a8bd6-ae3d-4d58-b576-cd5ec6a8ec88","resolution":{"observed_at":"2026-08-09T10:21:00.735319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-09T10:21:00.740322Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.740322Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:7fb5500002542bd2e41428ab2058160be306482af5cdd8cd1b1bb863fd3301a3","observation_id":"2f638896-1c91-4e00-bec3-70e5df8927ad","resolution":{"observed_at":"2026-08-09T10:21:00.740322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.143822Z","title":"Beyond human-level accuracy: Computational challenges in deep learning","venue":null,"work_id":"7e33cf69-94fa-4dd6-a053-7fd2fd61b64d","year":2019},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.745347Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:17227fb8f1718e749e793a00853f6d7c38bbfca496a096c37601ad9511c0c825","observation_id":"f37ac61d-49b3-45bc-98d2-d691cae9f443","resolution":{"observed_at":"2026-08-09T10:21:02.148518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.128521Z","title":"A., Welbl, J., Clark, A., et al","venue":null,"work_id":"1a91e8f6-2f29-44d4-93ad-cfbca0eacd8b","year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.750248Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:f9b4039deda68f0f05df586909c43538e506949061f38fc25a315245ebedde44","observation_id":"b47847ef-140e-41cc-9a4b-96f7f70dc5bb","resolution":{"observed_at":"2026-08-09T10:21:02.133361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-09T10:21:00.754953Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.754953Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:5c0dcf139eac5d2f0a730ee41915b989207012fff07f978cb3f6c4611334082c","observation_id":"1361b2c7-5d92-4014-8058-8aa869935150","resolution":{"observed_at":"2026-08-09T10:21:00.754953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04074","last_updated":"2021-02-08T09:25:31Z","snapshot_observed_at":"2026-08-09T18:26:21.057081Z","submitted_at":"2021-02-08T09:25:31Z","title":"Learning Curve Theory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04074","snapshot_observed_at":"2026-08-09T10:21:00.760063Z","title":"Learning curve theory","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.760063Z"},"links":{"cited_paper":"/paper/2102.04074","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:38f1f0551400d2908dc5f94b6fffe329828bc64ac502b38ee124f06c7b35528f","observation_id":"54430451-229d-4bbf-bab9-6a08dda57ccc","resolution":{"observed_at":"2026-08-09T10:21:00.760063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T10:21:00.764838Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.764838Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:ac3492f8c91e750b7ee6e40dbd6bd2c1ed5cc5bb8c8323d5818ead3c18e845ab","observation_id":"1fda8a08-bd22-4934-b618-5ba91f6f76ec","resolution":{"observed_at":"2026-08-09T10:21:00.764838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-09T10:21:00.769659Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.769659Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:d09a61113a391c62dfa119ad13c47303b3a421367fb3448b67b6bc60966ab3ca","observation_id":"50eb29d8-3277-47fd-94f3-a8aa9674764f","resolution":{"observed_at":"2026-08-09T10:21:00.769659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.112460Z","title":"M., Hughes, S., Wolf, T., Bahdanau, D., et al","venue":null,"work_id":"a26be48c-ae51-4253-8647-82d5c7ff4b3e","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.774674Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:a847f8d1fcd57435665345b9ea495c688a25980eec52b5e949c8e86e129369c9","observation_id":"50699452-3054-4c60-b654-854daaaab24d","resolution":{"observed_at":"2026-08-09T10:21:02.117618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.092848Z","title":"R., Mustafa, B., Ainslie, J., Tay, Y., Dehghani, M., and Houlsby, N","venue":null,"work_id":"f1b5628c-add3-40ac-8d35-299a2862d4a9","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.779697Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:fa79d7db127af7bca48582f15a57c47ac3658a9cbc9076639bd2ed7a51d670c5","observation_id":"d5fcd860-a71a-42d2-9b18-4446f8d085c5","resolution":{"observed_at":"2026-08-09T10:21:02.101081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.784808Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.784808Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:fe98f63e0f8d2236421ad0cace733c590de3e80370265c8ce8b3d05c02009b52","observation_id":"a6d2e450-2f8a-41b6-90cb-3a8fd444da18","resolution":{"observed_at":"2026-08-09T10:21:00.784808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-09T10:21:00.789646Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.789646Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:5391cc17d548bacaf37d4b040256322be09de8002d8f9f634d515738b93e1287","observation_id":"d2574811-c62c-4e89-af7d-ca2f6aad0326","resolution":{"observed_at":"2026-08-09T10:21:00.789646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.795115Z","title":"S., Biderman, S., Elsahar, H., Muennighoff, N., Phang, J., Press, O., Raffel, C., Sanh, V., Shen, S., Sutawika, L., Tae, J., Yong, Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.795115Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:4f89636f91cbe1bdd8ff30aa8951378836133325fcac3f6713f21a8b19cb4f6b","observation_id":"3c7a0ded-65cc-4836-b541-50bc857eacb2","resolution":{"observed_at":"2026-08-09T10:21:00.795115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.055752Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"92e18019-8057-4371-af96-0ecd409e4319","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.800048Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:78713905b4d15f90a69395f1257c9d97e60163ee3b721bc80dcd5b78c64de3d1","observation_id":"4e2caa37-9260-42eb-9d83-df591fd26608","resolution":{"observed_at":"2026-08-09T10:21:02.067364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.031753Z","title":"M., Bartlett, P., and Lee, J","venue":null,"work_id":"ff153e5c-5c5f-4726-9c2c-b6dbcaf5d2ae","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.805002Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:83cc31e7c850ecd14e696a2f235e708a9bcfefd7446171cf579361a15ee2b60a","observation_id":"5de7d31e-7e08-4b32-a44d-8a24eff3d3a2","resolution":{"observed_at":"2026-08-09T10:21:02.036098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.016320Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":"d5dbcdd0-cc0d-47e3-9a7a-454c7b9d2504","year":2021},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.809795Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:b10fba5c00afb4f4e91c1a216d4077834a3509fdbb420919e9b4f1124ce3ca74","observation_id":"b58d31b1-339a-4bd6-b826-84c72b41dbea","resolution":{"observed_at":"2026-08-09T10:21:02.021522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12136","last_updated":"2024-09-18T17:00:20Z","snapshot_observed_at":"2026-08-07T11:17:05.501623Z","submitted_at":"2024-09-18T17:00:20Z","title":"GRIN: GRadient-INformed MoE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12136","snapshot_observed_at":"2026-08-09T10:21:00.814433Z","title":"J., Wang, S., Liang, C., Shen, Y., Cheng, H., Liu, X., Tanaka, M., Wu, X., Hu, W., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.814433Z"},"links":{"cited_paper":"/paper/2409.12136","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:fde50a31c55c64ab1d84707fd513bfdd1032be1b529f4ba0011f87084be09e7c","observation_id":"4ee4bebb-f43a-44a5-8107-e7a2c1a05720","resolution":{"observed_at":"2026-08-09T10:21:00.814433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18219","last_updated":"2025-06-21T07:56:18Z","snapshot_observed_at":"2026-08-02T07:28:14.092271Z","submitted_at":"2024-06-26T10:07:57Z","title":"A Closer Look into Mixture-of-Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18219","snapshot_observed_at":"2026-08-09T10:21:00.819871Z","title":"M., Huang, Z., Qiu, Z., Wang, Z., and Fu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.819871Z"},"links":{"cited_paper":"/paper/2406.18219","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:fcd026c4b16c45f047f76a52ace956533b2b3e1686d9ec7e5251c3de34cd7dae","observation_id":"86a159af-e51a-4f7d-8607-56031be5fcbe","resolution":{"observed_at":"2026-08-09T10:21:00.819871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-09T10:21:00.824954Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.824954Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:34aeb186485fad87b3669722c3f35f823c7428f0056a79d8b719f0027035e652","observation_id":"1cdda9a7-164e-42c4-9021-44270f66114f","resolution":{"observed_at":"2026-08-09T10:21:00.824954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16859","last_updated":"2022-10-30T15:13:18Z","snapshot_observed_at":"2026-07-06T14:12:14.561840Z","submitted_at":"2022-10-30T15:13:18Z","title":"A Solvable Model of Neural Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16859","snapshot_observed_at":"2026-08-09T10:21:00.829988Z","title":"A., and Sully, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.829988Z"},"links":{"cited_paper":"/paper/2210.16859","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:d9981c6a0c71ef2eccbdccdf15e5bc06bc4825d1bb734f6ab69a9644b1e12387","observation_id":"2dc43d41-29b2-4d25-8cd5-f5c519b3891f","resolution":{"observed_at":"2026-08-09T10:21:00.829988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:02.000471Z","title":"A scaling law for syn2real transfer: How much is your pre-training effective? pp.\\ 477--492","venue":null,"work_id":"e9b9bbfb-6925-4781-a629-2e021c798313","year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.834868Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:e7cbb379c468d429a3ce8c48b0993f4ff95a5a3d2bf522f5ee9026e600a01d0c","observation_id":"f01c82c9-9c9c-43e3-b1b8-2988dfc586ad","resolution":{"observed_at":"2026-08-09T10:21:02.005441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.839985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.839985Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:2abe6cd8bdc5bac1ba1f54fb2fc2b72372afca646aa50235420ed2afd94ab2d2","observation_id":"8be729b1-2ceb-4a77-8185-3372d3f8c5b0","resolution":{"observed_at":"2026-08-09T10:21:00.839985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-09T10:21:00.844581Z","title":"Olmoe: Open mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.844581Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:d6157468632b317bf062ead3205be46d4497fb9cb0d4fd23934915c3f135b9b6","observation_id":"680872fe-0a7c-4365-9f05-cf91e01f32a7","resolution":{"observed_at":"2026-08-09T10:21:00.844581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.976135Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"a9955e05-deef-45ba-a3b6-d36654031862","year":2016},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.849362Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:3d12445ba18df75c1720d18f33fe31529471f8c3d84eb43d71d704d33903966d","observation_id":"a2d039d1-370e-4106-b220-37765d9b164e","resolution":{"observed_at":"2026-08-09T10:21:01.981117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.959155Z","title":"4+ 3 phases of compute-optimal neural scaling laws","venue":null,"work_id":"66f0d7f3-db7a-4b91-b892-3962616a11f4","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.853726Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:7b741a1115fd336b61605526cc36b8f908f1449e450544a6731dd5cd75781be3","observation_id":"280992d9-4f18-4209-ab8e-d10ca4f736dd","resolution":{"observed_at":"2026-08-09T10:21:01.964523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.935564Z","title":"Resolving discrepancies in compute-optimal scaling of language models","venue":null,"work_id":"1881acb0-414c-45f6-91eb-424e9559e87b","year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.858849Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:2bc57e3f683fe5f4e63d88ba3b0b115a52a8414a4498d9f93668eb3f2650531f","observation_id":"40cfef44-92d1-423f-9e14-20219f79c683","resolution":{"observed_at":"2026-08-09T10:21:01.947453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.902775Z","title":"S., Rosenfeld, A., Belinkov, Y., and Shavit, N","venue":null,"work_id":"318b086f-6ab0-4539-b9ad-d512ef5e89dc","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.863756Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:4fe4b9f251cd7f83a7fffda67ff40fa19ee18f74ee3a6dc1b644406d54f20eb3","observation_id":"f3b76803-d364-4546-93a5-74a6e24070d9","resolution":{"observed_at":"2026-08-09T10:21:01.917112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.868372Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.868372Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:c167bad01c945acf8fd8c4a7b5d5a996f53e6776907883b06d36315f6b0e8bef","observation_id":"99732fc2-1166-484f-b7f2-71649a3a555a","resolution":{"observed_at":"2026-08-09T10:21:00.868372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-09T10:21:00.872817Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.872817Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:2043d81ac3d67aceac780351cc30f852188072c69a5af12b142f7e061f1cd9ab","observation_id":"bc71ab9e-b12e-429d-b91e-87c3b666b0f6","resolution":{"observed_at":"2026-08-09T10:21:00.872817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.862756Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"16ebfeee-c2ce-40fa-940f-3d562788b777","year":2017},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.877615Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:67c86b6c356a8f9509c8b41d897d99bd539ff2f5b2cba0cbaaf1318d92517de7","observation_id":"6816f0a3-8d18-4162-ae58-85bcfa0696ab","resolution":{"observed_at":"2026-08-09T10:21:01.874187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-07T23:26:20.937888Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-09T10:21:00.882166Z","title":"Slimpajama-dc: Understanding data combinations for llm training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.882166Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:a8e3a15166baa7cbe55395fe7de9f4a6c34ad965f37b58603ce1454509ace789","observation_id":"d20a0011-25d6-411d-a42c-e1aed4ad5f61","resolution":{"observed_at":"2026-08-09T10:21:00.882166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-09T10:21:00.886921Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.886921Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:a079415ef8a221fa6cf91f190cf67f42277ffaddea71ceaa2a0970d9b0b3eb9a","observation_id":"3faeec56-b100-4767-b61e-50d2fa3cf0ca","resolution":{"observed_at":"2026-08-09T10:21:00.886921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.892147Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.892147Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:14ce3579f8e60b861112c5c594cc3c1f1db50c385f9f6114ac8818256ea4fb39","observation_id":"dc091f55-5163-4f97-9248-7fb4d3c0fcf2","resolution":{"observed_at":"2026-08-09T10:21:00.892147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.896782Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.896782Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:450c537d99b4f06a648305f949ebd30ea3f400d0ed7565f6efbeca50a5ddcbf6","observation_id":"2acef10c-e539-4861-81a4-9229639810bc","resolution":{"observed_at":"2026-08-09T10:21:00.896782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-04T12:39:25.666793Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-08-09T10:21:00.901515Z","title":"Hunyuan-large: An open-source moe model with 52 billion activated parameters by tencent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.901515Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:73e0ee00bcc1d746735ad83df335b09e7721d0d193a39ac2f9ecce5737ae5b6a","observation_id":"40b78dfb-ca84-4a26-a305-2859f1f528e0","resolution":{"observed_at":"2026-08-09T10:21:00.901515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T10:21:00.906340Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.906340Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:174b9d10edcab3ae5f8f5aa59004c6e1560fae9af7c12b20188b6ad58342c020","observation_id":"129ddd88-8d01-4c95-a87b-4cf01335da08","resolution":{"observed_at":"2026-08-09T10:21:00.906340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:00.911209Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.911209Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:8da9a1a3f6d170c8476e5d2e5a9906e78ea8d42848341a2320c8adc629488304","observation_id":"f98b996f-06a2-4953-8bfc-228e16830031","resolution":{"observed_at":"2026-08-09T10:21:00.911209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06563","last_updated":"2024-06-03T03:58:41Z","snapshot_observed_at":"2026-08-04T06:16:13.927362Z","submitted_at":"2024-06-03T03:58:41Z","title":"Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06563","snapshot_observed_at":"2026-08-09T10:21:00.915837Z","title":"Skywork-moe: A deep dive into training techniques for mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.915837Z"},"links":{"cited_paper":"/paper/2406.06563","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:bae2dc7f282b27008788a9211f4867d8cfc8e473be07d45f9e0d61aaf0eba84c","observation_id":"786be296-2a3e-4063-892b-bc080c2e5855","resolution":{"observed_at":"2026-08-09T10:21:00.915837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.816093Z","title":"F., and Gardner, M","venue":null,"work_id":"e4638258-4870-47eb-8b02-40c9441f3ed6","year":2017},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.920741Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:4b8340261b1c3d76c5fb75c759125635a40b4b0bd3275154678528b07ed115a2","observation_id":"c1d2843b-91d9-40cd-ba17-3cc691608f57","resolution":{"observed_at":"2026-08-09T10:21:01.821093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T10:21:00.925327Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.925327Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:9f3c20102f905ef3b4d2e18839a41737cf7026e812e77d7757712dfd7374f42d","observation_id":"73235337-3961-4fff-b80c-60d1b45d0480","resolution":{"observed_at":"2026-08-09T10:21:00.925327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-09T10:21:00.930068Z","title":"Glm-130b: An open bilingual pre-trained model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.930068Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:a27a748128cce679bcf5de31ca5f1d2de08d998bd23238b9f0d48c38d8cba878","observation_id":"7085dff3-2b7b-4c6e-a993-ab51154e4655","resolution":{"observed_at":"2026-08-09T10:21:00.930068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.797241Z","title":"Scaling vision transformers","venue":null,"work_id":"fb4cc802-e2be-4e75-93c6-2f00a003cb9c","year":2022},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.934916Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:0fccc236b1e033021b5f2cd572c4332d3782bd1c1880165f0c8ec2a10120100a","observation_id":"4e3656cd-e3ed-4ab5-ad68-2a6bf38c3847","resolution":{"observed_at":"2026-08-09T10:21:01.804747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T10:21:01.776372Z","title":"When scaling meets llm finetuning: The effect of data, model and finetuning method","venue":null,"work_id":"aba9985c-cf02-4620-baa4-aabf75bd3b70","year":null},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.939456Z"},"links":{"citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:ab205c7ba332100a68634e7c899e8097d8e3da61e576117776bae25739edf6c2","observation_id":"ef2ec21b-60e4-446b-ad46-4afe06ae3ff9","resolution":{"observed_at":"2026-08-09T10:21:01.785357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-09T10:21:00.944082Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T10:21:00.944082Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2502.03009"},"observation_digest":"sha256:c1f0fdb99c424c8e361a349ce8b86ad64c4a7872ed9c76eed75ddf2167c1b605","observation_id":"1c69fbcc-5255-4efe-b4de-12c7ad6ebc77","resolution":{"observed_at":"2026-08-09T10:21:00.944082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03009","last_updated":"2025-06-16T05:27:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:19:35.717054Z","submitted_at":"2025-02-05T09:11:13Z","title":"Scaling Laws for Upcycling Mixture-of-Experts Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2502.03009."}