{"as_of":"2026-08-04T10:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83a108f0d4f53123ac1aba5d28a982424397e5b9335a52fb2b45d508b4b177e5","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T00:05:08.916339Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:14:53.648013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T21:16:14.401711Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"cited_work":{"arxiv_id":"2506.12119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12119","snapshot_observed_at":"2026-07-01T21:16:14.401711Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","venue":"cs.CL","work_id":"7985e6b0-eb50-4c2e-a577-28d3b4074e2d","year":2025},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":1},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-12T03:36:12.915133Z"},"links":{"cited_paper":"/paper/2506.12119","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:9ac612eeb579d4a4f895d8acb999314f86f267597d8f63aa89e9580727c21c5d","observation_id":"da395097-aacb-41c0-9cc2-cb5f70a3391c","resolution":{"observed_at":"2026-05-20T00:02:51.345572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"cited_work":{"arxiv_id":"2506.12119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12119","snapshot_observed_at":"2026-07-01T21:16:14.401711Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","venue":"cs.CL","work_id":"7985e6b0-eb50-4c2e-a577-28d3b4074e2d","year":2025},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":2},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-13T07:29:14.545746Z"},"links":{"cited_paper":"/paper/2506.12119","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:bd855e54b109e0535c33c04336867cb30af2511877683718829d83b2e5bfea3b","observation_id":"536b5653-6a3a-44dd-a0f1-6851b4eae42e","resolution":{"observed_at":"2026-05-20T00:02:51.345572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"cited_work":{"arxiv_id":"2506.12119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12119","snapshot_observed_at":"2026-07-01T21:16:14.401711Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","venue":"cs.CL","work_id":"7985e6b0-eb50-4c2e-a577-28d3b4074e2d","year":2025},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-21T07:57:49.746594Z"},"links":{"cited_paper":"/paper/2506.12119","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:45ce2f45e53bbf2785e502fb12f6c2400f2bde3e456bd58d63217add35fecdfa","observation_id":"b71165e9-f491-42be-b78c-983a1bbe4575","resolution":{"observed_at":"2026-05-21T07:59:50.190755Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"cited_work":{"arxiv_id":"2506.12119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12119","snapshot_observed_at":"2026-07-01T21:16:14.401711Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","venue":"cs.CL","work_id":"7985e6b0-eb50-4c2e-a577-28d3b4074e2d","year":2025},"citing_paper":{"arxiv_id":"2606.01062","last_updated":"2026-05-31T07:08:16Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T07:08:16Z","title":"DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T17:14:53.648013Z"},"links":{"cited_paper":"/paper/2506.12119","citing_paper":"/paper/2606.01062"},"observation_digest":"sha256:bbe78d2dc6863469de41c9b999f93316c92406597109f3060257256ad933ce09","observation_id":"472c2027-c057-4da0-86e1-c27b0c340337","resolution":{"observed_at":"2026-07-01T21:16:14.403107Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12119/citation-record","integrity":"/paper/2506.12119/integrity","json":"/paper/2506.12119/citation-record.json","paper":"/paper/2506.12119"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:9cb986141c25a1ad90c6dbb1130e15d6d660d7cd7143d42174a2fc41a6dbd2b6","observation_id":"67bd1f81-0502-42bc-852f-28eb8af6e605","resolution":{"observed_at":"2026-05-22T00:05:47.697749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:6b376dcbdcc9c76b892990f1a805123f58f6df9e1d427816299392e547a307c6","observation_id":"720e2220-8bbb-4aa2-a9d2-c3bb106282cd","resolution":{"observed_at":"2026-05-22T00:05:47.756643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-10T20:57:35.014119Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:e61c1aaec8fe7c0b2a9d6589dbe5f08fb3b6ba8ac3a7fdea53a5563431091ccc","observation_id":"4debeef8-78e4-41ac-836e-fbd329edadc5","resolution":{"observed_at":"2026-05-22T00:05:47.717451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-07-06T08:40:06.727297Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":"1911.11641","doi":"10.48550/arxiv.1911.11641","metadata_source":"pith","pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":"cs.CL","work_id":"0d865a62-6376-4606-8d3a-eeb3b6e9ba6d","year":2019},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:23a701576bd582117f575ed6f5b29ae5e3409f7a0b634cd3f571a0eb1efef2e0","observation_id":"0c7743e0-2f3e-4b5c-b91f-d3ec0214afeb","resolution":{"observed_at":"2026-05-22T00:05:47.668876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T03:27:46.202228Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:3b81de1fb92c3a46e1477b33572846511d7782b06cb1f72b24fd757f09f96abf","observation_id":"50a7e440-700a-4451-ad34-8fd06b023afa","resolution":{"observed_at":"2026-05-22T00:05:47.653230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d8c0aec5bed4260f37485d37e4f87d33334f048a7aa6ae3d7114dd5fa93d624c","observation_id":"63be7365-d7be-406f-9b8f-6a05d2692a2d","resolution":{"observed_at":"2026-05-22T00:05:47.628122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d8ba8270fd041bcc43a2536ce8c0b60a40ef41f8e02591d2595a5cbada5f06c7","observation_id":"3776b774-c4dd-4521-8e09-b36e6091591b","resolution":{"observed_at":"2026-05-22T00:05:47.649244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:11b31a05d53ea7afde8a1be180c1445b88b8ee018e4c6eb46629e722b15d904c","observation_id":"7fd1a61c-c263-4df7-877d-a7407350d110","resolution":{"observed_at":"2026-05-22T00:05:47.619877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2401.06066","doi":"10.48550/arxiv.2401.06066","metadata_source":"pith","pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-07-11T03:27:46.973573Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"a9888d6d-bf47-4324-9834-7cc12ac3a78c","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:7a826519221809a5316d6d47fdc707056c854d0af7354b315e44b2bc87adf4be","observation_id":"99b7a461-7143-4ffa-9188-214ec6836b99","resolution":{"observed_at":"2026-05-22T00:05:47.645109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:94a3f81099cd29f103f3de46fe9183aee27f30dee2706a40382f9706887c4d11","observation_id":"671114e8-7e57-4473-9d43-644129e0cc27","resolution":{"observed_at":"2026-05-22T00:05:47.623838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-02T00:54:17.243656Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":"2406.04127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-07-04T19:20:05.653512Z","title":"Are we done with mmlu? CoRR, abs/2406.04127","venue":null,"work_id":"ed71a0fb-b1cc-4fbc-a1d5-01a096a4e957","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:e65f71ebb943fe289ed96b96a483678bd90b0ca471fd8c0dd3b6cd831a1af729","observation_id":"80715de0-fd37-4ba8-9111-0e32dab9e258","resolution":{"observed_at":"2026-05-22T00:05:47.753599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07524","last_updated":"2025-06-16T02:29:18Z","snapshot_observed_at":"2026-07-06T19:30:52.402150Z","submitted_at":"2024-10-10T01:36:03Z","title":"Upcycling Large Language Models into Mixture of Experts","version":2},"cited_work":{"arxiv_id":"2410.07524","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07524","snapshot_observed_at":"2026-07-02T16:07:09.402995Z","title":"Upcycling large language models into mixture of experts","venue":null,"work_id":"124103a9-a340-47f6-b26b-30c13720525f","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2410.07524","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:1f80f0782d1cf0c4fb741eb1f56f5ea0b1cefe4f88cd54c6b65a57fa664f21b4","observation_id":"ca0b421a-e734-4678-a90d-d4c2e5a5216b","resolution":{"observed_at":"2026-05-22T00:05:47.640835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:fd5159e0c6a743ba8a956675c55510c2d6bcef53e3971bd3e2a75b9464593af1","observation_id":"6145d918-0fbc-413b-b2c1-d7e71676f5db","resolution":{"observed_at":"2026-05-22T00:05:47.733573Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:db9cb4c142518f6d89df8c7eb27143453295c24338d44395b81de79f1afaff6a","observation_id":"d61ca962-7b3d-4d55-bccc-4f8b42063e92","resolution":{"observed_at":"2026-05-22T00:05:47.741307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10487","last_updated":"2022-05-21T02:14:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-21T02:14:27Z","title":"Scaling Laws and Interpretability of Learning from Repeated Data","version":1},"cited_work":{"arxiv_id":"2205.10487","doi":"10.48550/arxiv.2205.10487","metadata_source":"pith","pith_arxiv_id":"2205.10487","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Laws and Interpretability of Learning from Repeated Data","venue":"cs.LG","work_id":"136dc572-d32a-4ba7-a0e7-5b0ae080633c","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2205.10487","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:b43d336fdaec9c0adb7cfecaabfde50ac36a73792aeaeb2c4e62291fa5418257","observation_id":"76bb2438-b698-4c4e-9fc4-cd96dabde688","resolution":{"observed_at":"2026-05-22T00:05:47.681018Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Case-based or rule-based: How do transformers do the math? In Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27","venue":null,"work_id":"74bbdf19-5db7-46ef-bf0e-78495d1b211b","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:6ad03d2d9951c9f7ec0ee29e84edbd746f3abf338e90a2640c13d2d1f31265a9","observation_id":"be1ee3fa-942f-46f9-91ea-080e43d7e39e","resolution":{"observed_at":"2026-05-22T00:05:47.908061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:a95884d9034a1b96cec8c408f366be7e42dcdbe4a7f12465bdfe6b13fa14e363","observation_id":"45b3ea26-9255-47c5-95f8-481f39e6f447","resolution":{"observed_at":"2026-05-22T00:05:47.772946Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-11T03:27:47.028679Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:6904240f8eaf9795499e195fbbbe3b389b98b93a13e179a7ee32f6900925b6ba","observation_id":"7e2ae28e-cb49-4ff8-be1c-6643b83d5d7d","resolution":{"observed_at":"2026-05-22T00:05:47.677472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05055","last_updated":"2023-02-17T17:54:50Z","snapshot_observed_at":"2026-07-06T14:28:52.486524Z","submitted_at":"2022-12-09T18:57:37Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","version":2},"cited_work":{"arxiv_id":"2212.05055","doi":"10.48550/arxiv.2212.05055","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.05055","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Sparse upcycling: Training mixture-of-experts from dense checkpoints","venue":null,"work_id":"9ce112e7-e6f9-4837-9a98-f630f620a73b","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2212.05055","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:1e22447088d3f89c113f550f6fece9a929785a88d6bb7f4faa4fa37340d83f4c","observation_id":"add9a803-4985-4aa2-9871-2832581282d2","resolution":{"observed_at":"2026-05-22T00:05:47.760189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RACE: Large-scale ReAding comprehension dataset from examinations","venue":null,"work_id":"00d32983-a64d-4b98-9316-f1e595862761","year":2017},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:229ae30e3f7af95f70d7a420b36892bbeaac6b838e3b6cd2348220e922d7a2ac","observation_id":"61bc8a6f-2712-46f8-98c8-3bd72cc4d071","resolution":{"observed_at":"2026-05-22T00:05:47.928836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d17-1082","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.412321Z","title":"doi: 10.18653/v1/D17-1082","venue":null,"work_id":"4e65f57b-0562-4172-b6d3-b4ea2e5e62fb","year":2017},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:673a05fec154d4105b40142e1190d681615cbb76280da632e7b8e02c9f65f855","observation_id":"0e970b19-7d99-4dbf-8651-83bec4b3f8ff","resolution":{"observed_at":"2026-05-22T00:05:47.437184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:40.495585+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:40.495585+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-07-11T01:07:44.079601Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d0da7cdeaa62f1270e34644baf4d52afdfd4b15baf9e2fca49fb5771a6aff162","observation_id":"e9326b72-715d-4dc0-9d74-320525926010","resolution":{"observed_at":"2026-05-22T00:05:47.599569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-07-06T15:43:03.878575Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":"2306.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-06-29T19:43:55.030793Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":"cs.CL","work_id":"30c9ec62-1af0-4f30-94b4-d1ef163eff71","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:5f9fb0aea132ff4a9e1ec96a76a58c3fbb92e4375dc45ac82a7c3bbb75001f77","observation_id":"a6bd0cf1-c1d0-4723-b22d-883c265bd2df","resolution":{"observed_at":"2026-05-22T00:05:47.713817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":"2503.04715","doi":"10.48550/arxiv.2503.04715","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Predictable scale: Part i–optimal hyperparameter scaling law in large language model pretraining","venue":null,"work_id":"dc2607d8-8c5c-41ec-a2af-c022c7c4d0ee","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:da8c9c290814976445ea8fbdd9be345d906585ed7ed1abd46014b12c5becc8f8","observation_id":"5d54bad5-dbfe-43d1-a3f7-0e20e17efeee","resolution":{"observed_at":"2026-05-22T00:05:47.673917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18219","last_updated":"2025-06-21T07:56:18Z","snapshot_observed_at":"2026-08-02T07:28:14.092271Z","submitted_at":"2024-06-26T10:07:57Z","title":"A Closer Look into Mixture-of-Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.18219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18219","snapshot_observed_at":"2026-07-04T06:39:37.881836Z","title":"A closer look into mixture-of-experts in large language models","venue":null,"work_id":"c9847286-170d-4bea-92f5-92e4cf056620","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2406.18219","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d8139bd5a9fda8084bfbc050c695e36a7c36cbbc37f22564fb786271ca8e3928","observation_id":"e6474934-de1e-434c-a960-ef13542efa22","resolution":{"observed_at":"2026-05-22T00:05:47.615634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05172","last_updated":"2025-02-19T14:36:33Z","snapshot_observed_at":"2026-08-03T07:07:17.872539Z","submitted_at":"2025-02-07T18:55:38Z","title":"Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient","version":2},"cited_work":{"arxiv_id":"2502.05172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05172","snapshot_observed_at":"2026-07-02T22:17:25.653529Z","title":"Niklas Muennighoff, Alexander Rush, Boaz Barak, Teven Le Scao, Nouamane Tazi, Aleksandra Piktus, Sampo Pyysalo, Thomas Wolf, and Colin A Raffel","venue":null,"work_id":"6ab619ba-2f4b-4d79-8062-c42fc5f7a2c5","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2502.05172","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:69b94119048dd07970b76ae6e778d998d4c078b2e508274080ef5cab5db0b78b","observation_id":"a4a27b31-7bb1-443b-97ea-83b53fd4c023","resolution":{"observed_at":"2026-05-22T00:05:47.763501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:450a1018cbb88a79cf8b80d56b4d45b05441a15b063edc322326dc11237ab464","observation_id":"cc3bb2fe-81f6-4359-b1a0-b63f930cd457","resolution":{"observed_at":"2026-05-22T00:05:47.766515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":"2108.12409","doi":"10.48550/arxiv.2108.12409","metadata_source":"pith","pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-07-10T20:07:33.543353Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","venue":"cs.CL","work_id":"145b1374-5258-4c00-a433-4db0f5a50749","year":2021},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:f20324116facbfaf01671ebc215c1d7e52b7681e64f78cff721867ff904dad0e","observation_id":"de338e06-1efe-4901-a4f1-aa87dc3d8dcd","resolution":{"observed_at":"2026-05-22T00:05:47.701773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:a3b1896bb7857553f32944b2e56e3fa12cbb1c36bc66899f4b733ad66448a76b","observation_id":"cf1ce965-94ca-4586-aec1-c7217c3ce010","resolution":{"observed_at":"2026-05-22T00:05:47.603099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":"2201.05596","doi":"10.48550/arxiv.2201.05596","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Keisuke Sakaguchi, Ronan Le Bras, Chandra Bhagavatula, and Yejin Choi","venue":null,"work_id":"5af8bbea-08f6-4519-8d7e-b7ce9c838e57","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:c578e828a96d9b4016c086f784f07770b6c3636dfe371768bbf3e405ceb4112d","observation_id":"f142a64e-c741-441d-9f0f-2b83526640db","resolution":{"observed_at":"2026-05-22T00:05:47.665184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:15edaa556cd7bd6a081a4d2802228ff35bd7e3b0e4982538e44128bc8f1b781b","observation_id":"3d5cff0a-837d-4269-af6d-91a197dd9186","resolution":{"observed_at":"2026-05-22T00:05:47.632020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-11T03:27:46.760869Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:0f070465834fcc1f4a9594e256a934fb8575a2a38e1346778ce795ada32391ac","observation_id":"deca0ad1-5b52-43ef-80ba-00664d4e4099","resolution":{"observed_at":"2026-05-22T00:05:47.689044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-07-11T01:07:45.051014Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:1540a135f03230868a6465b5783d017bad985705eebda8bc24d29e0051bf543a","observation_id":"a24f0248-17f3-449a-9788-d79be0193865","resolution":{"observed_at":"2026-05-22T00:05:47.636429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16049","last_updated":"2024-03-23T21:21:44Z","snapshot_observed_at":"2026-07-06T16:37:58.121261Z","submitted_at":"2023-10-24T17:59:20Z","title":"MuSR: Testing the Limits of Chain-of-thought with Multistep Soft Reasoning","version":2},"cited_work":{"arxiv_id":"2310.16049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16049","snapshot_observed_at":"2026-07-03T14:28:31.206071Z","title":"Mirac Suzgun, Nathan Scales, Nathanael Sch¨arli, Sebastian Gehrmann, Yi Tay, Hyung Won Chung, Aakanksha Chowdhery, Quoc V Le, Ed H Chi, Denny Zhou, , and Jason Wei","venue":null,"work_id":"07c6d656-acea-4b1c-a918-d3410e88d8b6","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2310.16049","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:7d88cb3a7d14515a48a57b00a8cd2ac07892631546c1d24c65024c276ae36cfa","observation_id":"57adffde-3aaf-40a4-9487-9f4b88680d13","resolution":{"observed_at":"2026-05-22T00:05:47.661338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":"2210.09261","doi":"10.48550/arxiv.2210.09261","metadata_source":"pith","pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","venue":"cs.CL","work_id":"513eb205-04ca-4722-9a43-a74e8cbe7e85","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:4f74bf181908fcaab072f8157f9ae1fdaf39782c466c7afbf86fd29e50e784a5","observation_id":"6352e637-873e-4838-8951-231343952c26","resolution":{"observed_at":"2026-05-22T00:05:47.725732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:db0cab53b4096fcb11ae54daa9865697f86419b6910ef62ef6e093b144a6af6e","observation_id":"27906ec8-7f4f-436f-851a-d54a2ef1a3e9","resolution":{"observed_at":"2026-05-22T00:05:47.596018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":"2504.20571","doi":"10.18653/v1/2024.acl-long.643","metadata_source":"pith","pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","venue":"cs.LG","work_id":"75a5258b-4143-4f2f-99f3-6d950a496305","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:5e7c4cb41c66e0c1bea2e8932bbce013140fd779c94e936513ccfb48c1cbce8d","observation_id":"f0840b4a-20cd-425a-bafe-30c7d1e93f58","resolution":{"observed_at":"2026-05-22T00:05:47.611002Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06563","last_updated":"2024-06-03T03:58:41Z","snapshot_observed_at":"2026-08-04T06:16:13.927362Z","submitted_at":"2024-06-03T03:58:41Z","title":"Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":"2406.06563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06563","snapshot_observed_at":"2026-07-04T20:00:09.047211Z","title":"Skywork-moe: A deep dive into training techniques for mixture-of-experts language models","venue":null,"work_id":"10e04da9-d662-49e0-a54b-e38c50d4a175","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2406.06563","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:bf386b70e01c5ce7bab6b874ba7d36d8ce40b076df0196a1e616aa86198dc2ef","observation_id":"acd6bcd6-c948-4822-83f3-84d3863ec5e6","resolution":{"observed_at":"2026-05-22T00:05:47.709852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-07-06T05:51:51.253539Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":"1707.06209","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-07-04T00:59:20.987277Z","title":"Crowdsourcing Multiple Choice Science Questions","venue":"cs.HC","work_id":"d186f73e-dc39-4d8f-9c07-fb134a60433d","year":2017},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d07b36085ff58b56880d163a69aae7e9fbafff9b864521caf257c5f3b9fda66c","observation_id":"f4813c2c-ab4e-474b-81cb-1325c1519b49","resolution":{"observed_at":"2026-05-22T00:05:47.737525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":"2406.19314","doi":"10.48550/arxiv.2406.19314","metadata_source":"pith","pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","venue":"cs.CL","work_id":"6b2b33bf-350e-4ee2-b8a7-f011e53384e7","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:6f192d7de0b20e0f5017361263475b145b182aaf674a70cb29e3466443eeb18a","observation_id":"1b2f0dfb-fcf9-417d-af44-3f0c70d3fa30","resolution":{"observed_at":"2026-05-22T00:05:47.657250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17976","last_updated":"2024-05-29T07:19:58Z","snapshot_observed_at":"2026-07-06T18:21:09.808086Z","submitted_at":"2024-05-28T09:05:08Z","title":"Yuan 2.0-M32: Mixture of Experts with Attention Router","version":2},"cited_work":{"arxiv_id":"2405.17976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yuan 2.0-m32: Mixture of experts with attention router","venue":null,"work_id":"b80320df-0a34-4da3-a245-e5e6a4b9c753","year":null},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2405.17976","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:c0c6e372936aef46859df79a1b5d0616aa35924707a261f6945b4fd1bbdf9d86","observation_id":"6f62da38-a2af-4123-b8eb-4d460fe861f3","resolution":{"observed_at":"2026-05-22T00:05:47.684980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05986","last_updated":"2020-11-05T14:46:45Z","snapshot_observed_at":"2026-07-06T09:11:58.924192Z","submitted_at":"2020-04-13T15:02:29Z","title":"CLUE: A Chinese Language Understanding Evaluation Benchmark","version":3},"cited_work":{"arxiv_id":"2004.05986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.05986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clue: A chinese language understanding evaluation benchmark","venue":null,"work_id":"261c4173-b7f2-48a8-a14b-731445c995be","year":2004},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2004.05986","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:22460cadf420705f2a8c0356ba108b4124e6d1dfe8b9dc5c006b54bec5825da3","observation_id":"75dbee06-450c-400e-901d-4372730c132f","resolution":{"observed_at":"2026-05-22T00:05:47.693217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13230","last_updated":"2023-10-05T14:58:02Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:02:15Z","title":"To Repeat or Not To Repeat: Insights from Scaling LLM under Token-Crisis","version":2},"cited_work":{"arxiv_id":"2305.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13230","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuzhao Xue, Zian Zheng, Yao Fu, Jinjie Ni, Zangwei Zheng, Wangchunshu Zhou, and Yang You","venue":null,"work_id":"5492294f-0416-49c6-b2c2-b9ab55668e9f","year":null},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2305.13230","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:5ad1a2ec88450ab48a081ded5e86fc474f60d9a16c6ad29db3c718659824bdd6","observation_id":"ec96d003-d047-40b7-9b72-a953203bad57","resolution":{"observed_at":"2026-05-22T00:05:47.745161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:411c5aeb38f0c7ed877002e55136b657dd33b7fe4b05e77a5a0f12a1273a1d0b","observation_id":"82656867-18ed-4b56-a48e-7d77622b7fc6","resolution":{"observed_at":"2026-05-22T00:05:47.769523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-02T10:07:31.047425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":"2305.12474","doi":"10.48550/arxiv.2305.12474","metadata_source":"pith","pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","venue":"cs.CL","work_id":"2eacfa63-8867-4a90-9bcc-52f085f33cef","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:12f088e770f02d7358d16f7215012fc27777b526da3a1f779158e3d040d4b062","observation_id":"3f5a99a0-ade0-42fc-a449-04d9131a51f9","resolution":{"observed_at":"2026-05-22T00:05:47.729661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09590","last_updated":"2025-06-08T17:00:34Z","snapshot_observed_at":"2026-07-06T18:45:39.741597Z","submitted_at":"2024-07-12T17:25:02Z","title":"Diversifying the Expert Knowledge for Task-Agnostic Pruning in Sparse Mixture-of-Experts","version":4},"cited_work":{"arxiv_id":"2407.09590","doi":"10.48550/arxiv.2407.09590","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.09590","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Diversifying the expert knowledge for task-agnostic pruning in sparse mixture-of-experts","venue":null,"work_id":"9dfd7f70-5dac-4bad-86e9-eebfd0c72581","year":null},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2407.09590","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:37ce4ec95a183495b4daac8708ac428ee48cc71e5f16c9d34700a02d3581787a","observation_id":"c9a4be39-084a-460a-924a-2c2956d9beb0","resolution":{"observed_at":"2026-05-22T00:05:47.705926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01786","last_updated":"2022-04-05T07:35:52Z","snapshot_observed_at":"2026-07-06T11:54:22.967815Z","submitted_at":"2021-10-05T02:14:38Z","title":"MoEfication: Transformer Feed-forward Layers are Mixtures of Experts","version":3},"cited_work":{"arxiv_id":"2110.01786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.01786","snapshot_observed_at":"2026-07-02T23:07:26.908775Z","title":"Moefication: Transformer feed-forward layers are mixtures of experts","venue":null,"work_id":"8bbd46fd-dadc-4762-a85f-501e5406b4de","year":2021},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2110.01786","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:8775080dca6db02091f0c0a8c4f6f2473b308d38ee0986faea06050f22cae259","observation_id":"280b87f7-95ae-40a7-a53d-0a4de84dd515","resolution":{"observed_at":"2026-05-22T00:05:47.722120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:b216d0557fb6b74ae91e3f9fa35d50db65a9feff13876306075511d70c2eec76","observation_id":"73a841bc-ceb5-48fe-aa7d-35c89d7577a5","resolution":{"observed_at":"2026-05-22T00:05:47.607647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:4fb7bb9e817c852b36b09e7bbb13e8c54adebc82ab8b61f4189fafe312940d94","observation_id":"37db8820-005c-4f5c-810f-4550f796cf64","resolution":{"observed_at":"2026-05-22T00:05:47.749121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"sparsity","venue":null,"work_id":"7d0e57e9-5b30-43ac-8d94-69e407d18a78","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d3f236daf8e3027f16bfa963d8a1b2b261e95c8b98260900e087d801cf1711d0","observation_id":"c775ce18-7b75-4ff4-a612-c65fadaeda18","resolution":{"observed_at":"2026-05-22T00:05:47.934246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Our conclusion regarding a consistent optimal activation rate contradicts the findings of Abnar et al","venue":null,"work_id":"cfe5cff9-e40c-4da5-ae5b-a9bc266fc8a5","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:ac5c88824aad67e613754aac922d182c65b2adeacba1ad5b002c4c0af47df470","observation_id":"32b79e37-c0b1-4d4d-ba05-1f47794715ca","resolution":{"observed_at":"2026-05-22T00:05:47.931706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbol Definition D Dataset size in tokens","venue":null,"work_id":"4d756fe0-0d8c-45ca-95cd-de19f0e59fdd","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:f9938ae681003171a18957fdb43739ed804983c811aea41c041d6907128476c9","observation_id":"2f771291-94bb-47d9-97bb-4d7620ac7e1e","resolution":{"observed_at":"2026-05-22T00:05:47.926158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameters shared by all experiments: L = 16, S = 2048, Dm = 1408, Dffn = 3904, H = 11, Dh = 128, ζ =","venue":null,"work_id":"38970b9a-b470-403a-ac93-6c63f58771b9","year":1920},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:1fc363b469b93117c6438d51da0934e711751f76ed18be8a1ba94d81e19b926a","observation_id":"fb94c589-bf13-4033-8955-2cefd68e4ba3","resolution":{"observed_at":"2026-05-22T00:05:47.923133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameters shared by all experiments: L = 16, S = 2048, Dm = 1408, Dffn = 3904, H = 11, Dh = 128, ζ =","venue":null,"work_id":"4ddacb71-dbd3-48b2-91e9-d3cbce400ba8","year":2048},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:200663d08832aa454666597529a93a0f5390ff3378c721bb7305dd2a91fde907","observation_id":"bd6b37dc-7c8b-4eb4-b134-6ce18c7d0397","resolution":{"observed_at":"2026-05-22T00:05:47.910862Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameters shared by all experiments: L = 24 , S = 2048 , Dm = 2048 , Dffn = 5464, H = 16, Dh = 128, ζ = 85.3","venue":null,"work_id":"0adbd8ae-c2da-42e6-a458-a6c50024483e","year":1920},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:9ae75cb13c54b7a5a8d204d7c831275afb321c5801ffabff29a02e15679d86cf","observation_id":"b8782ba1-4c80-4947-86f7-3024bd30da70","resolution":{"observed_at":"2026-05-22T00:05:47.919733Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameters shared by all experiments: L = 24, S = 2048, Dm = 1408, Dffn = 3904, H = 11, Dh =","venue":null,"work_id":"d423d6e4-4ede-4e5d-ab42-2cf2dbe3af95","year":2048},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:d0dc21a89b12422322cc63e2bc8f30c6da0023eaba3e63bc9f36c38e33fe3f50","observation_id":"1a96db6e-6dff-4194-a7e2-2f09af30d116","resolution":{"observed_at":"2026-05-22T00:05:47.916591Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperparameters shared by all experiments: L = 24, S = 2048, Dm = 2048, Dffn = 5464, H = 16, Dh =","venue":null,"work_id":"1b6b6a6e-28ca-403e-b3ce-9642ba0c3d48","year":2048},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:7e775114276d2c42489376f1ea667555571317a1e4ec053373ba9d0d85edc12b","observation_id":"0c732526-fbd7-4939-a649-1f27cdce5ff5","resolution":{"observed_at":"2026-05-22T00:05:47.913675Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"766eb4d6-cb73-4206-83cc-f65838e42868","year":2048},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:0a541f1f3f83b7909e62d767ba715d2ae905dfe062b2715c976b1ebe28bc1358","observation_id":"b96edb45-ff34-44d4-8978-591c54afd2c8","resolution":{"observed_at":"2026-05-22T00:05:47.937242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":4,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":43,"verified_fuzzy":6},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2506.12119."}