{"as_of":"2026-08-10T07:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fc0952ec8110f4ebba59dd57e692c942cfb7dc3526d71e9c844bb32a760c117","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:43:28.592940Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:17:25.673360Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-10T00:43:28.592940Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18107","last_updated":"2025-06-07T00:03:08Z","snapshot_observed_at":"2026-08-10T00:35:28.131322Z","submitted_at":"2025-01-30T03:16:44Z","title":"Scaling Inference-Efficient Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T00:43:28.592940Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2501.18107"},"observation_digest":"sha256:30caecf67e4bc8a8f7c9ca1e42393142bbc25ba6e20356416f3b66c085fa9375","observation_id":"2b1402f3-23ec-4a99-b4c5-b2d7da5810f7","resolution":{"observed_at":"2026-08-10T00:43:28.592940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-09T14:27:57.391563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.391563Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:676780bbbadd25343004cae262b59bc6835afd4758247f1318e873a13fec8b5d","observation_id":"d8853291-31a6-4438-838c-e8177ea277fc","resolution":{"observed_at":"2026-08-09T14:27:57.391563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-08T20:06:23.465646Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05172","last_updated":"2025-02-19T14:36:33Z","snapshot_observed_at":"2026-08-09T03:47:32.466460Z","submitted_at":"2025-02-07T18:55:38Z","title":"Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T20:06:23.465646Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2502.05172"},"observation_digest":"sha256:92d99d5bf56d1b8e37e6de0dce80ba8594797a5f1ba841caf82b3572a22bcd1f","observation_id":"6361a183-bd8a-407d-b52b-e72d7762cd38","resolution":{"observed_at":"2026-08-08T20:06:23.465646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-08T19:48:11.228581Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05335","last_updated":"2025-06-11T13:38:50Z","snapshot_observed_at":"2026-08-09T13:18:01.617334Z","submitted_at":"2025-02-07T21:16:43Z","title":"Towards Foundational Models for Dynamical System Reconstruction: Hierarchical Meta-Learning via Mixture of Experts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T19:48:11.228581Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2502.05335"},"observation_digest":"sha256:3cf29924f621c3905343cb0c6f17535a1aa01a78c5e81efc19066174224ce4b3","observation_id":"5936b078-f0f5-4a30-b5cf-48ee2b83b68a","resolution":{"observed_at":"2026-08-08T19:48:11.228581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-07T04:21:29.247011Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models.arXiv preprint arXiv:2501.12370, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10972","last_updated":"2025-07-16T07:09:02Z","snapshot_observed_at":"2026-08-09T19:09:19.738358Z","submitted_at":"2025-06-12T17:59:23Z","title":"Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:29.247011Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2506.10972"},"observation_digest":"sha256:01ac2d7067eae7d90fd827ed854eb14a887c295040682a89514621d512436ace","observation_id":"61bd56b4-0238-4bd8-9835-d8ebbd3b0c15","resolution":{"observed_at":"2026-08-07T04:21:29.247011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:adae8057d23fdf5bc23898b5f98ef15d9e7f326e00f8604849c17e01d8d20a71","observation_id":"67bd1f81-0502-42bc-852f-28eb8af6e605","resolution":{"observed_at":"2026-05-22T00:05:47.697749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2510.18245","last_updated":"2026-05-13T04:16:31Z","snapshot_observed_at":"2026-08-08T00:42:38.787054Z","submitted_at":"2025-10-21T03:08:48Z","title":"Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:30:11.389756Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2510.18245"},"observation_digest":"sha256:0139afd405d33050d8ca62d0af3f69d2c8b75d1ae766fd92d9ea7afa6642c7b5","observation_id":"709620e1-3cdb-448e-ae3e-15838ae8e350","resolution":{"observed_at":"2026-05-18T05:30:54.974819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-14T20:29:33.439034Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models.arXiv preprint arXiv:2501.12370,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.15389","last_updated":"2026-06-27T04:53:36Z","snapshot_observed_at":"2026-08-01T17:36:36.240938Z","submitted_at":"2026-03-16T15:04:16Z","title":"When Does Sparsity Mitigate the Curse of Depth in LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T20:29:33.439034Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2603.15389"},"observation_digest":"sha256:91fea09966a45ffae8a172bf7880fce5da316b083f1d38686f2c968a550485cb","observation_id":"f13dd8c7-eedf-4c8b-ad1b-8a75355d77f7","resolution":{"observed_at":"2026-07-14T20:29:33.439034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T03:29:16.555166Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:2b045186a109f75c5af2887f27241f43127fc3d027baf49a4d7981e2f7a3ab17","observation_id":"3caf1dfb-fc80-4345-8074-e8733f1aad62","resolution":{"observed_at":"2026-05-10T03:29:21.516826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2604.19835","last_updated":"2026-05-10T18:33:52Z","snapshot_observed_at":"2026-08-08T23:43:56.161397Z","submitted_at":"2026-04-21T05:53:33Z","title":"Expert Upcycling: Shifting the Compute-Efficient Frontier of Mixture-of-Experts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T02:03:02.654035Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2604.19835"},"observation_digest":"sha256:9be3e7a63cd6867a1b811d5f2fb27abaed1357ee129501ef178d563ec86183e6","observation_id":"ab36c26a-dc41-4aca-9625-6c996c4dc159","resolution":{"observed_at":"2026-05-12T02:06:15.405336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2606.01062","last_updated":"2026-05-31T07:08:16Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T07:08:16Z","title":"DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T17:14:53.648013Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2606.01062"},"observation_digest":"sha256:40b848229dc1daf14901ae53e03376b4d96aa34c03a02899d7135709cf404d0d","observation_id":"e4cf1cc1-725f-4acd-a839-6a14408f17bd","resolution":{"observed_at":"2026-07-01T21:16:14.400239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":"2501.12370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-07-02T22:17:25.673360Z","title":"Parameters vs flops: Scaling laws for optimal sparsity for mixture-of-experts language models","venue":null,"work_id":"8172eae6-6287-423a-b283-a628cb2796d6","year":2025},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:5649aa2ad9d36895b16f3e4fcd29c718c731e161ae2e96a5f01607740b744aea","observation_id":"b6bbcd40-c9a2-4a63-9faa-e2e8350ceee5","resolution":{"observed_at":"2026-07-02T22:17:25.674860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12370/citation-record","integrity":"/paper/2501.12370/integrity","json":"/paper/2501.12370/citation-record.json","paper":"/paper/2501.12370"},"outbound":[],"paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2501.12370."}