{"as_of":"2026-08-09T08:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d94ed79ecf279c54f1335feb5e37e235e61ecd9a072b750a62a157bfaba90e58","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:48:11.364496Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:37:56.692349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-08T19:48:11.364496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05335","last_updated":"2025-06-11T13:38:50Z","snapshot_observed_at":"2026-08-08T19:40:49.188350Z","submitted_at":"2025-02-07T21:16:43Z","title":"Towards Foundational Models for Dynamical System Reconstruction: Hierarchical Meta-Learning via Mixture of Experts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T19:48:11.364496Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2502.05335"},"observation_digest":"sha256:8e41e5439dfb69a8e2c4fb6d2041a99a8ce69c8a13349efc69ddbdb1cc968abc","observation_id":"121e1a94-c352-40bd-aace-8d04fe613942","resolution":{"observed_at":"2026-08-08T19:48:11.364496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-07T15:39:32.373581Z","title":"Mixture of a million experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-07T15:34:08.821122Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:32.373581Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:c75194e41cd45c5cae6e978890aaf84f825c8de0b8ed962a727d5f6b6302a154","observation_id":"c6287b0f-f201-490d-b5b4-5e8dc12f5861","resolution":{"observed_at":"2026-08-07T15:39:32.373581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-07T11:17:09.108597Z","title":"https://arxiv.org/abs/2407.04153","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02965","last_updated":"2025-06-04T05:38:31Z","snapshot_observed_at":"2026-08-09T03:33:32.001000Z","submitted_at":"2025-06-03T15:00:18Z","title":"PC-MoE: Memory-Efficient and Privacy-Preserving Collaborative Training for Mixture-of-Experts LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:09.108597Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2506.02965"},"observation_digest":"sha256:b4a5cbce1c06e2c674b68f929dadb3506fcdc5130211bacc4e91b2641587ad6a","observation_id":"bb39ab09-f000-46e2-98cf-a409e0b67f47","resolution":{"observed_at":"2026-08-07T11:17:09.108597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-05T16:17:41.950238Z","title":"Mixture of a million experts.arXiv preprint arXiv:2407.04153, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-09T07:25:17.981291Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.950238Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:92f084d56849cd0c6f430350474d436910cc58d42be967e235c9f84195282c87","observation_id":"7b5d0f0f-6f70-4f1f-9b93-74b345fadb35","resolution":{"observed_at":"2026-08-05T16:17:41.950238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-04T19:37:27.224525Z","title":"Mixture of a million experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09175","last_updated":"2025-09-11T06:18:29Z","snapshot_observed_at":"2026-08-06T15:48:58.256012Z","submitted_at":"2025-09-11T06:18:29Z","title":"MoLEx: Mixture of LoRA Experts in Speech Self-Supervised Models for Audio Deepfake Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:27.224525Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2509.09175"},"observation_digest":"sha256:96ccf24421ae753841bf933df19fa9277aeb39dc89bd95b09c0b4be83ee9ad3e","observation_id":"b4016bff-8614-4827-8e25-b67cda9bb738","resolution":{"observed_at":"2026-08-04T19:37:27.224525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-03T04:13:59.832245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05711","last_updated":"2026-07-01T04:46:34Z","snapshot_observed_at":"2026-08-03T04:13:56.754896Z","submitted_at":"2026-02-05T14:37:32Z","title":"OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T04:13:59.832245Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2602.05711"},"observation_digest":"sha256:38318835ca5da91033beebf93fbe5b57c17c17eecfe42222498407e05966b117","observation_id":"5ade3434-a3de-479a-b864-57022517dc0a","resolution":{"observed_at":"2026-08-03T04:13:59.832245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2604.14419","last_updated":"2026-04-15T21:02:02Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T21:02:02Z","title":"Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:19.016420Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2604.14419"},"observation_digest":"sha256:1b6cc2ed88d847d35872208fccb56bc52ca798e37dd234db51368582ebaf388d","observation_id":"3e49ea68-8357-465c-919d-25b64cad0efb","resolution":{"observed_at":"2026-05-10T13:05:25.086899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2604.20156","last_updated":"2026-04-22T03:50:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T03:50:52Z","title":"Temporally Extended Mixture-of-Experts Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:39:39.492135Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2604.20156"},"observation_digest":"sha256:5f5c07df3bc5fab36db209713eeb74749b6287bf9e351ce98318d7abe7f4034d","observation_id":"cd592267-68a2-4dd4-b2c6-2abb046a696e","resolution":{"observed_at":"2026-05-10T00:39:48.228957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.04952","last_updated":"2026-05-06T14:15:10Z","snapshot_observed_at":"2026-07-06T23:17:38.226365Z","submitted_at":"2026-05-06T14:15:10Z","title":"Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T17:58:10.323354Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.04952"},"observation_digest":"sha256:4119d85bdd06f874f59c819fcfd4ee00b908b9e8362c6d48c2c31b3016a5df1d","observation_id":"bafeb384-a0fa-431c-a211-8a5063e2c5eb","resolution":{"observed_at":"2026-05-09T06:55:43.470352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.06216","last_updated":"2026-05-07T13:16:18Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:16:18Z","title":"TIDE: Every Layer Knows the Token Beneath the Context","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-08T10:35:46.447739Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.06216"},"observation_digest":"sha256:f0c929cd4e3473e77ad4afc230e124ef5fa0e4aee5ab9ce1d16f74bec4873e0f","observation_id":"5799d1e2-3407-4da7-88f6-1367878d7f2b","resolution":{"observed_at":"2026-05-11T19:56:09.981433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.06665","last_updated":"2026-05-07T17:59:44Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:59:44Z","title":"UniPool: A Globally Shared Expert Pool for Mixture-of-Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T11:56:21.623709Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.06665"},"observation_digest":"sha256:b9dad79105142c0050175a143f3f3f3d3a5e65c953cf9ca828fa6c555ef4f9e2","observation_id":"b1d229bd-51c7-4249-a4e2-19d2f716b43b","resolution":{"observed_at":"2026-05-11T19:26:09.384847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-12T03:36:12.915133Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:c160d6cfcf850f801b4a8f8e5c21b503b8fe777654bca71b4c67f2876c7f3e6d","observation_id":"cdbc6248-daf8-4605-8b37-3e2d1be6b662","resolution":{"observed_at":"2026-05-12T03:36:19.888923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":2},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-13T07:29:14.545746Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:599bcf96f63161f8a9b7f9018f99f791b09898f7cb07e5cbeb29b957ffe09cec","observation_id":"b5eeb441-4021-44de-b6bb-e1ca58a5eec5","resolution":{"observed_at":"2026-05-13T07:32:30.357681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.10933","last_updated":"2026-05-20T17:26:14Z","snapshot_observed_at":"2026-08-03T07:36:40.918472Z","submitted_at":"2026-05-11T17:58:28Z","title":"DECO: Sparse Mixture-of-Experts with Dense-Comparable Performance on End-Side Devices","version":3},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-21T07:57:49.746594Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.10933"},"observation_digest":"sha256:25cc925b3c38f1a98c9d3eef0ad686a4fad9e5c1baf0d444210c589f8943a721","observation_id":"b9b62680-b302-4991-847a-1b18ee10a28b","resolution":{"observed_at":"2026-05-21T07:59:50.211883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.11537","last_updated":"2026-05-12T05:03:53Z","snapshot_observed_at":"2026-07-06T23:23:21.034839Z","submitted_at":"2026-05-12T05:03:53Z","title":"Fast MoE Inference via Predictive Prefetching and Expert Replication","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T02:25:59.268868Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.11537"},"observation_digest":"sha256:c6033646c5f2733e43475bbdf1331be278d4c7f3c00b657d688195f1a8550584","observation_id":"41ea0c41-45ba-45aa-9119-406cba099cb3","resolution":{"observed_at":"2026-05-13T02:27:06.988620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:0f327a576f5befb0fabf524612e0118c3808958422bdb45443ba904c519d7488","observation_id":"3dd333e6-64a6-4f97-b62c-9839998c6e5a","resolution":{"observed_at":"2026-05-15T04:49:44.989030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2606.01062","last_updated":"2026-05-31T07:08:16Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T07:08:16Z","title":"DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T17:14:53.648013Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2606.01062"},"observation_digest":"sha256:a79914cd2f2972ed34e488d0a88513b7b028ffe8503fbefa928184f2e0527d14","observation_id":"809f2788-440c-42b3-9ce8-abde9189cb07","resolution":{"observed_at":"2026-07-01T21:16:14.388131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2606.07414","last_updated":"2026-06-05T16:06:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T16:06:47Z","title":"Sparsely gated tiny linear experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T22:49:49.299925Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2606.07414"},"observation_digest":"sha256:1578719bac1c3d4dedd03b32277fd792c5739fd977f256a2cd0191ddacb6a516","observation_id":"4489dfe9-ad7a-419a-9437-017a59a40d71","resolution":{"observed_at":"2026-07-02T16:17:09.302550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2606.12113","last_updated":"2026-06-10T14:07:18Z","snapshot_observed_at":"2026-07-06T23:51:02.805629Z","submitted_at":"2026-06-10T14:07:18Z","title":"Augmenting Molecular Language Models with Local $n$-gram Memory","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T09:57:12.398344Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2606.12113"},"observation_digest":"sha256:9657a7aca91d9574ffdbe637f51db6e00a66f74b6985e48d10ea0bd75f7123f6","observation_id":"ac2a1825-b19d-4496-8fd2-153890b1b080","resolution":{"observed_at":"2026-07-03T10:37:56.693740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":"2407.04153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-03T10:37:56.692349Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":"edf386eb-cf36-47f2-b15f-fad92344ed8a","year":2024},"citing_paper":{"arxiv_id":"2606.28533","last_updated":"2026-07-10T20:43:15Z","snapshot_observed_at":"2026-08-03T07:50:44.628154Z","submitted_at":"2026-06-26T18:32:43Z","title":"CMSL: Constructive Multi-Sequence Learning for Recommendation Systems","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-30T00:51:49.085017Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2606.28533"},"observation_digest":"sha256:abaefa29c04e75bf77fd87784f3f48525b5d30e5a37cd125d5bb05670d227955","observation_id":"6970dd79-d760-4dd0-8be9-d49f2d2aad34","resolution":{"observed_at":"2026-07-01T16:05:49.806130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-13T05:35:58.568346Z","title":"arXiv preprint arXiv:2407.04153 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08946","last_updated":"2026-07-09T21:15:40Z","snapshot_observed_at":"2026-08-07T14:21:37.931530Z","submitted_at":"2026-07-09T21:15:40Z","title":"Training, Reading, and Editing Legible Transformers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-13T05:35:58.568346Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2607.08946"},"observation_digest":"sha256:ef0d293e4d86ed89cf49f14f7da0e01681956c560a176ce4caa74a57e86d1062","observation_id":"888c7626-4b91-4bbd-85f8-6d701390a12a","resolution":{"observed_at":"2026-07-13T05:35:58.568346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-02T09:48:58.072705Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16254","last_updated":"2026-06-27T10:21:07Z","snapshot_observed_at":"2026-08-06T23:35:37.559836Z","submitted_at":"2026-06-27T10:21:07Z","title":"More Than Memory: Task-Conditioned Signed FFN Writes in Long-Context Retrieval","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T09:48:58.072705Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2607.16254"},"observation_digest":"sha256:0b3afaad9eeaeaf32d06f92bad8045fedf0a1782dcc8bd11f2c48f292ccefae4","observation_id":"0e7c3cc1-065d-4c66-a6cd-3b2116b3d7e7","resolution":{"observed_at":"2026-08-02T09:48:58.072705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-07-31T16:02:10.656508Z","title":"Mixture of a million experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24396","last_updated":"2026-07-27T13:13:02Z","snapshot_observed_at":"2026-08-09T04:23:10.785984Z","submitted_at":"2026-07-27T13:13:02Z","title":"The SpiNNaker2 chip: a many-core platform for flexible and scalable brain-inspired computing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T16:02:10.656508Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2607.24396"},"observation_digest":"sha256:f23547ba027a5f63bc225bf80161e65f3959cf0d4fa46058e883e33fc2077517","observation_id":"876f88c5-56eb-4a9f-bd84-ba0df0479b50","resolution":{"observed_at":"2026-07-31T16:02:10.656508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.04153/citation-record","integrity":"/paper/2407.04153/integrity","json":"/paper/2407.04153/citation-record.json","paper":"/paper/2407.04153"},"outbound":[],"paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T03:49:14.814294Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2407.04153."}