{"as_of":"2026-08-09T11:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39f0d0d8611dfee1fbf594f3586449fc841aa41b4f10dac5dea61ef54662479a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:27:01.462063Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:39:56.509576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-09T04:26:41.688700Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03608","last_updated":"2025-02-05T20:53:16Z","snapshot_observed_at":"2026-08-09T04:19:12.610416Z","submitted_at":"2025-02-05T20:53:16Z","title":"(GG) MoE vs. MLP on Tabular Data","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T04:26:41.688700Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2502.03608"},"observation_digest":"sha256:27c6e261df76cedf926caf4bc2839df0022f0430a523d38fa1ae2638471d2a39","observation_id":"89f4c747-4b63-4fa8-8b5c-dd63fc5ed48f","resolution":{"observed_at":"2026-08-09T04:26:41.688700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-08T14:50:58.853117Z","title":"From sparse to soft mixtures of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06635","last_updated":"2025-02-13T07:31:55Z","snapshot_observed_at":"2026-08-09T03:32:09.083141Z","submitted_at":"2025-02-10T16:31:37Z","title":"Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:50:58.853117Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2502.06635"},"observation_digest":"sha256:c819310e23ea7eabae55e2d1c3545f6d5baa3dd7df3858bfcff21cdf26cb6663","observation_id":"f65a9190-f25b-4d3a-9d2f-01f9e0ac3562","resolution":{"observed_at":"2026-08-08T14:50:58.853117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-09T04:27:01.462063Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06832","last_updated":"2025-05-27T15:29:53Z","snapshot_observed_at":"2026-08-09T04:19:51.904847Z","submitted_at":"2025-02-05T20:45:52Z","title":"Optimizing Robustness and Accuracy in Mixture of Experts: A Dual-Model Approach","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T04:27:01.462063Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2502.06832"},"observation_digest":"sha256:431993ae7802eac242a1aecadc64ce7ee8fcf1a6d76fe0b4e02ac314289f2bbc","observation_id":"e0f0bb31-750d-4e81-9fc5-3c3826d06023","resolution":{"observed_at":"2026-08-09T04:27:01.462063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2502.15315","last_updated":"2026-04-19T13:09:18Z","snapshot_observed_at":"2026-08-02T11:10:25.267742Z","submitted_at":"2025-02-21T09:10:54Z","title":"Tight Clusters Make Specialized Experts","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T02:54:12.217351Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2502.15315"},"observation_digest":"sha256:c965e6b9cecf88d88fe6b76d94ef0fcd8be41760ea6b60bf6320a1057fe3f859","observation_id":"13152973-2e14-40b2-a8ae-aed3fe2f2708","resolution":{"observed_at":"2026-05-23T02:55:19.531795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-07T14:33:35.205550Z","title":"From sparse to soft mixtures of experts.arXiv preprint arXiv:2308.00951, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18586","last_updated":"2025-05-24T08:25:50Z","snapshot_observed_at":"2026-08-07T14:27:05.876076Z","submitted_at":"2025-05-24T08:25:50Z","title":"Guiding the Experts: Semantic Priors for Efficient and Focused MoE Routing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:35.205550Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2505.18586"},"observation_digest":"sha256:28d3925e4a8fd17db88ed9d7bbbaeb1718a01bce503f68835b7c329e330a2625","observation_id":"c1a987f1-b60b-4593-831b-0e420031a924","resolution":{"observed_at":"2026-08-07T14:33:35.205550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-07T00:56:26.259692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12597","last_updated":"2025-06-14T18:34:38Z","snapshot_observed_at":"2026-08-07T00:43:00.229748Z","submitted_at":"2025-06-14T18:34:38Z","title":"Automatic Expert Discovery in LLM Upcycling via Sparse Interpolated Mixture-of-Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:56:26.259692Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2506.12597"},"observation_digest":"sha256:510b4a8387f68dbc4b4edf2e1817fb4cbe9c048e6a0f181ac071f48271afa2bb","observation_id":"e8015542-df26-4d4a-a1ad-cf5adccf0d39","resolution":{"observed_at":"2026-08-07T00:56:26.259692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-07T00:40:35.120771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13028","last_updated":"2025-06-16T01:34:25Z","snapshot_observed_at":"2026-08-07T00:35:03.147331Z","submitted_at":"2025-06-16T01:34:25Z","title":"NaSh: Guardrails for an LLM-Powered Natural Language Shell","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:35.120771Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2506.13028"},"observation_digest":"sha256:b58cc0d349cf7f20418cb308d845f87595bf5a26e997df1b81c1cc0b54ae875b","observation_id":"9b1d85a2-228a-4a2d-ab42-36fab4ff35b4","resolution":{"observed_at":"2026-08-07T00:40:35.120771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-06T20:59:17.450359Z","title":"From sparse to soft mixtures of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01337","last_updated":"2025-07-02T03:55:13Z","snapshot_observed_at":"2026-08-09T02:14:01.407646Z","submitted_at":"2025-07-02T03:55:13Z","title":"Dynamical Multimodal Fusion with Mixture-of-Experts for Localizations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:17.450359Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2507.01337"},"observation_digest":"sha256:8d39be495e0f8710017b6531ad0c41f202b9cdf089f4833b3784d754aa42bc59","observation_id":"fb3f2271-e40c-4456-a191-fc9c05a58007","resolution":{"observed_at":"2026-08-06T20:59:17.450359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-06T20:29:51.252763Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02714","last_updated":"2025-07-03T15:27:45Z","snapshot_observed_at":"2026-08-09T06:28:39.685973Z","submitted_at":"2025-07-03T15:27:45Z","title":"FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:51.252763Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2507.02714"},"observation_digest":"sha256:e8253550dcc959f693e26dbb43318ad920f596f23fe72dd76f596dc755f612a4","observation_id":"7e39d32b-2240-4c27-8163-23d429404113","resolution":{"observed_at":"2026-08-06T20:29:51.252763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-05T21:04:51.415891Z","title":"From sparse to soft mixtures of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09591","last_updated":"2025-08-13T08:16:31Z","snapshot_observed_at":"2026-08-08T09:32:17.331959Z","submitted_at":"2025-08-13T08:16:31Z","title":"HierMoE: Accelerating MoE Training with Hierarchical Token Deduplication and Expert Swap","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:04:51.415891Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2508.09591"},"observation_digest":"sha256:3cc108c3f75f530cd757969d13c54fea0d69ba1d72570c57c27ead771c4ccdb1","observation_id":"a9b30a42-7534-45c3-a6b9-c85f4cd04e63","resolution":{"observed_at":"2026-08-05T21:04:51.415891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-03T13:44:08.081983Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.23273","last_updated":"2025-12-30T12:52:51Z","snapshot_observed_at":"2026-08-06T12:05:22.819069Z","submitted_at":"2025-12-29T07:54:49Z","title":"YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T13:44:08.081983Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2512.23273"},"observation_digest":"sha256:b6c3c7875b0ad6fb50a49dfa0b0d31271f108c53fab2d0847ff00c2537411a86","observation_id":"19c0d25c-bfd3-4f25-8c3d-a220e5435a37","resolution":{"observed_at":"2026-08-03T13:44:08.081983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2603.18297","last_updated":"2026-04-03T22:50:01Z","snapshot_observed_at":"2026-07-06T22:49:37.944352Z","submitted_at":"2026-03-18T21:35:53Z","title":"Path-Constrained Mixture-of-Experts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T09:16:06.226566Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2603.18297"},"observation_digest":"sha256:3ebaf06c9432d58f09bf361b30d04078c562c9184cc9e64fc70523c6bdc7f248","observation_id":"d7926735-5601-427d-a8ee-b908ce7165a1","resolution":{"observed_at":"2026-05-15T09:19:54.289329Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2603.24245","last_updated":"2026-04-10T11:27:52Z","snapshot_observed_at":"2026-07-06T22:50:28.640006Z","submitted_at":"2026-03-25T12:33:11Z","title":"B-MoE: A Body-Part-Aware Mixture-of-Experts \"All Parts Matter\" Approach to Micro-Action Recognition","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T00:28:53.910133Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2603.24245"},"observation_digest":"sha256:0bc795438e372b0e38e6e32934a97d1ef1fd1be94b7d23fe48fc655d9b9f1737","observation_id":"f33d753c-3f83-4a11-8319-589c3d0cb773","resolution":{"observed_at":"2026-05-15T00:29:35.643808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2604.13761","last_updated":"2026-04-15T11:47:34Z","snapshot_observed_at":"2026-08-07T21:34:59.948697Z","submitted_at":"2026-04-15T11:47:34Z","title":"Design and Behavior of Sparse Mixture-of-Experts Layers in CNN-based Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:38:22.581971Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2604.13761"},"observation_digest":"sha256:0b401f1e58b3cdec33a36e26f31a24307736a11c9b26b974729fc9dcb371d1d4","observation_id":"a3f0049e-ef7b-4848-b11c-6483dbd50786","resolution":{"observed_at":"2026-05-10T13:40:26.987468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2604.24661","last_updated":"2026-05-08T02:03:01Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:24:40Z","title":"Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T02:53:39.060764Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2604.24661"},"observation_digest":"sha256:12805c1977ef282ad538c55d6cb0d45a04c78ff289f421665b843aea3a7827a4","observation_id":"ae3d0395-5e80-45cb-867b-e52643afdeaa","resolution":{"observed_at":"2026-05-11T22:21:49.347934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2604.24661","last_updated":"2026-05-08T02:03:01Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:24:40Z","title":"Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T00:48:43.992238Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2604.24661"},"observation_digest":"sha256:ff22484feff1f4f18770579aa04e54f762ff196da3cd7ffa80ce19cfe0f1f877","observation_id":"b9bc0e76-6ccb-4ee0-b25f-d30dad3295d0","resolution":{"observed_at":"2026-05-11T00:50:49.837183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.00539","last_updated":"2026-05-11T15:02:38Z","snapshot_observed_at":"2026-08-08T14:53:50.203528Z","submitted_at":"2026-05-01T09:39:03Z","title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-09T19:46:13.015064Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.00539"},"observation_digest":"sha256:b31d1207cffef5d4a57e09c2cb90820727f13d1e3a87fadd0ded24f1fb0170d2","observation_id":"ac11bf97-213c-4289-bd5f-48f8723c4984","resolution":{"observed_at":"2026-05-11T15:31:18.126388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.00539","last_updated":"2026-05-11T15:02:38Z","snapshot_observed_at":"2026-08-08T14:53:50.203528Z","submitted_at":"2026-05-01T09:39:03Z","title":"AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-12T05:17:09.793360Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.00539"},"observation_digest":"sha256:be7fa5dc839fc5f3585048c49c5943816d584249c38cad896e33b9fd5000ceb2","observation_id":"d2a6515c-cc2c-4876-9777-54f8a74f7df1","resolution":{"observed_at":"2026-05-12T05:21:30.651879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:bf8e7094f9883eceeda5c7490648a15433fbe0233b8c618d2847b08b46b3c5d2","observation_id":"88aaa5fe-7a34-437e-a879-38ce25bfe2b4","resolution":{"observed_at":"2026-05-11T07:01:11.251068Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.07260","last_updated":"2026-05-08T05:26:09Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:26:09Z","title":"When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T01:50:40.158985Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.07260"},"observation_digest":"sha256:3b850d8cbde8219067c56e81510ee5508637e9ef17ad46b21efeb3b1f9661ce4","observation_id":"890ef04f-fe37-4cec-9700-5df28c300bec","resolution":{"observed_at":"2026-05-11T01:50:51.077679Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.07287","last_updated":"2026-05-21T06:22:28Z","snapshot_observed_at":"2026-08-03T02:41:16.708897Z","submitted_at":"2026-05-08T05:51:34Z","title":"SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T01:14:57.486828Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.07287"},"observation_digest":"sha256:ebd9a8a894944a90a2c7236ee60c0c5df96b4f87e0fe8369400692bfe32a4fdf","observation_id":"d5b8f625-0d7f-45f8-b819-3d1d10cad90d","resolution":{"observed_at":"2026-05-11T04:35:57.923923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.07287","last_updated":"2026-05-21T06:22:28Z","snapshot_observed_at":"2026-08-03T02:41:16.708897Z","submitted_at":"2026-05-08T05:51:34Z","title":"SplatWeaver: Learning to Allocate Gaussian Primitives for Generalizable Novel View Synthesis","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T10:44:18.694076Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.07287"},"observation_digest":"sha256:53cf1e52ef2ce5039355cad282010f0929a9330a75c95afd53f317f118410ad3","observation_id":"0871bf51-f1ca-4f8d-a620-595a327690f2","resolution":{"observed_at":"2026-05-22T10:44:47.386893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2605.27431","last_updated":"2026-05-22T05:01:21Z","snapshot_observed_at":"2026-08-06T06:43:33.194889Z","submitted_at":"2026-05-22T05:01:21Z","title":"Tackling Multimodal Learning Challenges with Mixture-of-Expert: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T15:26:44.904121Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2605.27431"},"observation_digest":"sha256:fa3584e6270c66a781588af0e53c022d0089b0ae95b49cb5d6cfa3aabd86d99a","observation_id":"b525316b-a790-4ef5-bd84-8a84b6b54be0","resolution":{"observed_at":"2026-06-30T15:34:48.331743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2606.26287","last_updated":"2026-06-24T18:34:00Z","snapshot_observed_at":"2026-07-07T00:00:36.766142Z","submitted_at":"2026-06-24T18:34:00Z","title":"GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T01:32:40.435742Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2606.26287"},"observation_digest":"sha256:e44842a2cb90c97330930a4b336ea1265e03c3a26b4ac3c5d16ba0ee2310550b","observation_id":"6d5eab58-d593-441f-8cd8-d9fb51189395","resolution":{"observed_at":"2026-07-04T15:39:56.510834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2308.00951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-04T15:39:56.509576Z","title":"From sparse to soft mixtures of experts","venue":null,"work_id":"231d2f62-bb2f-4331-ae5d-1fd92c1a1ff3","year":2023},"citing_paper":{"arxiv_id":"2606.32040","last_updated":"2026-06-30T17:59:57Z","snapshot_observed_at":"2026-08-02T11:40:52.560861Z","submitted_at":"2026-06-30T17:59:57Z","title":"FaceMoE: Mixture of Experts for Low-Resolution Face Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T05:22:19.609558Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2606.32040"},"observation_digest":"sha256:5e0a2e7773f0556151f3684904ab4cc8a92326cbdf825a1c3eabec1b163da122","observation_id":"6fff8aa0-57d2-4e22-a3e6-b7d48ddd7051","resolution":{"observed_at":"2026-07-01T10:35:42.199447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-07-14T09:13:07.507164Z","title":"arXiv preprint arXiv:2308.00951 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10796","last_updated":"2026-07-12T15:09:03Z","snapshot_observed_at":"2026-08-07T10:02:01.144681Z","submitted_at":"2026-07-12T15:09:03Z","title":"Mixture of Cognitive Experts in Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T09:13:07.507164Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2607.10796"},"observation_digest":"sha256:c0f876d03892ee7f3d81984cf762bafca1f9f5a47d2d48c5ab911502b2bd80eb","observation_id":"251602e5-9cf8-4393-b4af-d9439acc1f38","resolution":{"observed_at":"2026-07-14T09:13:07.507164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-02T13:37:00.571260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-06T13:09:35.487490Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T13:37:00.571260Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:75df521771de73624fd53c1dd1b84ac927d77a0a9ffd129066cb6fccc309df8a","observation_id":"163732c0-7845-4fe9-8db5-0f2350bf1679","resolution":{"observed_at":"2026-08-02T13:37:00.571260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.00951/citation-record","integrity":"/paper/2308.00951/integrity","json":"/paper/2308.00951/citation-record.json","paper":"/paper/2308.00951"},"outbound":[],"paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T22:30:49.675313Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2308.00951."}