{"as_of":"2026-08-07T08:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5f18e00e0b9b99084b617976ff78c71070951b77736a06230b1cefbec3ae25d","coverage":[{"denominator":175,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T23:14:25.431471Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":106,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:14:11.885288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:27:46.863255Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-05-10T23:45:06.755839Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2204.02311"},"observation_digest":"sha256:f0754835f916dc775ccf2c547f2d8dc5a84bc41947dc8dcdd64c8e8714cf91e3","observation_id":"67a7c374-9df5-4ea4-adcf-d5aa90925842","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-11T07:38:37.734402Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2206.07682"},"observation_digest":"sha256:51ee9dde8167032b6ceac39832271486cc4c8f9eb99608c14c0ddb88ecffc985","observation_id":"3c6053bd-e93e-4160-bd65-be85372de604","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-05-12T11:59:25.813128Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2305.10403"},"observation_digest":"sha256:bd25a58dd81c8aadb35d02765d09b1d4c2c25c13012c154d5525b854854ce090","observation_id":"81ad87bb-beef-4ee8-9f4e-9ec76652caeb","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:bce7664be301ef9993abc71ffbdb801a7b5d44a0b9c71e00071274c800ee2b94","observation_id":"0a169d98-7503-48eb-ae7f-1796eae99012","resolution":{"observed_at":"2026-05-18T01:35:21.538426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:ab3751928e2d1ccd14b9211799db436e48902f6874f0bd39f58d292aeee7eaa2","observation_id":"5a86c06f-f37d-4b3c-a651-d68f4718f167","resolution":{"observed_at":"2026-05-16T02:33:30.239552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T14:11:27.156350Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2403.19887"},"observation_digest":"sha256:a74d95966586b8d4e2613759e2eac1ef542064f251cb7d1a9fec97907c649f67","observation_id":"2ba4f66c-8e43-4318-a115-d74850562e0a","resolution":{"observed_at":"2026-05-13T14:11:27.226046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:843131341aa12393ff9f68e91877c18ddc08ea4572c7b8dd6b5f92b6962e2048","observation_id":"46e05863-54f8-4001-a82f-79e2c3d03610","resolution":{"observed_at":"2026-05-15T02:39:33.253199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:6a0362fe94758b790b6b5487329e8b94b52f6457a561c63c1aa8da165b6f4146","observation_id":"d9c6a86d-8593-45dd-b90e-4b29d085d8c4","resolution":{"observed_at":"2026-05-23T06:25:27.899582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:cba6a8542295cfd989f84ad8ade59c16d4fada6bc842a9ff34b591c8dee8fea3","observation_id":"84a53930-ff56-42f4-82a0-c4d607a2c969","resolution":{"observed_at":"2026-05-16T06:15:46.203629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2502.18965","last_updated":"2025-02-26T09:25:10Z","snapshot_observed_at":"2026-07-06T20:42:55.911327Z","submitted_at":"2025-02-26T09:25:10Z","title":"OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T18:30:35.796271Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.18965"},"observation_digest":"sha256:b1257cd4a35fa9fae7acf6189fded4718c1797a2e1d9d79420298a6c41e51f41","observation_id":"43a4d525-4e00-4178-9250-94edf613e55f","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:7871852a68b2a5f7f0aaded0a654c8525f76b5b5dd43c9678259610c38bb7600","observation_id":"8e8d7945-0255-4df4-9709-245e1884b6a1","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:963551f979a362989158906605dd6093b517022fd779c29eb0427902681ea88e","observation_id":"37db8820-005c-4f5c-810f-4550f796cf64","resolution":{"observed_at":"2026-05-22T00:05:47.749121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T20:14:11.885288Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03526","last_updated":"2025-07-04T12:23:45Z","snapshot_observed_at":"2026-08-06T20:05:26.425762Z","submitted_at":"2025-07-04T12:23:45Z","title":"Decoupled Relative Learning Rate Schedules","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:14:11.885288Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2507.03526"},"observation_digest":"sha256:5c8fa4d3336404518d4ba034821768990e8ce1541f575acb7853d1a647af7f03","observation_id":"d6251c4e-449c-4d4a-9cfe-aae1467b3f1c","resolution":{"observed_at":"2026-08-06T20:14:11.885288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T18:37:46.441294Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07818","last_updated":"2025-08-13T13:45:40Z","snapshot_observed_at":"2026-08-07T03:24:47.709912Z","submitted_at":"2025-07-10T14:48:08Z","title":"MoSE: Skill-by-Skill Mixture-of-Experts Learning for Embodied Autonomous Machines","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:37:46.441294Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2507.07818"},"observation_digest":"sha256:b0bee13799f20acb0882f3d033a211bd473872c078b6cfc2fa8c059e1aa28e8e","observation_id":"c3dd1e9b-0d51-4115-8e98-174d7f77f9a8","resolution":{"observed_at":"2026-08-06T18:37:46.441294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T18:10:16.572247Z","title":"ST-MoE: Design- ing Stable and Transferable Sparse Expert Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09116","last_updated":"2025-07-19T16:25:24Z","snapshot_observed_at":"2026-08-06T18:01:28.830892Z","submitted_at":"2025-07-12T02:14:50Z","title":"Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:10:16.572247Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2507.09116"},"observation_digest":"sha256:4eced7efec0b1c2a1a3942ca0abc0cd14997a9a91e4b0cb7534b96bb573cea39","observation_id":"ff2f5baa-4966-4c59-a6ab-eef86c2a9538","resolution":{"observed_at":"2026-08-06T18:10:16.572247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T16:26:58.655031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13575","last_updated":"2025-08-27T16:34:47Z","snapshot_observed_at":"2026-08-06T16:19:23.253511Z","submitted_at":"2025-07-17T23:37:19Z","title":"Apple Intelligence Foundation Language Models: Tech Report 2025","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:26:58.655031Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2507.13575"},"observation_digest":"sha256:0de1d2e16e6acd87ec9d0981426f0a76abfbad4caf6e63e0c598da7eeb2c3c5a","observation_id":"85bd6396-169b-49bf-b005-41efc2ba5aa0","resolution":{"observed_at":"2026-08-06T16:26:58.655031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T05:30:37.955324Z","title":"St- moe: Designing stable and transferable sparse expert mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-06T05:30:32.545698Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.955324Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0911e7789a62487f0f221f440a90c750b331e622b09691b56a22fb7aaa0f4be4","observation_id":"e2d15f56-e33b-49f5-9a5f-b9ea67da2ed7","resolution":{"observed_at":"2026-08-06T05:30:37.955324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T00:56:02.677146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04153","last_updated":"2025-08-06T07:28:25Z","snapshot_observed_at":"2026-08-07T01:24:45.980335Z","submitted_at":"2025-08-06T07:28:25Z","title":"ICM-Fusion: In-Context Meta-Optimized LoRA Fusion for Multi-Task Adaptation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T00:56:02.677146Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.04153"},"observation_digest":"sha256:7a1f22204161784f1072984824ec71033d8be36f3513c2dcc1a5d47d69681e81","observation_id":"da16a950-7ef8-4dfa-a288-7ef3be779e10","resolution":{"observed_at":"2026-08-06T00:56:02.677146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T23:38:07.772930Z","title":"St- moe: Designing stable and transferable sparse expert mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05037","last_updated":"2025-09-09T02:42:55Z","snapshot_observed_at":"2026-08-05T23:38:01.673363Z","submitted_at":"2025-08-07T05:29:21Z","title":"A Novel Image Similarity Metric for Scene Composition Structure","version":4},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-05T23:38:07.772930Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.05037"},"observation_digest":"sha256:42e3345c3b0d846710409a863801f00c60ac212e99a0ca39365df2a8c078ed2a","observation_id":"1aeb1bd1-5f7f-40a0-8fef-9b7bbaecd5c8","resolution":{"observed_at":"2026-08-05T23:38:07.772930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T23:38:07.698419Z","title":"St- moe: Designing stable and transferable sparse expert mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05038","last_updated":"2025-08-27T04:31:10Z","snapshot_observed_at":"2026-08-05T23:38:06.250870Z","submitted_at":"2025-08-07T05:34:14Z","title":"HAMoBE: Hierarchical and Adaptive Mixture of Biometric Experts for Video-based Person ReID","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-05T23:38:07.698419Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.05038"},"observation_digest":"sha256:44f77105214cf790af6ac9a4dbc9bac762b6cd638263bf3d160f89dfc79a4d12","observation_id":"07200874-7ac8-4c54-a858-4753c5112811","resolution":{"observed_at":"2026-08-05T23:38:07.698419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T19:23:18.505657Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12801","last_updated":"2025-08-18T10:25:42Z","snapshot_observed_at":"2026-08-06T02:58:00.222739Z","submitted_at":"2025-08-18T10:25:42Z","title":"Maximum Score Routing For Mixture-of-Experts","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T19:23:18.505657Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.12801"},"observation_digest":"sha256:15d43da37860544c0eabef6c8e616af10351adb19e92e759d448a916fa0b7221","observation_id":"b20848b1-08c8-4486-9a51-c008c1573e61","resolution":{"observed_at":"2026-08-05T19:23:18.505657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T15:53:29.303551Z","title":"Designing effective sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-05T15:53:27.523245Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.303551Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:5b548e0236145aa824ca55fd442edbfa03b51bedec566137c6f62defd1f4a8d1","observation_id":"0891a351-fee2-4949-8b0e-eadd58e3fc64","resolution":{"observed_at":"2026-08-05T15:53:29.303551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T15:45:39.865650Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19609","last_updated":"2025-08-27T06:44:46Z","snapshot_observed_at":"2026-08-05T15:45:34.442125Z","submitted_at":"2025-08-27T06:44:46Z","title":"FinCast: A Foundation Model for Financial Time-Series Forecasting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.865650Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.19609"},"observation_digest":"sha256:c93acb9aca31b615a731ee9892367f3e2f7e4548e865d783e71bfa0d88d9e1db","observation_id":"4f0126d6-8219-4377-92f5-da403a76b8b7","resolution":{"observed_at":"2026-08-05T15:45:39.865650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-05T05:44:47.674501Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05006","last_updated":"2025-09-05T11:13:20Z","snapshot_observed_at":"2026-08-07T05:15:59.447770Z","submitted_at":"2025-09-05T11:13:20Z","title":"Do Large Language Models Need Intent? Revisiting Response Generation Strategies for Service Assistant","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T05:44:47.674501Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.05006"},"observation_digest":"sha256:329fc3462b3935e21a873bb540482e5faf578d08d5f605af3a8cd7acbfdd8fb1","observation_id":"bd6911da-b306-490d-9a89-8e6fcc25d1b3","resolution":{"observed_at":"2026-08-05T05:44:47.674501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2509.14255","last_updated":"2026-04-12T14:13:04Z","snapshot_observed_at":"2026-07-06T22:30:07.020487Z","submitted_at":"2025-09-12T09:02:48Z","title":"Cosine-Similarity Routing with Semantic Anchors for Interpretable Mixture-of-Experts Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T17:48:22.819674Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.14255"},"observation_digest":"sha256:c7065c3946748abc2d20b3af3d80b8f4f96ff46f3b599ef9d940adc3b9e87d33","observation_id":"3b2b9762-6f96-49d3-b678-3b04a036a18f","resolution":{"observed_at":"2026-05-18T17:51:42.063629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2509.19349","last_updated":"2025-09-17T17:49:02Z","snapshot_observed_at":"2026-08-04T18:42:43.786371Z","submitted_at":"2025-09-17T17:49:02Z","title":"ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution","version":1},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-05-16T13:58:58.627748Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.19349"},"observation_digest":"sha256:e62198ed07426ab0ebfb0715fc5df7e9203dc662703c4fd4966e6883f3def5cf","observation_id":"e96c0f3c-af23-4319-b956-4ea3148a5890","resolution":{"observed_at":"2026-05-16T13:58:58.742335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-04T15:17:05.021245Z","title":"St-moe: Designing stable and transferable sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20073","last_updated":"2026-06-30T12:36:01Z","snapshot_observed_at":"2026-08-04T15:17:04.439040Z","submitted_at":"2025-09-24T12:50:04Z","title":"SHMoAReg: Spark Deformable Image Registration via Spatial Heterogeneous Mixture of Experts and Attention Heads","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:05.021245Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.20073"},"observation_digest":"sha256:ba13c28c71c88ea586245cb8807587c2c070c5148a641a02f4ecb17f7a89b941","observation_id":"3456374b-a1d0-4b34-b43f-a80d160d0622","resolution":{"observed_at":"2026-08-04T15:17:05.021245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2510.08055","last_updated":"2026-04-16T12:39:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T10:41:35Z","title":"From Tokens to Layers: Redefining Stall-Free Scheduling for MoE Serving with Layered Prefill","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T08:47:29.759674Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2510.08055"},"observation_digest":"sha256:a873037801e911870abcad9af9673c12ddbffb4857a12dfa8d58692119c28433","observation_id":"2aff76a7-17f5-48a3-b9be-9c85a89b06fe","resolution":{"observed_at":"2026-05-18T08:51:08.934210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-03T22:47:20.246737Z","title":"Selective Sinkhorn Routing for Improved Sparse Mixture of Experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.08972","last_updated":"2026-06-04T02:54:34Z","snapshot_observed_at":"2026-08-06T17:48:05.257674Z","submitted_at":"2025-11-12T04:29:05Z","title":"Selective Sinkhorn Routing for Improved Sparse Mixture of Experts","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T22:47:20.246737Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2511.08972"},"observation_digest":"sha256:b4d2f0c24d3e5c6da260728f8c894b9e98740bc4a85bacf286c999e33975a486","observation_id":"98c9651f-34bc-4af6-ac0f-7f45e6d1c032","resolution":{"observed_at":"2026-08-03T22:47:20.246737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2512.08411","last_updated":"2026-05-13T07:02:09Z","snapshot_observed_at":"2026-08-02T21:03:40.872307Z","submitted_at":"2025-12-09T09:40:34Z","title":"Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:26.202547Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2512.08411"},"observation_digest":"sha256:eaede398cb4beb4fef835dc587b252d2bb44139d9df3be3543722cd77635e90c","observation_id":"4651ce0f-131a-450c-8beb-7c4644c6e450","resolution":{"observed_at":"2026-05-17T00:38:44.988074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-03T16:21:35.153431Z","title":"St-moe: Designing stable and transferable sparse expert models.arXiv preprint arXiv:2202.08906, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13996","last_updated":"2026-06-01T21:50:10Z","snapshot_observed_at":"2026-08-03T16:21:25.419900Z","submitted_at":"2025-12-16T01:28:57Z","title":"DTop-p MoE: Sparsity-Controlled Dynamic Top-p MoE for Foundation Model Pre-training","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:35.153431Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2512.13996"},"observation_digest":"sha256:28d3e3367f159e7e17834af8a61b13ed7b9760063b224e050939281f0325038c","observation_id":"7bb61d32-cfa6-4da4-839b-d4b39894f6fd","resolution":{"observed_at":"2026-08-03T16:21:35.153431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2601.21349","last_updated":"2026-05-14T07:59:04Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:33Z","title":"L2R: Low-Rank and Lipschitz-Controlled Routing for Mixture-of-Experts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T09:56:22.252528Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2601.21349"},"observation_digest":"sha256:23f0e82abdb9b93db3be00bdf9008ee304154f3f98722fcbb31d3bafa54019ec","observation_id":"3a7bcbda-5a33-44af-8f71-856774884516","resolution":{"observed_at":"2026-05-16T09:57:42.803764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-03T04:14:03.048101Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.05711","last_updated":"2026-07-01T04:46:34Z","snapshot_observed_at":"2026-08-03T04:13:56.754896Z","submitted_at":"2026-02-05T14:37:32Z","title":"OmniMoE: An Efficient MoE by Orchestrating Atomic Experts at Scale","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:03.048101Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2602.05711"},"observation_digest":"sha256:9a21c0ef88b9d61bc2264367e4fabf105f7bfdbde4af27c85c4d78a9945bc4b3","observation_id":"cb329fa6-7011-4a67-926d-10da8b2f157e","resolution":{"observed_at":"2026-08-03T04:14:03.048101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-03T04:04:36.471336Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.06154","last_updated":"2026-06-16T12:59:35Z","snapshot_observed_at":"2026-08-06T18:40:04.383273Z","submitted_at":"2026-02-05T19:48:41Z","title":"MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T04:04:36.471336Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2602.06154"},"observation_digest":"sha256:3a7dadf183c134b9c0c99662e9509f2fbf8896832bbd7811cc4665c95f76aaac","observation_id":"ec00082f-b64e-4827-a3c3-ec17fb0dd206","resolution":{"observed_at":"2026-08-03T04:04:36.471336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-02T21:32:47.917300Z","title":"St-moe: Designing stable and transferable sparse expert models, 2022.https://arxiv.org/abs/2202.08906","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19938","last_updated":"2026-07-13T22:02:53Z","snapshot_observed_at":"2026-08-02T21:32:43.874314Z","submitted_at":"2026-02-23T15:11:16Z","title":"A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:32:47.917300Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2602.19938"},"observation_digest":"sha256:4ddab262248da5238c8748325968b98dec80c075a3fae156b57a3dec39795a87","observation_id":"72bf5afb-77d3-4ae0-af99-d779c209ab0a","resolution":{"observed_at":"2026-08-02T21:32:47.917300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-02T21:50:59.874745Z","title":"St-moe: Designing stable and transferable sparse expert models.arXiv preprint arXiv:2202.08906,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.06626","last_updated":"2026-05-24T09:37:35Z","snapshot_observed_at":"2026-08-02T21:50:53.342047Z","submitted_at":"2026-02-22T06:09:57Z","title":"Grouter: Decoupling Routing from Representation for Accelerated MoE Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:50:59.874745Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2603.06626"},"observation_digest":"sha256:1d7100577939ef0601d5ba602a47ce0c010cade228a499176fe2b56c46d018eb","observation_id":"a988af4d-8d88-4ae0-9fb0-2cf62b0d7055","resolution":{"observed_at":"2026-08-02T21:50:59.874745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-14T20:29:33.439034Z","title":"12 When Does Sparsity Mitigate the Curse of Depth in LLMs A","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.15389","last_updated":"2026-06-27T04:53:36Z","snapshot_observed_at":"2026-08-01T17:36:36.240938Z","submitted_at":"2026-03-16T15:04:16Z","title":"When Does Sparsity Mitigate the Curse of Depth in LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T20:29:33.439034Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2603.15389"},"observation_digest":"sha256:37cc002dc1abe2dc6dc8fae2e12fc909e6ced92d87a651bca661ac25c518a505","observation_id":"0d8214f1-1fe8-4330-ae9a-994db7daf915","resolution":{"observed_at":"2026-07-14T20:29:33.439034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:02833bce25f8b6c5f256bce5d75411f0f9ec1c1fbad5327fc98c0a91605aaefd","observation_id":"d003b137-f88f-4871-b56b-b6c8c0f0a9cb","resolution":{"observed_at":"2026-05-14T21:53:02.447398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.06542","last_updated":"2026-04-08T00:41:11Z","snapshot_observed_at":"2026-07-06T22:55:01.863342Z","submitted_at":"2026-04-08T00:41:11Z","title":"Does a Global Perspective Help Prune Sparse MoEs Elegantly?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T19:06:25.626026Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.06542"},"observation_digest":"sha256:3e77780a53933c4c0fa3bda03cc914c5c7af8778f941e840d964fbba863daa20","observation_id":"f529c584-1b2a-476f-aec3-bd1001a0608e","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.07035","last_updated":"2026-05-18T19:31:30Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T12:50:52Z","title":"Unified Deployment-Aware Evaluation of Open Reasoning Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:52.594972Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.07035"},"observation_digest":"sha256:975cbf95972175345f98c7104293a69e270d40dac415b4b406948dbab0e0553d","observation_id":"fa1f0886-eed5-4195-a152-ebe2f10a4e14","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.07035","last_updated":"2026-05-18T19:31:30Z","snapshot_observed_at":"2026-07-06T22:55:24.459130Z","submitted_at":"2026-04-08T12:50:52Z","title":"Unified Deployment-Aware Evaluation of Open Reasoning Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T09:42:33.144129Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.07035"},"observation_digest":"sha256:ef01873a66ef3978eec28b2c95705f37f21af483f861d050caef43a7012c0075","observation_id":"c3445105-fd4d-481b-b6a6-0c75cea51eaa","resolution":{"observed_at":"2026-05-21T09:44:05.754848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.07753","last_updated":"2026-06-27T04:43:13Z","snapshot_observed_at":"2026-07-13T00:15:55.253944Z","submitted_at":"2026-04-09T03:19:26Z","title":"Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T18:24:17.872120Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.07753"},"observation_digest":"sha256:501ac3f9127e8734fd300423db91142aca280ce0d25ba8f03a3a046ee02c4a61","observation_id":"d8f9f0dd-7393-41fa-9fc9-a55bdeae1e53","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.14419","last_updated":"2026-04-15T21:02:02Z","snapshot_observed_at":"2026-07-06T23:02:13.885476Z","submitted_at":"2026-04-15T21:02:02Z","title":"Equifinality in Mixture of Experts: Routing Topology Does Not Determine Language Modeling Quality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:19.016420Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.14419"},"observation_digest":"sha256:918671e96404283e8339ee88f20de0fcf30731f469e64f7d73e7d5c1da1b8d65","observation_id":"0c824283-b3cc-4866-81e4-19d327a57e3d","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.16247","last_updated":"2026-04-17T17:07:35Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:07:35Z","title":"Joint-Centric Dual Contrastive Alignment with Structure-Preserving and Information-Balanced Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:58.502396Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.16247"},"observation_digest":"sha256:a1fe812e104f5c9f763b85666249aceef945be0a19e7c8be9c87fac3c715dda9","observation_id":"7013c5c4-21a6-424e-8043-e5ec3d4b365f","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.17228","last_updated":"2026-04-19T03:20:40Z","snapshot_observed_at":"2026-08-04T01:34:20.569967Z","submitted_at":"2026-04-19T03:20:40Z","title":"Revisiting Auxiliary Losses for Conditional Depth Routing: An Empirical Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T07:07:17.023690Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.17228"},"observation_digest":"sha256:707865e044b18d669f3350727a6b03e667eb81ed7cb0b84136f8124d31ff5db7","observation_id":"883c12d5-b2ac-4510-8978-7ec874e72fa7","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.21330","last_updated":"2026-04-23T06:34:10Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:34:10Z","title":"Teacher-Guided Routing for Sparse Vision Mixture-of-Experts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T21:52:25.776287Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.21330"},"observation_digest":"sha256:84885b57968e28402d303e9ba4e0ac9b58532b0d880f239fb532b9f1c15fb3c9","observation_id":"ddfa46a4-79e7-4931-b086-a1a2e78d76f6","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2604.23150","last_updated":"2026-04-25T05:33:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-25T05:33:03Z","title":"Scaling Multi-Node Mixture-of-Experts Inference Using Expert Activation Patterns","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T08:29:17.149710Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2604.23150"},"observation_digest":"sha256:50e38c9914246bdd2004e6f0bc5d80321884051f2a65f2967287372266adde29","observation_id":"3e732b31-da43-4f50-9123-fcad2a12af8c","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.00604","last_updated":"2026-05-01T12:18:55Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T12:18:55Z","title":"Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T19:10:18.888463Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.00604"},"observation_digest":"sha256:972c9d69d8721e69a9f4ffac395de98d1459fbf0042d960555fa1cddb3db3024","observation_id":"cac4c1f6-5e94-4cbe-81ed-baead987c091","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.02960","last_updated":"2026-05-15T03:29:35Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T03:10:24Z","title":"MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-08T19:29:28.916831Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.02960"},"observation_digest":"sha256:38df5679df55b8aaf311fc903eab4ff37d3fa9dd7d278e19945520d4b1f4b687","observation_id":"da6e6f46-33ad-48ac-a446-66acc6927832","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.02960","last_updated":"2026-05-15T03:29:35Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-03T03:10:24Z","title":"MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T17:43:56.767714Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.02960"},"observation_digest":"sha256:a5bf46e5ec8a51c752ade9de8e0ae55bf24571c4aa100b150247702e7a6d815f","observation_id":"0c6e8f99-1228-4a0b-93de-2549252a383a","resolution":{"observed_at":"2026-05-19T17:47:41.957786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.06240","last_updated":"2026-05-07T13:24:58Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:24:58Z","title":"Cumulative-Goodness Free-Riding in Forward-Forward Networks: Real, Repairable, but Not Accuracy-Dominant","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T13:19:35.424177Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.06240"},"observation_digest":"sha256:0c9e69f8d2d24d92eca15137be1927f9e0d02bae60bbca8261a984ee554e565c","observation_id":"e4ca4794-962a-4fc6-b2ca-389133e69688","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.06665","last_updated":"2026-05-07T17:59:44Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:59:44Z","title":"UniPool: A Globally Shared Expert Pool for Mixture-of-Experts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-08T11:56:21.623709Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.06665"},"observation_digest":"sha256:a270d8e19f50535d91a8a4035da4b93eac6ad972d2a8ded2615fc7c8b4059d7d","observation_id":"7c4c3554-aa3b-4448-ac47-fe0690924ca5","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.07260","last_updated":"2026-05-08T05:26:09Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:26:09Z","title":"When Are Experts Misrouted? Counterfactual Routing Analysis in Mixture-of-Experts Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T01:50:40.158985Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.07260"},"observation_digest":"sha256:c8b702e041f09d1d9ce508bc213d673cbc7e6b10da53b5cbee99a603fee6044b","observation_id":"24c41cb2-8475-43a6-95b0-fa06a3fd053a","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.08292","last_updated":"2026-05-08T09:21:46Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T09:21:46Z","title":"Hierarchical Mixture-of-Experts with Two-Stage Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:58:04.218139Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.08292"},"observation_digest":"sha256:5062462569a91948091b917399d3f057a3ed4bdd4c1d0e370e6eb8460dbf306f","observation_id":"e3c45406-37f3-4dcc-8298-a07bd711391e","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.08322","last_updated":"2026-05-12T08:55:50Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T16:25:21Z","title":"SDG-MoE: Signed Debate Graph Mixture-of-Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T01:20:48.313702Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.08322"},"observation_digest":"sha256:f561f036ae8a8be81d8d25b378d467c548d8d486d1d0f61f69194639a99fd757","observation_id":"d68115f7-ef31-4fdb-9c5d-f4f68ad23c1f","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.08322","last_updated":"2026-05-12T08:55:50Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T16:25:21Z","title":"SDG-MoE: Signed Debate Graph Mixture-of-Experts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T07:21:44.772644Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.08322"},"observation_digest":"sha256:f4c077ffa5ae965a1b8db4038dd083826a22d385f830fd9064e6d6f2dc333385","observation_id":"217cec5c-a2a1-4335-bbf7-fc85ceb3822b","resolution":{"observed_at":"2026-05-13T07:22:28.418888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.09104","last_updated":"2026-05-09T18:18:51Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T18:18:51Z","title":"Token Economics for LLM Agents: A Dual-View Study from Computing and Economics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T02:34:34.546971Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.09104"},"observation_digest":"sha256:07ce77874e4c2dcddebdd7e69a28eb800b5722a2b2b08fcb8d8f1634820089e8","observation_id":"d635bd5d-a60a-4a16-9ec5-31858db12d69","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:12.696712Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:61d5cee40606daa2586301ec8a4fb78895715351976fa4cceb233ea76ee6c275","observation_id":"82837ec9-7e11-4098-aa64-1db03473ea3a","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:62b542be0c21679f5453a7299d0df127da1abe1b84cfa53c37853231dccb1ac4","observation_id":"a8545f5e-dea0-4647-b36b-3b57af46b590","resolution":{"observed_at":"2026-07-01T07:35:29.151888Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.09516","last_updated":"2026-05-10T12:53:28Z","snapshot_observed_at":"2026-07-06T23:21:35.327066Z","submitted_at":"2026-05-10T12:53:28Z","title":"Mixture of Layers with Hybrid Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:51:24.779108Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.09516"},"observation_digest":"sha256:586de361601c95fdb4d53d69f53a49a93628e200dcddeecd633a13f090825084","observation_id":"f9b5c58d-1e3e-4944-9fee-d977edd757e7","resolution":{"observed_at":"2026-05-12T23:14:26.471193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.12476","last_updated":"2026-05-12T17:55:02Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:55:02Z","title":"Routers Learn the Geometry of Their Experts: Geometric Coupling in Sparse Mixture-of-Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:20:32.087436Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.12476"},"observation_digest":"sha256:8510a89e54cb712075caba302af43a6597b753ce76b33b4c0623e89bc12ad111","observation_id":"64db099b-4d8a-45c9-8246-e4578ab06037","resolution":{"observed_at":"2026-05-13T05:27:18.798680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.13247","last_updated":"2026-05-14T02:03:27Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:31:09Z","title":"EMO: Frustratingly Easy Progressive Training of Extendable MoE","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T20:06:33.816250Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.13247"},"observation_digest":"sha256:e9f45c99e67c51555f40c8ced33459a2f52e5355253050649c4ee255ef13d616","observation_id":"fee3ff78-6395-40e0-81b1-87abae42afe0","resolution":{"observed_at":"2026-05-14T20:07:53.608925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.13247","last_updated":"2026-05-14T02:03:27Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:31:09Z","title":"EMO: Frustratingly Easy Progressive Training of Extendable MoE","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T05:32:10.642355Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.13247"},"observation_digest":"sha256:a0e23e759ca927b8a084362ddb46026c1435e090a3c370cca5318ce2677a8d88","observation_id":"3668db31-e3d6-43cc-b5b2-284a0e0100e7","resolution":{"observed_at":"2026-05-15T05:35:04.322452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:260cdb0ba903818cf3971819985fa92372aa759003e255981affc9bd3b71aa56","observation_id":"01316674-913b-4aaf-8299-e81185a2c67d","resolution":{"observed_at":"2026-05-15T04:49:44.723240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.15484","last_updated":"2026-05-15T00:01:11Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T00:01:11Z","title":"When Does Sparse MoE Help in Vision? The Role of Backbone Compute Leverage in Sparse Routing","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-19T16:21:02.198882Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.15484"},"observation_digest":"sha256:75802187be181791cfe38e9b69e49b64d603a8e699c96f430da671d0c5b50a55","observation_id":"3166dffd-5b63-4d5a-8599-6d3f7ee66859","resolution":{"observed_at":"2026-05-19T16:22:39.093259Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.16349","last_updated":"2026-05-08T04:17:10Z","snapshot_observed_at":"2026-08-02T09:46:11.155553Z","submitted_at":"2026-05-08T04:17:10Z","title":"Geometric Asymmetry in MoE Specialization: Functional Decorrelation and Representational Overlap","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T23:45:19.279268Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.16349"},"observation_digest":"sha256:33b0533e7c1c2fbce83df1219559feaec36af0c161e5e56d114ac29314a1e8f5","observation_id":"a5d6afb3-30da-401f-8fb3-e256d8e2b37d","resolution":{"observed_at":"2026-05-20T23:49:15.487908Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.16690","last_updated":"2026-05-15T23:06:59Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:06:59Z","title":"UB-SMoE: Universally Balanced Sparse Mixture-of-Experts for Resource-adaptive Federated Fine-tuning of Foundation Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T19:06:08.951475Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.16690"},"observation_digest":"sha256:2f01d1b9049b7858d38d05106db78fb490760a9abf82d70cb613c5565b974020","observation_id":"30a1f700-48dc-442b-8706-5c3d466a7a87","resolution":{"observed_at":"2026-05-20T19:08:54.316621Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.18083","last_updated":"2026-05-18T08:59:08Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:59:08Z","title":"A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$\\Delta$ Integration into Upcycled MoE","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-20T11:09:22.027588Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.18083"},"observation_digest":"sha256:5534fa30dd5fbb12ababc5bfe532feabb24070f9046863bfed2aefecb49febe8","observation_id":"96295a3b-53fb-48ef-909d-f2ba70c01645","resolution":{"observed_at":"2026-05-20T11:13:13.598892Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:22a09497b1e0f5d00f0280f6136007a10003ca92afbdae8c6f6210a9ce2fcb41","observation_id":"c829acb5-e4a1-4193-a031-09d3858bdf29","resolution":{"observed_at":"2026-05-20T09:38:11.025209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:998b51bfd09133310170d1e46e8dea4d6f15cada1dd8898c29d424268341066d","observation_id":"40bacc92-8fb3-4b9b-9cad-3a30c2f15d29","resolution":{"observed_at":"2026-06-30T18:45:00.447358Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.18643","last_updated":"2026-06-08T03:38:38Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:50:48Z","title":"Post-Trained MoE Can Skip Half Experts via Self-Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T12:00:35.496822Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.18643"},"observation_digest":"sha256:7cf2c531deba472f925ce744b5fd47dfb480d2f5d16d6856d123f1e67f52ea79","observation_id":"eb931bf2-bcc7-4da9-acf3-d330441d677c","resolution":{"observed_at":"2026-05-20T12:03:15.205078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.18643","last_updated":"2026-06-08T03:38:38Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:50:48Z","title":"Post-Trained MoE Can Skip Half Experts via Self-Distillation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:22:45.702572Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.18643"},"observation_digest":"sha256:97b69c2f10e2a646e9d6a0d36e43765c144fb00105129e0f5119a3b67d322104","observation_id":"c3adf2aa-0dab-4c29-b9fe-dcfdabcd2f19","resolution":{"observed_at":"2026-06-30T18:25:00.058113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.20610","last_updated":"2026-05-20T01:55:40Z","snapshot_observed_at":"2026-08-05T11:22:57.551703Z","submitted_at":"2026-05-20T01:55:40Z","title":"Beyond Routing: Characterising Expert Tuning and Representation in Vision Mixture-of-Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T05:56:18.498128Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.20610"},"observation_digest":"sha256:91bef1ff92721afb362b05033527722d060d5c7d1986ff6b6a9cf1d27d49498d","observation_id":"c7e7edb4-b327-41f3-be90-ffe3112b969b","resolution":{"observed_at":"2026-05-21T05:59:41.002103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T02:11:11.003259Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:20f5caba33d5c17c7efc8f22931fb0c46db77b0c94aa662ef971f02241b26b81","observation_id":"ebaf8f7e-187e-462f-8b0d-635829ffb929","resolution":{"observed_at":"2026-05-21T02:13:56.353818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-02T13:33:43.865248Z","title":"ST-MoE: Designing stable and transferable sparse expert models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.20982","last_updated":"2026-07-17T08:33:40Z","snapshot_observed_at":"2026-08-02T13:33:38.641735Z","submitted_at":"2026-05-20T10:14:00Z","title":"Diagnosing Overhead in Dispatch Operations: Cross-architecture Observatory","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T13:33:43.865248Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.20982"},"observation_digest":"sha256:c57b77a719c27f1a91b62d6121716db7696ec298172b288c85b3aaf76ae4a866","observation_id":"5f446645-730a-4fff-aec3-44e58cf7f48e","resolution":{"observed_at":"2026-08-02T13:33:43.865248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.23893","last_updated":"2026-05-22T17:56:13Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-22T17:56:13Z","title":"Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T04:33:25.028283Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.23893"},"observation_digest":"sha256:ea07899c70ca827a70c7a671c2b88d220f7e7f669fa0b26a8e90cda7ab0cfc66","observation_id":"5a79f8b6-3377-4cbe-a8f9-214a787879f5","resolution":{"observed_at":"2026-05-25T04:35:21.017868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.24817","last_updated":"2026-05-24T02:06:44Z","snapshot_observed_at":"2026-07-06T23:34:52.129354Z","submitted_at":"2026-05-24T02:06:44Z","title":"RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T00:33:35.235214Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.24817"},"observation_digest":"sha256:4d4bc439bf0a0bed2f00d0aba64a2def6f99a85e47980ae1db3834218bad8a51","observation_id":"ba5fc112-5eff-4b48-a001-491575a9966e","resolution":{"observed_at":"2026-06-30T00:34:05.290483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.27358","last_updated":"2026-05-26T17:58:24Z","snapshot_observed_at":"2026-07-06T23:37:02.891611Z","submitted_at":"2026-05-26T17:58:24Z","title":"MobileMoE: Scaling On-Device Mixture of Experts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-29T18:48:50.656971Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.27358"},"observation_digest":"sha256:1edff3d56eb958022bfa60f8c1c92ea8d8ee3b713c4a458f15e3fd29c2dd0661","observation_id":"ad8e7f9a-1bf7-4058-8dc8-dca74b01e782","resolution":{"observed_at":"2026-06-29T18:53:51.377203Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.29121","last_updated":"2026-05-27T21:29:30Z","snapshot_observed_at":"2026-08-02T19:36:09.904137Z","submitted_at":"2026-05-27T21:29:30Z","title":"A Minimal Bifurcation Model of Load Imbalance in a Softmax Mixture-of-Experts Router","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T09:28:02.669459Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.29121"},"observation_digest":"sha256:084b235d4ab342a0b7602e773cfe2bab46dc2f48120a1afc30373890494b2150","observation_id":"9c18fb57-d3c6-4e69-b869-cd2b7903b8c1","resolution":{"observed_at":"2026-06-29T10:03:17.820226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.29714","last_updated":"2026-05-28T10:12:41Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T10:12:41Z","title":"Leveraging Routing Dynamics in Mixture-of-Experts Models for Efficient Language Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:32:03.855744Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.29714"},"observation_digest":"sha256:0434f2add2caf0d733210e17c7cd3ca8c6f5d07003fd90cc9678e8520512313c","observation_id":"c31551e4-1870-419f-b170-c3a0ee9d9e3c","resolution":{"observed_at":"2026-06-29T07:33:13.341204Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2605.31268","last_updated":"2026-05-29T13:01:11Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T13:01:11Z","title":"Mellum2 Technical Report","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T22:58:35.397914Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2605.31268"},"observation_digest":"sha256:eebd628503d561b3f6c1375179c3633774c811172954fb31d93c8909ea93d1f1","observation_id":"cebde98a-6141-4783-b1bb-9631190cec67","resolution":{"observed_at":"2026-06-28T23:02:46.526886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.00275","last_updated":"2026-05-29T19:08:20Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T19:08:20Z","title":"Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T22:43:33.929871Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.00275"},"observation_digest":"sha256:9ba38c2c86ddc335bd50a8553204f7f783849aeee5087c1e0b8bbbf6558e2574","observation_id":"89f3cfd1-45ec-4919-ac7c-6fa3050611d6","resolution":{"observed_at":"2026-07-01T19:26:00.076019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01047","last_updated":"2026-05-31T06:35:10Z","snapshot_observed_at":"2026-08-03T01:58:39.637171Z","submitted_at":"2026-05-31T06:35:10Z","title":"Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:26:36.956666Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01047"},"observation_digest":"sha256:d6a0d83694f825da3ea154a0f77338095ab78becdfb3e704f042ad576a721d29","observation_id":"71276e9d-873e-444b-b15c-d09e760e9f08","resolution":{"observed_at":"2026-07-01T21:06:14.811901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01062","last_updated":"2026-05-31T07:08:16Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T07:08:16Z","title":"DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T17:14:53.648013Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01062"},"observation_digest":"sha256:ddd67129216c80a5e1611496728c34bd7668b5c83f512306d28abe46c099d018","observation_id":"504d5230-ce26-48cb-b5ba-ab4bdb7cce91","resolution":{"observed_at":"2026-07-01T21:16:14.426688Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01143","last_updated":"2026-06-03T04:16:23Z","snapshot_observed_at":"2026-07-06T23:41:43.820102Z","submitted_at":"2026-05-31T10:24:10Z","title":"Schedule-Level Shared-Prefix Reuse for LLM RL Training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T16:43:39.796020Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01143"},"observation_digest":"sha256:a16e0a409c811d58dbefbf32ae801e77845832bdf1ea0382dcfb7276f0ae65b7","observation_id":"daa1af65-2e43-490d-b2c1-e47c8861c095","resolution":{"observed_at":"2026-07-01T21:36:15.139447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01173","last_updated":"2026-08-02T10:08:54Z","snapshot_observed_at":"2026-08-06T23:24:43.009595Z","submitted_at":"2026-05-31T11:28:41Z","title":"Bridging Multimodal Fusion and Expert Routing via Spectral Reliability Descriptors for Robust Object Detection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T17:26:50.038071Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01173"},"observation_digest":"sha256:0435aa513259b157c704e1b817941aaf51cd66c5d2df146bc3d4fb01cc06d377","observation_id":"0b16b90c-cd8d-4f7b-b84a-e2137acceb7d","resolution":{"observed_at":"2026-07-01T21:06:14.704945Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01660","last_updated":"2026-06-01T04:14:13Z","snapshot_observed_at":"2026-08-02T14:22:41.251311Z","submitted_at":"2026-06-01T04:14:13Z","title":"Gate the Filter, Not the Message: Node-Channel Mixtures for Pre-Propagation GNNs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:36:27.182300Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01660"},"observation_digest":"sha256:44c600ff84f72c5d2e9aa98fc5d887e6e1e2f5df24f4c861e8acee316a858487","observation_id":"643e76db-f877-4784-b91d-239f503da702","resolution":{"observed_at":"2026-07-01T22:16:16.193312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.01666","last_updated":"2026-06-01T04:19:16Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T04:19:16Z","title":"DOT-MoE: Differentiable Optimal Transport for MoEfication","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T15:30:34.142428Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.01666"},"observation_digest":"sha256:3d196c1ee78fd1f692181f58b7035a9c8ca7a8b75c021da522b5288ea5c06873","observation_id":"5e0e10ca-b6bc-4994-8109-d25a997db8df","resolution":{"observed_at":"2026-07-01T22:16:16.871409Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.05957","last_updated":"2026-06-04T09:54:08Z","snapshot_observed_at":"2026-07-06T23:45:51.910263Z","submitted_at":"2026-06-04T09:54:08Z","title":"Dead Directions: Geometric Singular Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T03:20:09.365073Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.05957"},"observation_digest":"sha256:2582d8dbda9f278ea226e0e14df6d010d3f4861f4a83d87c5b230fcbaf669c88","observation_id":"8176d94b-363b-4f2a-90ec-55d75e4c8346","resolution":{"observed_at":"2026-07-02T11:36:55.220216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.09038","last_updated":"2026-06-08T05:10:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T05:10:05Z","title":"Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs","version":1},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-06-27T16:49:14.243931Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.09038"},"observation_digest":"sha256:d1651db8f49932cfb986db6aafc6e004dc24b2c1c79f25eaabc141cd8db67e90","observation_id":"a70b6f45-6bd8-4b8b-8792-779e1eee5532","resolution":{"observed_at":"2026-07-03T01:07:30.151835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.09607","last_updated":"2026-06-08T15:17:54Z","snapshot_observed_at":"2026-08-02T05:50:49.496750Z","submitted_at":"2026-06-08T15:17:54Z","title":"Closure-Validated Circuit Discovery in Attention Heads: Co-activation Proposes, Ablation Disposes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T17:19:27.706747Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.09607"},"observation_digest":"sha256:506be9ea399b898a3211993875e36d0143905e59c8dc8ae205b8a299dfa1f529","observation_id":"394abdd7-54b3-4080-9943-387398e2fff4","resolution":{"observed_at":"2026-07-03T00:17:29.343222Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:10416ee09ad3a69d7c63d2038343b606780540d84d7d186cf53251d02b872315","observation_id":"7806b32e-a81c-4bf1-9514-26d4adc8068b","resolution":{"observed_at":"2026-07-02T22:17:25.645023Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.17952","last_updated":"2026-06-16T14:05:41Z","snapshot_observed_at":"2026-08-06T11:31:55.903888Z","submitted_at":"2026-06-16T14:05:41Z","title":"SoftMoE: Soft Differentiable Routing for Mixture-of-Experts in LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T01:58:01.787208Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.17952"},"observation_digest":"sha256:ffa398311277423d157163a597dec478464831a7bf7fde08734929a2dc2511c2","observation_id":"18ea6396-a373-4726-b911-41f8a93da109","resolution":{"observed_at":"2026-07-03T19:08:50.551554Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.21033","last_updated":"2026-06-19T01:56:25Z","snapshot_observed_at":"2026-08-02T10:50:07.505622Z","submitted_at":"2026-06-19T01:56:25Z","title":"MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T13:12:03.271949Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.21033"},"observation_digest":"sha256:de8cd01f821c0f21976f66d4bb3966975ba1833fae4e3f298a1ad513191abef5","observation_id":"51745c41-ebb0-4bff-ba82-c6ddeafc875b","resolution":{"observed_at":"2026-07-04T07:39:38.930459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-08-02T19:24:45.644999Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":221,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:4205953910429de407618e8e2ac4ca411f3008fbc6381d2e8b1ff2964cdf1201","observation_id":"a7ea1e7f-eed7-47c9-a8db-fbe42f46d9db","resolution":{"observed_at":"2026-07-04T06:29:38.254281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.21645","last_updated":"2026-06-19T17:56:44Z","snapshot_observed_at":"2026-08-05T10:02:01.473600Z","submitted_at":"2026-06-19T17:56:44Z","title":"Behavioral and Representational Evidence of Binomial Ordering Preferences in Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T14:18:11.215278Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.21645"},"observation_digest":"sha256:93ccb65fc125421a34dd225c71a51409c9ee3d125a7e54d0b513d5790474192b","observation_id":"4e24b3df-a49d-4090-9189-7cfb8642b5a4","resolution":{"observed_at":"2026-07-04T06:39:37.835952Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2606.31201","last_updated":"2026-06-30T06:31:18Z","snapshot_observed_at":"2026-08-02T03:54:14.311295Z","submitted_at":"2026-06-30T06:31:18Z","title":"ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T06:15:35.508989Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2606.31201"},"observation_digest":"sha256:5b7dc534e2b754e9009856fdbcad88deefc28d5f7b7bc84659ae40d694babe8a","observation_id":"93b6c390-a2c0-4ea1-9390-8d1ea24fa08d","resolution":{"observed_at":"2026-07-01T09:45:40.099562Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2607.01061","last_updated":"2026-07-13T08:49:10Z","snapshot_observed_at":"2026-08-06T06:09:28.125347Z","submitted_at":"2026-07-01T15:24:06Z","title":"Agentic generation of verifiable rules for deterministic, self-expanding reaction classification","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-02T12:19:23.229663Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2607.01061"},"observation_digest":"sha256:8c9bfdea5175114254969bf391487e34ba6034f53336191605b00bdd43281a3e","observation_id":"24d06b4a-55c6-411a-bcd6-587d334f92b3","resolution":{"observed_at":"2026-07-02T12:26:56.195693Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-12T00:40:49.755070Z","title":"@@@@\", \"!@#¥%","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03688","last_updated":"2026-07-04T03:43:38Z","snapshot_observed_at":"2026-07-12T00:40:48.705893Z","submitted_at":"2026-07-04T03:43:38Z","title":"PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:40:49.755070Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2607.03688"},"observation_digest":"sha256:5c56a89d2b0ab357046c4c82cab488898e0ba4f601be6a74acdff9e55367e45e","observation_id":"824a20b1-8931-4e27-abdc-6590df53fbb5","resolution":{"observed_at":"2026-07-12T00:40:49.755070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":"2202.08906","doi":"10.48550/arxiv:2202.08906","metadata_source":"pith","pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-07-11T03:27:46.863255Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","venue":"cs.CL","work_id":"b7581741-3f43-4528-a7d0-3af9e51a4d9f","year":2022},"citing_paper":{"arxiv_id":"2607.06601","last_updated":"2026-07-07T00:12:46Z","snapshot_observed_at":"2026-08-01T16:41:37.087537Z","submitted_at":"2026-07-07T00:12:46Z","title":"TriRoute: Unified Learned Routing for Joint Adaptive Attention, Experts, and KV-Cache Allocation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T03:21:01.687528Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2607.06601"},"observation_digest":"sha256:a2f8db68dea4d14f98fcaae66d1c66feeab50bed1eedba830f7d3e2060eac704","observation_id":"a43205cb-f2bf-4834-9110-62da85b0a662","resolution":{"observed_at":"2026-07-11T03:27:46.886389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2202.08906/citation-record","integrity":"/paper/2202.08906/integrity","json":"/paper/2202.08906/citation-record.json","paper":"/paper/2202.08906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:06:48.300828Z","title":"Neural computation , volume=","venue":null,"work_id":"9ec8c37b-ee21-4936-93b8-fb116d144528","year":1991},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:8a9d622f2117daf2f259434e6cadf852a00ced3c56941150e19624a7f4da24f1","observation_id":"7e3bbc03-701a-44ee-a12f-7f9895f4fec7","resolution":{"observed_at":"2026-05-12T23:14:26.239053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.522161Z","title":"Neural computation , volume=","venue":null,"work_id":"2d5bc52c-d63a-4e81-90da-7367880e5e42","year":1994},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:bfe4c6ced4d87f419cef68803e3a736fc79335bbba87b6b17f1feb2bae1d3162","observation_id":"c0363d08-b2a0-4725-a753-1cbdbc2084f1","resolution":{"observed_at":"2026-05-12T23:14:26.247633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"12th \\ USENIX \\ symposium on operating systems design and implementation ( \\ OSDI \\ 16) , pages=","venue":null,"work_id":"156ae981-f571-4b55-9a41-0956fd9f7450","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:550508b4d57f8de9f8d4516d58bd67bc2cad5939f999c10250af19b7ef7f538f","observation_id":"f849d6ae-4b34-4c3a-a23b-54f157af91df","resolution":{"observed_at":"2026-05-12T23:14:26.251253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"df0dc6dd-4bb8-4a22-8a04-00de3a66f7a3","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:9cbf8b5905227e21a5b361c5ab0974b2d47e5d7d9f0b22ecfc22ba6ea7a1e687","observation_id":"a2085c12-55ba-4afb-bee5-546fa20966f8","resolution":{"observed_at":"2026-05-12T23:14:26.254989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:52:44.794849Z","title":null,"venue":null,"work_id":"0a388dbd-6afd-465e-a308-f4f9e5469cbb","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:c32a7a67924db73af11dcaec0f38fd0c416467ac1c7f15d9fbb52011573601e8","observation_id":"046081d6-cb00-48a6-b50a-38a360bbfedf","resolution":{"observed_at":"2026-05-12T23:14:26.259175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 44th annual international symposium on computer architecture , pages=","venue":null,"work_id":"f1b612cf-b36a-49f2-a653-d3a05af55849","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:cd42689d43046a79b916f19b8b388a6ea4123182acd0be42a826e482f00d5337","observation_id":"f92ff7fa-75bf-43ab-a389-50be7ea7ea01","resolution":{"observed_at":"2026-05-12T23:14:26.262772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"a9586b21-4ba9-45bf-9763-8b99915a0fff","year":2013},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:3b795cbb5e570650ae70c9512e0306ec47d94ae242cc1476fee8b1f5e3742304","observation_id":"c40bc2c7-cefe-4a51-90dc-7b2bed2ba33b","resolution":{"observed_at":"2026-05-12T23:14:26.266523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:42:44.000479Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"35543f21-3d84-4b03-9c92-cd5d72edf6d1","year":2015},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:0b50ab7622726427849fb5c86ea2ff45d5a24aec0ebeec2f1aabad0b79c097c9","observation_id":"bfd594c5-8615-4b20-83f8-c2c3d8cece66","resolution":{"observed_at":"2026-05-12T23:14:26.270328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:42:49.820847Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"6f52ce35-43b2-42d9-b3db-f0069783d0c1","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:e85c25d5f6d6a4bea88a63cf99cdd6268349c3df1418ddebfc98ed7e82cdcbd5","observation_id":"c72ca70a-1a47-4b78-9cfe-6dc9c479fad7","resolution":{"observed_at":"2026-05-12T23:14:26.273543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google Cloud Blog , year=","venue":null,"work_id":"ea6a1464-a3a1-4db3-81e5-b2f209c05f34","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6becad21c60d5c941911981d173e744b0bfb3b6bc440659089c5a76143028be1","observation_id":"31a08be5-1f84-4df6-86eb-c5c0633cef05","resolution":{"observed_at":"2026-05-12T23:14:26.278234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Google AI Blog , year=","venue":null,"work_id":"c6fd1d4b-ba50-46ce-a501-96e77446e77f","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:9ff034d077833ef02513d430c25918ed5ae416ea9a588527f586634e5d388de1","observation_id":"97c24351-1235-411b-8ead-26e491a68e21","resolution":{"observed_at":"2026-05-12T23:14:26.281252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b4274670c536613c6f37a9f224703948e672bc7295acc49c593d3681fc929513","observation_id":"2e94748d-dfa3-455c-8952-358d3e5f415e","resolution":{"observed_at":"2026-05-12T23:14:25.876204Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8e09bb6e-e7bf-4fb7-b783-b904b42cbb7d","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:90d544ec941c8ec94644cb20e92ae88f8c365d3eb088e5f192964901e9903df9","observation_id":"8f973cee-11f0-4ce5-b103-b3f437dda023","resolution":{"observed_at":"2026-05-12T23:14:26.284495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"d48c7773-8bf3-4532-b506-84cb1f6ce70e","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:462229111a8567bde1269d8411f01086c9e0cb5ed332c0348769265c45cc90d5","observation_id":"c92bd85d-2009-45b5-83fe-cc4b21f1a839","resolution":{"observed_at":"2026-05-12T23:14:26.288031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"5c83b242-808a-432a-aaf3-4540b41c6c9c","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b8f51841bbf900220bf028880c6aaa7c70d71723c7f96398edfb2a52647981bb","observation_id":"ca3bc2e3-f78b-44d2-826c-6cd3952783e4","resolution":{"observed_at":"2026-05-12T23:14:26.291585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Krizhevsky, Alex and Sutskever, Ilya and Salakhutdinov, Ruslan , biburl =","venue":null,"work_id":"6e651a28-8fab-4d92-8ad7-66e0a23eac43","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:991bde70994f45e3cb3646d6f0ab6ec97fe92b1f853ed8361385fe7e13a3e64f","observation_id":"e307b0e9-6a47-4d11-9d0c-410a2d08ddf8","resolution":{"observed_at":"2026-05-12T23:14:26.295256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"50b52648-d509-46c2-b5cf-3079c57c1cf6","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:9666faad25a6f2167d6831cc44f5710782442b69b828f5846d714c9fc7754779","observation_id":"69aea647-1efe-4a7c-9cd2-ee5975d77891","resolution":{"observed_at":"2026-05-12T23:14:26.299877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"e164c6c5-855f-4d29-9ae3-908eb3465310","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:68334012c3570aee68519e2b386151873f98b943285dd5a75d7c53cc0f1e0724","observation_id":"5160ce8b-7f9b-458f-9bf6-b1307c664e0f","resolution":{"observed_at":"2026-05-12T23:14:26.303760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.14062","last_updated":"2021-01-08T07:41:50Z","snapshot_observed_at":"2026-07-06T09:42:23.296738Z","submitted_at":"2020-07-28T08:34:04Z","title":"Big Bird: Transformers for Longer Sequences","version":2},"cited_work":{"arxiv_id":"2007.14062","doi":"10.48550/arxiv.2007.14062","metadata_source":"pith","pith_arxiv_id":"2007.14062","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Big Bird: Transformers for Longer Sequences","venue":"cs.LG","work_id":"605bd800-a1a3-4bcc-b188-604145af1773","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2007.14062","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:aaef053814b429486d014107730f705ebf4aeb7e7b4c857fe347a4b98536c51b","observation_id":"ba54f5b2-61bb-4d2c-abcc-48df3c3e89da","resolution":{"observed_at":"2026-05-17T01:54:01.139247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:04.522608+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:04.522608+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:fefecb5e72ed7609f519bc5f0ed29605455c1f62e40a53cbf2c8ad15ba97614c","observation_id":"ea891404-2b92-42a4-bffa-bb49cf382547","resolution":{"observed_at":"2026-05-12T23:14:25.821498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching Machines to Read and Comprehend , url =","venue":null,"work_id":"8ba217de-863b-4edd-b10b-65c01bd31deb","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:8b1627bd9fa14f8dffdff958d9611513de0ba1f98ee3a6eb27dbfabffca36f68","observation_id":"d2edb82d-0c23-478e-acbf-a88d2db0481f","resolution":{"observed_at":"2026-05-12T23:14:26.307192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"faaf8c7a-4886-4bf5-a560-a655209c85df","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6d685743046948e2cb5000a0a75eb750b348a4472ed9fe0da7e78cc504d6e53a","observation_id":"38367276-de34-434f-9573-df597902348f","resolution":{"observed_at":"2026-05-12T23:14:26.310562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:27:04.772485Z","title":"Communications of the ACM , volume=","venue":null,"work_id":"9088adc6-18d9-49fd-bd7b-a5b920a02fc8","year":2009},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:fd604e8f901a6f7c9d5b3caee6ea617e8bad8231971b2fd002795086b9dc7692","observation_id":"309ec290-95df-4770-b408-537ea5012428","resolution":{"observed_at":"2026-05-12T23:14:26.313913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.236076Z","title":"2020 , eprint=","venue":null,"work_id":"1a5d14cc-ecd6-416e-822b-ebcb198535ce","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:7c480ec845cda978571bb3919c5e493e657fdbadffe4511a600e60e5e93589c3","observation_id":"61724017-51e8-4d95-bc24-fd4160263634","resolution":{"observed_at":"2026-05-12T23:14:26.317145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"88ba21c5-644d-4294-a897-37521f516d78","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:51ed2225520ff4b8728a50c3087d42ab7f1b13036e1156e261c716da4f0f5cb0","observation_id":"2e0def31-2cd3-45a6-834f-b069d02ba8d8","resolution":{"observed_at":"2026-05-12T23:14:26.320762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-04T14:30:44.904839Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"1706.05098","doi":"10.48550/arxiv.1706.05098","metadata_source":"pith","pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","venue":"cs.LG","work_id":"2c849184-06ce-40df-8143-ec29eb925f39","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:948b2f568683ad01bae1c6980aeebe139199c814cc0181a1b5b38042f69c2e2d","observation_id":"8e6f611e-4995-4060-b03c-7508818ba72e","resolution":{"observed_at":"2026-05-13T09:50:25.566913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":"1804.07461","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-07-04T09:19:44.134394Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","venue":"cs.CL","work_id":"1bb6fb0c-482d-43cf-94a8-ed18f72a5563","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b6c88afbc51a48902dfdbf50da4933094e5f1c0041bcd8a7f7a8f56bdd77bea2","observation_id":"f99fd7fc-3e73-4cfd-a0ce-3a6caa6de942","resolution":{"observed_at":"2026-05-12T23:14:25.793609Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"dd307b3f-2732-40df-96c0-3b25ceccd534","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:62c5c81b4985ff711834b5097bd03df1293a146eb8a399b7bf0e1cba5940334e","observation_id":"2fa18507-2516-46ea-9d49-5ba503e92f8f","resolution":{"observed_at":"2026-05-12T23:14:26.324870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"0a009b59-5090-4a96-8b50-47d277712513","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:f90cadb18cf1dff237f342da24e755109b5ad6f81b5b52b6ad3e60fe204bcf8b","observation_id":"7fe897d7-f2ca-4d7c-9c36-0b71110079e2","resolution":{"observed_at":"2026-05-12T23:14:26.329810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cloze procedure","venue":null,"work_id":"a4cbd99b-b22c-42eb-af11-23676bbe794d","year":1953},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:e267a3b58fd4f213c8d5c790b7bf171380fab34bcf78c7e3ef816198bd61c9ad","observation_id":"ebc0be28-0177-40ea-9094-e2a23021e923","resolution":{"observed_at":"2026-05-12T23:14:26.333076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06489","last_updated":"2020-09-21T22:58:12Z","snapshot_observed_at":"2026-07-06T09:55:28.543635Z","submitted_at":"2020-09-14T14:49:10Z","title":"The Hardware Lottery","version":2},"cited_work":{"arxiv_id":"2009.06489","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.06489","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Hardware Lottery","venue":null,"work_id":"535254a9-16a9-4579-b503-b6ddaafd09b8","year":2009},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2009.06489","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:7e43f622410f103c9792fc6d40505d28fafc2027134fe634c20109593a3b19e2","observation_id":"080aada6-2d58-46f5-9f71-69e86f82f1cf","resolution":{"observed_at":"2026-05-12T23:14:25.596054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"5decc901-2edf-45bf-a107-009d781dba81","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6c3a4729391a92404cb649a214a0493d3249c3caea7a7baf2ba529cada0ca988","observation_id":"8765c9ff-468e-4eaa-ab30-c5413ca67488","resolution":{"observed_at":"2026-05-12T23:14:26.336479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:12:50.928371Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"7ffb0a42-d4b0-4a4d-9507-e85319b86fcf","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:3b1cf45c99eeb9f2b131873c732563a5fb9bf5ab8cfaa0b204bd87c87782f94e","observation_id":"f11c9fca-fe1d-41d6-bbd0-d20baad0d1fc","resolution":{"observed_at":"2026-05-12T23:14:26.340507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2013 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"112d2e96-1421-45f9-b75a-2e56e687b0f7","year":2013},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:d2e9bd1fbc7f71fc455bd88b4392c39e4e8f6f8bc61a8d98eb3d766b633f7437","observation_id":"fdbdb093-39e0-46ec-aa2e-0c0b04697e41","resolution":{"observed_at":"2026-05-12T23:14:26.344787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:25:40.338364Z","title":"Neural computation , volume=","venue":null,"work_id":"4914089f-a9c3-4c65-9a48-040e9ec189be","year":1997},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:37999590894d511b6187dbaa057c0d4d6e2e11008dd720f3bd30096e66bdcf45","observation_id":"0c547233-892f-472d-a2f0-d0da97e16830","resolution":{"observed_at":"2026-05-12T23:14:26.348186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:2c739899e0c5d6b78a47f20a00b9c6a375ce3c73c1c0823c14a79a1b75964277","observation_id":"17e7fe4c-28a3-4d1a-91ac-b9c3cece5104","resolution":{"observed_at":"2026-05-12T23:14:25.906150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b527bcc259a4b93b978ac903b3aa53146e5997f0ef4441bc372d818d058e8457","observation_id":"c0c9a629-8755-44d9-8b5b-8da5af7565e5","resolution":{"observed_at":"2026-05-12T23:14:25.954005Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.01239","last_updated":"2017-12-31T14:53:00Z","snapshot_observed_at":"2026-08-05T10:32:12.591894Z","submitted_at":"2017-11-03T17:07:51Z","title":"Routing Networks: Adaptive Selection of Non-linear Functions for Multi-Task Learning","version":2},"cited_work":{"arxiv_id":"1711.01239","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.01239","snapshot_observed_at":"2026-07-04T16:29:57.598718Z","title":"Routing networks: Adaptive selection of non-linear functions for multi-task learning","venue":"cs.LG","work_id":"eb94db35-3670-4bc2-aa23-a06cea28978e","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1711.01239","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:70ed7ca93488b70635dbab0ad5013f2d5687eb1f3df917d84ef2049aa1ec7869","observation_id":"440f3928-87be-4a0b-8185-71498a334d10","resolution":{"observed_at":"2026-05-12T23:14:25.961090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c56365f2-70bf-431c-b2b2-fffd4dd03f1e","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:957781768286559efe79ec2a291800d457382c4ea18ccefce01659a7544be851","observation_id":"7324901c-1709-4911-8a29-2a5e949dcf10","resolution":{"observed_at":"2026-05-12T23:14:26.351282Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-02T18:12:03.258298Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":"1806.03377","doi":"10.48550/arxiv.1806.03377","metadata_source":"pith","pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","venue":"cs.DC","work_id":"335ca03b-43f7-43d8-af32-3eaeb6735100","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6f1fb2667696eb2609dce4879699637bff1703b0bd909bee7afee232e20c8b25","observation_id":"af61a47e-b27d-4f06-98ad-f7133b7bbb2c","resolution":{"observed_at":"2026-05-12T23:14:25.548820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13239","last_updated":"2020-09-28T12:07:10Z","snapshot_observed_at":"2026-08-02T01:27:39.748968Z","submitted_at":"2020-09-28T12:07:10Z","title":"Scalable Transfer Learning with Expert Models","version":1},"cited_work":{"arxiv_id":"2009.13239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.13239","snapshot_observed_at":"2026-07-04T07:39:38.946418Z","title":"Scalable transfer learning with expert models","venue":null,"work_id":"4ebaba01-613e-48e9-8693-1e9958516aa7","year":2009},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2009.13239","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:61483f9355d416b4cdcb71fe63b6a0035a4361c94b630ab9b370f4b1ab6f33a2","observation_id":"be5eed83-9bd3-4ee8-a33e-4b405319fad7","resolution":{"observed_at":"2026-05-12T23:14:25.563954Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.7362","last_updated":"2014-06-28T06:45:51Z","snapshot_observed_at":"2026-07-06T03:47:30.453630Z","submitted_at":"2014-06-28T06:45:51Z","title":"Exponentially Increasing the Capacity-to-Computation Ratio for Conditional Computation in Deep Learning","version":1},"cited_work":{"arxiv_id":"1406.7362","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.7362","snapshot_observed_at":"2026-07-04T07:39:38.911186Z","title":"Exponentially increasing the capacity-to-computation ratio for conditional computation in deep learning","venue":"stat.ML","work_id":"c9cccf2e-67bb-400d-bdde-a83709d9c660","year":2014},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1406.7362","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:e7ce659fe32ef16d977efb6628d96d5af6a9b2a4bdede5890f0fa732e72069e4","observation_id":"f7665a65-a854-4b4e-a767-d0beb4e6130c","resolution":{"observed_at":"2026-05-12T23:14:25.570470Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":"2001.04451","doi":"10.48550/arxiv.2001.04451","metadata_source":"pith","pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reformer: The Efficient Transformer","venue":"cs.LG","work_id":"eb3dbae4-931f-40ab-a37b-507a35f42712","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:38800e267250ed8a5fb54b6d9e2e8084ad9f17885bebcd048bbf8f3ef4631a62","observation_id":"17037839-5876-4d38-a62d-275a9e5057c8","resolution":{"observed_at":"2026-05-13T07:22:03.298150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:50:01.947571+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 30th on Symposium on Parallelism in Algorithms and Architectures , pages=","venue":null,"work_id":"e711c3bd-96b2-4efd-87a3-d517cef6330d","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:d7debaa8c8d17b29f1f1c4661938c1827e17f57ff49b916fc92bb959c1ddabed","observation_id":"d8a68cf8-bf36-4708-9a50-4dc9e4243986","resolution":{"observed_at":"2026-05-12T23:14:26.354649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c204cb8-24b0-4473-94b8-00358d7e34e9","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:7af4e618c9c8b0f81cb265174003283a2222a0ff8da0109a490ca5e2218da3cb","observation_id":"c20f4504-2af2-4e5b-92ec-9defdbfe8164","resolution":{"observed_at":"2026-05-12T23:14:26.357434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10901","last_updated":"2020-08-31T18:35:07Z","snapshot_observed_at":"2026-08-04T00:53:01.714540Z","submitted_at":"2020-06-18T23:59:11Z","title":"Sparse GPU Kernels for Deep Learning","version":2},"cited_work":{"arxiv_id":"2006.10901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.10901","snapshot_observed_at":"2026-07-04T09:29:44.177417Z","title":"Sparse gpu kernels for deep learning","venue":null,"work_id":"3ba7ed80-9b2d-41d3-b96b-8c1176f88d8f","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2006.10901","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:4ca230a5e3e548b0b789b360a528cf8e11b4e635457f822aba04038b8aab559f","observation_id":"6e744918-0599-43ed-830c-0fc7b71b6ab1","resolution":{"observed_at":"2026-05-12T23:14:25.654291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08435","last_updated":"2018-06-25T19:45:25Z","snapshot_observed_at":"2026-07-06T06:24:56.718110Z","submitted_at":"2018-02-23T08:20:23Z","title":"Efficient Neural Audio Synthesis","version":2},"cited_work":{"arxiv_id":"1802.08435","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.08435","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Neural Audio Synthesis","venue":"cs.SD","work_id":"6ec315aa-c0bf-46b3-bf59-fb7f287235b8","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1802.08435","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6b075360d0aa445f70ad48fbccf07454390159c6ccc6a3fd9b0634d1364351ad","observation_id":"f176fb34-9c9b-4f61-b653-f3e2a21162e3","resolution":{"observed_at":"2026-05-12T23:14:25.666215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02243","last_updated":"2019-06-05T18:40:53Z","snapshot_observed_at":"2026-07-06T07:58:15.564292Z","submitted_at":"2019-06-05T18:40:53Z","title":"Energy and Policy Considerations for Deep Learning in NLP","version":1},"cited_work":{"arxiv_id":"1906.02243","doi":"10.18653/v1/p19-1355","metadata_source":"doi_reference","pith_arxiv_id":"1906.02243","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Energy and Policy Considerations for Deep Learning in NLP","venue":"cs.CL","work_id":"33ac678f-b75d-4caf-b8a6-9a4d65b1748c","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1906.02243","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:677109103d7d03a23d1351ac560586c9c2fd588d8da98d295f0ae48bc088d810","observation_id":"353184c9-acbf-4f95-b2fc-e8ff7e770f4b","resolution":{"observed_at":"2026-05-12T23:14:25.673836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:12.114132+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:12.114132+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"9a724a5b-1c50-4a73-966b-50abd8bed62a","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b0d203ab64171c58cead48fc041d7424d6e16ad45a92e08f8a0fc0551d7edb95","observation_id":"2e458b79-79a4-4b75-9dac-b7c65320f67f","resolution":{"observed_at":"2026-05-12T23:14:26.360769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":"2002.08909","doi":"10.48550/arxiv.2002.08909","metadata_source":"pith","pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","venue":"cs.CL","work_id":"a397ddf8-b0b7-4e32-9d59-fb6ea67ac287","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:4739ff87ca79863f16d988711b694faf25079626e98d3fee3383041b70134a5c","observation_id":"1cb9a8f0-ffb6-488f-844e-5f9afc84e146","resolution":{"observed_at":"2026-05-15T09:59:16.231557Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bulletin of the American Mathematical Society , volume=","venue":null,"work_id":"4db6429f-0d4a-4188-b1ef-4993257f8d1f","year":1952},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6f4fca537cca056ba6b0a4d247864d0c6865edad3d18ab6e4344562ab6f92f89","observation_id":"574dcda9-3fd9-4e09-9aa6-ed2b056ce439","resolution":{"observed_at":"2026-05-12T23:14:26.363466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":"1910.02054","doi":"10.48550/arxiv.1910.02054","metadata_source":"pith","pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","venue":"cs.LG","work_id":"c5e9ad7b-c11d-43b7-b02d-c46d74a77fa9","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:45e0a91dfe3a7a43db34f15e6126c1e15888c7b844ad9d97e6655a7a369b3372","observation_id":"5a9965ca-f18b-4f79-8d81-4fe94c11d65d","resolution":{"observed_at":"2026-05-16T09:24:35.924862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.137438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"7f32bd7f-92cc-46e9-bc54-2ff6d9c639c5","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:59d7428a17636dfd33e9f62f70c1179022b10ab0481d3532e1ccf168576f0aca","observation_id":"fa892273-36d0-4798-828e-8002fd543365","resolution":{"observed_at":"2026-05-12T23:14:26.367698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icml , year=","venue":null,"work_id":"6337894b-1445-4b82-8532-aa44eea2ba9d","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:eae4773a8d78b9777abbafc9675c2538ece6b9a587dbd18af88be25a3d1ff556","observation_id":"478c2168-909e-44ac-8dbe-9c5d0d9befd7","resolution":{"observed_at":"2026-05-12T23:14:26.371474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"2646b993-265b-4728-bd4b-496a5c989382","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:a87c842ecdaab7f7cdd81b9a50fe3ec770b18f2625cd66a914f9010f648ce539","observation_id":"cd656b2a-7d71-43e9-8543-49bb16ce49c1","resolution":{"observed_at":"2026-05-12T23:14:26.375126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"93362368-9908-4c4e-b7ab-b1a3134e1c71","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:717e2832dd994e06bbfcdc560ab19c5f808aafe1d6d18f8539dd64fc7c605549","observation_id":"6dbc823d-8eed-4679-ab91-27c733945121","resolution":{"observed_at":"2026-05-12T23:14:26.378004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2012 , publisher=","venue":null,"work_id":"cf38322f-ffca-4713-a590-5dff74595028","year":2012},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:827d0014fa7bd26b03172a12425f7850256b67e7f4ac3c25b551718e343f48ae","observation_id":"3f1ba9b3-7b83-4c6e-85cd-cd548218dd0f","resolution":{"observed_at":"2026-05-12T23:14:26.381354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00015","last_updated":"2019-09-06T16:55:20Z","snapshot_observed_at":"2026-08-04T18:25:35.193476Z","submitted_at":"2019-08-30T18:06:14Z","title":"Adaptively Sparse Transformers","version":2},"cited_work":{"arxiv_id":"1909.00015","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.00015","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptively sparse transformers.arXiv preprint arXiv:1909.00015","venue":null,"work_id":"54230e04-4e2f-4c21-a39f-e789f3276949","year":1909},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1909.00015","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:57d876bd1419e9274ff52f7003134bf1252da13e1c084f9c13021b2314850803","observation_id":"5e59fa68-41b9-4f6d-ac3a-5e8ff7e211ca","resolution":{"observed_at":"2026-05-12T23:14:25.533024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07799","last_updated":"2019-08-08T06:58:31Z","snapshot_observed_at":"2026-07-06T07:54:02.817335Z","submitted_at":"2019-05-19T19:43:14Z","title":"Adaptive Attention Span in Transformers","version":2},"cited_work":{"arxiv_id":"1905.07799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.07799","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1905.07799 , year=","venue":null,"work_id":"08e00647-200c-4770-8b3e-fd49def2e288","year":1905},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1905.07799","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:45db1e02f6ccefdb1c46d27ce1e617572e23e316624bb0f6ce8f3f3de41007ca","observation_id":"77d7c5f8-5577-49ad-a511-3c075d008c32","resolution":{"observed_at":"2026-05-12T23:14:25.540984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:03:26.240484Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":"4b2ece61-6892-4f0b-839e-9809b643a6b9","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:e4c8c479b861b0d9e7f8a4041079e5a468d480e0959fc191b90f21881eae285b","observation_id":"a67c2401-44fa-445c-96c8-ef75c3565c24","resolution":{"observed_at":"2026-05-12T23:14:26.384762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"proceedings of Sinn und Bedeutung , volume=","venue":null,"work_id":"dab593b7-1951-4723-a7af-f4b4cd117153","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:34a4006f7c27d1ab8b66633154dd4f1bd25c76a561a8fff78cb2be27a347fe06","observation_id":"133d741e-dce6-46c2-9ef6-ac69cd5b3104","resolution":{"observed_at":"2026-05-12T23:14:26.389945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:16:24.081103Z","title":"2015 , eprint=","venue":null,"work_id":"948c9222-e716-4297-919b-917ed6f56d86","year":2015},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:8fe6188496afd23b26091ff1ef169ad3538dd25e6fbd4df488f8f1db2a6a7c14","observation_id":"625bba96-c63a-4414-91ad-73e36b1673d5","resolution":{"observed_at":"2026-05-12T23:14:26.394278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:33:53.600247Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"52abdbce-5e7a-4446-9127-8b135382ddd0","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:099f0f7d9839b9f64d70154d59bffde97f55c6eda60001ca2b24d75dbcc125f7","observation_id":"6f4b73f0-6a55-44d9-a059-6f21718c3887","resolution":{"observed_at":"2026-05-12T23:14:26.397932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:02.344867Z","title":"2019 , eprint=","venue":null,"work_id":"5f2345fb-4e80-45ca-8971-f128b26375be","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:522b9b5f234fcdeaaad30efe5bb5592d4b2da58e7a208bf012299a693193c41a","observation_id":"17ff3182-2201-44c7-a6aa-4ab1167b29ba","resolution":{"observed_at":"2026-05-12T23:14:26.401601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02137","last_updated":"2021-07-05T16:54:59Z","snapshot_observed_at":"2026-07-06T11:26:04.679324Z","submitted_at":"2021-07-05T16:54:59Z","title":"ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2107.02137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.02137","snapshot_observed_at":"2026-07-04T09:49:44.483372Z","title":"arXiv preprint arXiv:2107.02137 , year=","venue":null,"work_id":"a6d1bbcd-82f9-438e-b837-c250e0bea6d9","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2107.02137","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:4ff8df802dec8a4b249e656a6daa6fa763161298978d22ff82d695ee309ccf6e","observation_id":"713b3523-37ba-4597-83cb-64339082c636","resolution":{"observed_at":"2026-05-12T23:14:25.615889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.789180Z","title":"2021 , eprint=","venue":null,"work_id":"11530843-3714-4451-a7d6-56575bb19fcc","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:04c3235dba43891a88d08bec2728880d6b0406f06fe5e670c1ce573bb017871c","observation_id":"e63850c1-2644-4573-beab-e99549d08d15","resolution":{"observed_at":"2026-05-12T23:14:26.405854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"bf14c497-a89c-4408-9431-68a60521abef","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:912c16d2b7d12351e2e797de701b953f9054d3733147089720cbdabc3b3695a0","observation_id":"8b48262c-c65e-4518-a40e-728e7ead7c5f","resolution":{"observed_at":"2026-05-12T23:14:26.409091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"fc1934f7-54fb-4f0a-ad07-c75f539357d9","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:63a76e0f0ae861eac7cc50acd570ca9a8f36ff7cb61b8b48ba0afa824370880b","observation_id":"f70d6a9b-f9d6-4970-b599-578c7df57eef","resolution":{"observed_at":"2026-05-12T23:14:26.412847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"3cf8bcdb-bdf8-4727-8397-7f4810ee1ae6","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:6450957b96f2bfd84d47fdf3f6393cd6af8f494ebd3178633492b483ec0d7005","observation_id":"78d7d680-2e4a-4d9d-b5dc-248873f1dbaf","resolution":{"observed_at":"2026-05-12T23:14:26.416563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:0dfec0addd44908b5661a63eebabdc0f804307ec34bd94812fb4b5ddc9ddfd9c","observation_id":"c6d16588-711c-4fc6-b067-2f884e1c40ac","resolution":{"observed_at":"2026-05-12T23:14:25.736459Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"51bb813a-285e-41ba-b54b-031ca079e35f","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:161be2e4cb4f6bafecb307b0e4e0aff54b2ea8375923853ee5c4afb7c170924a","observation_id":"c2ec5729-b2dc-4fda-8d40-7684ad782050","resolution":{"observed_at":"2026-05-12T23:14:26.419687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"1183ead8-3613-4e10-9ea1-a84e119630b0","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:34d9a3ec85e6952f520cb0469c7f0ee877339363a533ad6c46a354997db6485b","observation_id":"7cd844c4-690b-4b36-9b80-2b5f9f02c77d","resolution":{"observed_at":"2026-05-12T23:14:26.423100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"5f9af946-d08c-469a-a58e-aad5ac3a1f93","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:c603834e827316563c866731a2e04e55d0184e8bfd6c4480de18a82903574c40","observation_id":"2c9d1f62-593e-4ffb-af41-30db29bd61e5","resolution":{"observed_at":"2026-05-12T23:14:26.426409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"ca8cc35b-6b6e-4f8a-b345-6fe747e989d1","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:44cc6eeb5ba9a45379d96badbf183bd46c045acc3ea23710f750ff3e55da8bb0","observation_id":"58f72aed-bf8e-4eb3-ae46-397f7a3790be","resolution":{"observed_at":"2026-05-12T23:14:26.429437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"f3856339-7e0b-4f02-80b5-e81db5ed84ed","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:cd8c72f39b4b2b6659a8bfd37a49c6f7a93d98e25bc5fdca287120feb0c39f47","observation_id":"b41705c2-d7b8-4237-ba12-cc09241f018b","resolution":{"observed_at":"2026-05-12T23:14:26.432513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"f2fa8c99-fdf4-4088-8075-6985a990b826","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b4f60a5395e2cc89caad67e3d70f677492b851ca4252aec96840fe98d0b35e28","observation_id":"1e7cb09e-aa35-496c-a00e-0af19336fd6e","resolution":{"observed_at":"2026-05-12T23:14:26.435275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"9dc16960-cf25-4896-bc93-adbf763c5854","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:ba87ece56afafc6b7a8c457994708c275fe85fa811dd32a35bb2c05817b4858c","observation_id":"8745b592-a933-40a0-863f-c41a919fa8e9","resolution":{"observed_at":"2026-05-12T23:14:26.438511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"3e2c4061-7bf6-47ae-9a7b-a3fb53156988","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:fe857f6f320e7d97b3702d136b73d3d2e4b21249da65269bc9b5ff7c102975fb","observation_id":"4db36fbd-8806-4bd4-a44a-6e390f21c11c","resolution":{"observed_at":"2026-05-12T23:14:26.443006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"9233520f-f4f0-4a55-8b23-50b50d68876f","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:a3739ecce7687298c1289c7b0d1338648a247c32fbf96223c1adf8c1b909d6bb","observation_id":"77588b18-3670-46b8-9e4e-972ee191e8e1","resolution":{"observed_at":"2026-05-12T23:14:26.446589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining , pages=","venue":null,"work_id":"4dbf561a-c780-4f95-b80c-b0241b3d4e43","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:58558d3196d0abb88a2792e71759157beb44726b40359a2c0a8e49f442d1d182","observation_id":"2117bacb-3f2a-48ae-b602-cbce6ec6b8bc","resolution":{"observed_at":"2026-05-12T23:14:26.450357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"182eb68e-09c4-4dea-8898-a090b8c0ab0f","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:591d999beea81c0814afe336f40021f4324253c64246d10bf3706870d7c25ae9","observation_id":"6382114b-f616-4d22-b0e9-9210ee97b090","resolution":{"observed_at":"2026-05-12T23:14:26.453653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"d4b3690a-6680-4700-88a7-d6968fb98cdd","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:133b9a6db7d682c7621cdb33b9bad787d8b1aa7b8e65823cead76478e669e046","observation_id":"8a6ed10b-7b19-4a99-a730-e7e1ba9e7391","resolution":{"observed_at":"2026-05-12T23:14:26.457514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:c19a808a6bf1f99f2e1ff9cf6c483d90c5e8e9630fc89649c95e1771616dd7d8","observation_id":"c075f1e5-8d17-4429-a42f-23a0a60f8a5b","resolution":{"observed_at":"2026-05-12T23:14:25.556218Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , eprint=","venue":null,"work_id":"c4ae605b-9702-4125-b605-7b2334e945af","year":2016},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:38d0c02d6885039954fe1d09ff8016c146591fd2ee1eb1fe8b7cea153d4ed90c","observation_id":"422f2a7e-2534-474e-9dad-c1427e1acb5a","resolution":{"observed_at":"2026-05-12T23:14:26.461386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"1b4126c0-e237-4de2-86a8-80482cffc154","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:a81a103fc42bd0121588a38723657cd48c3cd4b056a72cc0c02ce7606d92fcb7","observation_id":"6679f094-ae63-4b3b-ba88-35edd4d2569f","resolution":{"observed_at":"2026-05-12T23:14:26.465768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:54.543821Z","title":"2009 IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"0287b3d7-3294-4d36-bdf0-64add6c6c84b","year":2009},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:4f4a2f58bc86df6c32a6361b0a3d374fce1a74009c53abc4a5e1bc8a6f8322e2","observation_id":"eba129fb-671e-423b-8d23-175401890b04","resolution":{"observed_at":"2026-05-12T23:14:26.469593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"5bdc84bc-b0b9-45c6-a3e4-683a482eb03f","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:7a1867bd15abc74e3e7bd70672c36f71349614ac8e549125e3a7f44881049cc4","observation_id":"cc8ccce7-5bad-4dc0-a250-f81b5b85201f","resolution":{"observed_at":"2026-05-12T23:14:25.994993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"a80ee6a8-cf43-4bca-9acf-682e939a8dd1","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:b5a9d2216c9444a651bfcec8b22a279392af84b6e71585f8da4e8b9f2d589907","observation_id":"76e5a90b-b4e1-43e8-a7dc-ea7fc4877389","resolution":{"observed_at":"2026-05-12T23:14:25.999104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"369ed402-b7e0-4fe3-a6e3-3e2122a7d53d","year":null},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:37bb767c962784c1f50799a7590c48d9072dddb193e92d7c68505cc411bed501","observation_id":"141df76f-e23c-4f97-9f33-097fa31967f0","resolution":{"observed_at":"2026-05-12T23:14:26.005619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large scale language modeling with mixtures of experts","venue":null,"work_id":"01d9fa83-2f08-4390-998b-d635f36e4f1e","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:e3ffc70c4830e531f08019d588cdef9020603a599771df2608f403f6d3c1bdda","observation_id":"d0e15952-c481-4d03-9a7d-ddd0c3b6d73c","resolution":{"observed_at":"2026-05-12T23:14:26.009775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:444dc12b3335a353a13c4cd816aa82eeae7144b42fcdb0bb3751347455ffcb8b","observation_id":"aaae6167-36d8-4a44-a802-0cb40e6d28a4","resolution":{"observed_at":"2026-05-12T23:14:25.660180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":"253922de-08b6-425d-b83c-992c6c715438","year":2016},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:a0935b1b078b814629efb281238add6d9445aa63342a3b69a3b586bd2659a97e","observation_id":"2175b0bb-de85-4fef-872e-9a46e61fc451","resolution":{"observed_at":"2026-05-12T23:14:26.015463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic parsing on freebase from question-answer pairs","venue":null,"work_id":"4aeb3b4b-6e56-4fe8-9699-ae5c51bcf210","year":2013},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:606fae4fc7749cea28c78c044abbf97c57561742550fe1f7c8b9b94744eab3db","observation_id":"a9bfbda3-de07-4546-99c9-9310e2de2164","resolution":{"observed_at":"2026-05-12T23:14:26.020215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:538e4379cff1dfad65084ccfe8164a91d158978282633d1898959e5c0468d88f","observation_id":"d63a30a2-41c6-43dd-87fa-a8770229b2a4","resolution":{"observed_at":"2026-05-12T23:14:25.685972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01169","last_updated":"2022-02-09T11:07:21Z","snapshot_observed_at":"2026-08-06T06:53:10.381665Z","submitted_at":"2022-02-02T17:58:52Z","title":"Unified Scaling Laws for Routed Language Models","version":2},"cited_work":{"arxiv_id":"2202.01169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.01169","snapshot_observed_at":"2026-06-28T23:02:46.443329Z","title":"https://arxiv.org/abs/2202.01169","venue":null,"work_id":"949e740d-0982-4912-9de4-d1ce5d953246","year":2022},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/2202.01169","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:bb09bc1ee1d7aa8636ca7a7c678d7d57ab39ab48544d186ba997f74c969c07a9","observation_id":"6596db79-f720-4508-bf26-ec6c578637e8","resolution":{"observed_at":"2026-05-12T23:14:25.718005Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:aeab17b3bc680ce5f9e6bc633998bead85f4be36e2fe9dc9e4da27ca796cd663","observation_id":"0d809d4d-af55-49e5-87b9-5be48f9cfbc7","resolution":{"observed_at":"2026-05-12T23:14:25.724154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language modeling with gated convolutional networks","venue":null,"work_id":"edc81f8a-85cf-4763-92b0-48796c4cd46c","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:4ad3b17e181eb1b159e77d1c7e2e39d4c73d8a438c173b81ec2fe0e593cdec63","observation_id":"3b89347f-9e6c-4e0d-8044-0f2c081af8e6","resolution":{"observed_at":"2026-05-12T23:14:26.024492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The commitmentbank: Investigating projection in naturally occurring discourse","venue":null,"work_id":"0fad69e5-39d7-4aee-8b72-6c0ab8bf170c","year":2019},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:23805b73fa741391eb102996730d09149aa3ba71c03d08d29e8e6bbf905aead6","observation_id":"a986968f-5c7b-4ebb-9e89-2dbd4600d016","resolution":{"observed_at":"2026-05-12T23:14:26.029782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing pathways: A next-generation ai architecture","venue":null,"work_id":"e9586203-0567-4f87-97b8-e5f0054cad0d","year":2021},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:766404e2e802b25368e1ade221f9d2d16b1e9c8bbf10caa9c191388e29a9ed92","observation_id":"2785fabf-a27c-492a-a6ab-a3bff568e4f1","resolution":{"observed_at":"2026-05-12T23:14:26.035050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"f615828a-bb3e-4831-8609-6c8f17eb2981","year":2009},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:ff5315f5428934850a9fa586c51b700664aa8ccf1eb237dbc80475f48fa6c111","observation_id":"1fb93a68-c771-4db2-b991-5c7ceccdccb2","resolution":{"observed_at":"2026-05-12T23:14:26.039579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":21,"parse_uncertain":1,"unresolved":4,"verified_exact":6,"verified_fuzzy":68},"total_outbound_references":175},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 175 outbound references and 100 inbound Pith citation observations for arXiv:2202.08906."}