{"as_of":"2026-08-16T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39dbe018c3d910fb1aace2240c695a4703dfb156848f849fb574ce9280c1ff8f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:32:03.727373Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10530/citation-record","integrity":"/paper/2509.10530/integrity","json":"/paper/2509.10530/citation-record.json","paper":"/paper/2509.10530"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-15T16:32:03.102282Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv preprint arXiv:2101.00027, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.102282Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0af3dcbd234ae3cd8ce83a867cb1857a43161afbc6c57c3c1286edea98b1dabb","observation_id":"b21f112d-6e84-4952-a97d-2b5314cff2ee","resolution":{"observed_at":"2026-08-15T16:32:03.102282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.114581Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.114581Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1668033d85cbad6597df6865ee6c9c03bb074df840b2548837b23f7632bcb119","observation_id":"418fec02-e729-4cc7-b677-502c07e9dccf","resolution":{"observed_at":"2026-08-15T16:32:03.114581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T16:32:03.122984Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.122984Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:90c287a307317ff40a8f456e0a7ea961209bfa39ddfba227b66ee8799738235f","observation_id":"a2cfd6db-3aca-4ed1-a360-c97afcc8c9aa","resolution":{"observed_at":"2026-08-15T16:32:03.122984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.132827Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.132827Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1699c2df72da7cfed7c132b18bc11a2604f982b0666d3bacabd19712c5920542","observation_id":"370dd306-3b37-448e-8b88-6fbb2d425ed9","resolution":{"observed_at":"2026-08-15T16:32:03.132827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T16:32:03.141013Z","title":"Outra- geously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.141013Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:4c217ca240a3d054ccc82b365791960a185019a206147bd15384facdafcf3d53","observation_id":"7f772533-9eaf-4953-b708-019590d4c3b6","resolution":{"observed_at":"2026-08-15T16:32:03.141013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.152543Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.152543Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0e77bf0743546c4e53f30f5cb42d606edfc80839db8b4aa4c32c0ca55102250a","observation_id":"c026a01c-5db7-416b-af46-ef1937360e92","resolution":{"observed_at":"2026-08-15T16:32:03.152543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.161637Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.161637Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:91eabba5c788248cfbe5e0a460747cb2c25609caef533fe4624169013da1650c","observation_id":"07fe1b71-d834-4af7-9164-0fc1304e57e5","resolution":{"observed_at":"2026-08-15T16:32:03.161637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-14T16:17:45.993688Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-15T16:32:03.168149Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.168149Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:3cafefaaaba5f5f075c2463496e79b3884b4fbd5b029abc9cdb2072c5aa887c8","observation_id":"0b9c3a84-db0d-4c4a-a20f-374f2e2e96e0","resolution":{"observed_at":"2026-08-15T16:32:03.168149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-14T16:28:06.194757Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-15T16:32:03.174237Z","title":"Analyzing multi-head self-attention: Spe- cialized heads do the heavy lifting, the rest can be pruned.arXiv preprint arXiv:1905.09418, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.174237Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:8be8def517af8efcf8d07fdaacde03fd9ed69d00e2fb8cba120d768c38baea51","observation_id":"e2464f07-ac6f-458e-b872-bbbfc014d0b7","resolution":{"observed_at":"2026-08-15T16:32:03.174237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.172902Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"c4ae9665-f078-4b76-9bd9-3df992e260c6","year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.181778Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:b5bbcaf243bbdbf3f60fe45b43a26754c168cf503585aa0907c23d931456c120","observation_id":"845cbdcc-ed51-4c1f-bd48-6711d3a0c56c","resolution":{"observed_at":"2026-08-15T16:32:05.178360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.154643Z","title":"Chatgpt: Optimizing language models for dialogue, Nov 2022","venue":null,"work_id":"4cd3c42e-8401-49eb-85cf-4ccb7a0713bb","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.188074Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e970def185ea2d8b0467f12acaa5ef6b1a0fc88fb9c70d88857cdd301521569e","observation_id":"380e7d19-998e-4c41-86d2-dc1cbe62254f","resolution":{"observed_at":"2026-08-15T16:32:05.160707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T16:32:03.196590Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.196590Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:ce65ad4c339e2746eab62cb9a43c6193bb5f2b3e72bf24af3556238ccffefca6","observation_id":"bc83fb04-e1a6-4ac1-905c-270fe3c952d3","resolution":{"observed_at":"2026-08-15T16:32:03.196590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.205921Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.205921Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:25570ce14ca054a88ddbebf6ba61e20c9e1c893cccb10e9bc05504b9024ffd37","observation_id":"e0d0b965-b4b4-4de5-b6ca-918a8a3aaf06","resolution":{"observed_at":"2026-08-15T16:32:03.205921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.117477Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"47c3d594-5b7d-4a68-9ce1-5ee0ba3e4053","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.215508Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1b09a976a94cb0332cf6f36a0f47e99cb91b47fcfb8e9c3f1884ca93b78e02a8","observation_id":"81c2cb9a-e169-4e83-92dc-b58f18f78bbf","resolution":{"observed_at":"2026-08-15T16:32:05.124029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-15T16:32:03.226383Z","title":"St-moe: Designing stable and transferable sparse expert models.arXiv preprint arXiv:2202.08906, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.226383Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:7865db6896ca51dffd851405b594f1ada2293f0d9f390c90ac7bde02c2a5a9c8","observation_id":"722a6d10-20c9-480f-9b15-5bc66e284559","resolution":{"observed_at":"2026-08-15T16:32:03.226383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-14T20:08:44.842157Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-15T16:32:03.233617Z","title":"Dai, Zhifeng Chen, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.233617Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:a737c263099fbc630629ccb6cd71e0adc7002721132aac2f8bfa624e45d28e42","observation_id":"bcdbf71e-4747-4e51-ab4e-fb3743e3a3ea","resolution":{"observed_at":"2026-08-15T16:32:03.233617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.249006Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.249006Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:abb9034fc71337c3ad9fb5c97a8321daebe47c1b3e01b420f165d1813bad5b48","observation_id":"86591840-0333-4746-b4ed-fd9cdb30bf34","resolution":{"observed_at":"2026-08-15T16:32:03.249006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12894","last_updated":"2022-03-16T13:27:44Z","snapshot_observed_at":"2026-08-15T03:04:17.528451Z","submitted_at":"2021-10-25T12:48:07Z","title":"The Efficiency Misnomer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12894","snapshot_observed_at":"2026-08-15T16:32:03.259828Z","title":"The efficiency misnomer.arXiv preprint arXiv:2110.12894, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.259828Z"},"links":{"cited_paper":"/paper/2110.12894","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:43a7e75f1f195813d65beb9684ca1d4614061c0fd2ac87f7dffb44ac94018f9f","observation_id":"72e07bab-da7d-412b-82f1-329f27358bbf","resolution":{"observed_at":"2026-08-15T16:32:03.259828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-15T16:32:03.268556Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks.arXiv preprint arXiv:1803.03635, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.268556Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:bafe255b208482957e6e51553b77c30536b13cac77d03fb95ca79dc0b84738da","observation_id":"b0f5f81b-586a-43af-821e-6494e872ac9f","resolution":{"observed_at":"2026-08-15T16:32:03.268556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.278164Z","title":"Big bird: Transformers for longer sequences.Advances in neural information processing systems, 33:17283–17297, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.278164Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:393e9b8f4207ca11e0c027b222aa8c6f16df0358812cca54f947e5ecf3583c5f","observation_id":"382d5947-2e0c-49bb-bc48-93a6cff44cf3","resolution":{"observed_at":"2026-08-15T16:32:03.278164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-09T15:12:21.086848Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-15T16:32:03.286629Z","title":"Long range arena: A benchmark for efficient transformers.arXiv preprint arXiv:2011.04006, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.286629Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:d69c840297680defb493a754004c00bd40d590e3a71087ba7b100776e2c2d527","observation_id":"990c5cbe-0781-49b6-a3b7-c4fe2765a371","resolution":{"observed_at":"2026-08-15T16:32:03.286629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.064477Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"e62f1be0-d2ae-427f-bf9b-b26fce436524","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.293221Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f949a026584721d0be774c4d5545df5505bf8416e32b5354101a75243af1a54b","observation_id":"7036773e-43d0-4468-a9c7-c562bbda26f5","resolution":{"observed_at":"2026-08-15T16:32:05.070594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:05.030515Z","title":"Sparse is enough in scaling transformers.Advances in Neural Information Processing Systems, 34:9895–9907, 2021","venue":null,"work_id":"8f084227-b11f-45b5-963b-bccb1eac9dd5","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.300884Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f5d4a65ec57ab9d6b2a52f018c554be720d6a1e29069469a6fd805a8b70758f4","observation_id":"9b4d9c3d-c9c6-486e-8b0b-6a74e6c8c037","resolution":{"observed_at":"2026-08-15T16:32:05.041059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.313419Z","title":"Hash layers for large sparse models.advances in neural information processing systems, 34:17555–17566, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.313419Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:8db9f2f7213534e74111e08ff538f8833437715f50216951704cc4e96cedcb7c","observation_id":"a66adfdd-9e1a-4cc7-ae92-830454ea166e","resolution":{"observed_at":"2026-08-15T16:32:03.313419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.988073Z","title":"Synthesizer: Rethinking self-attention for transformer models","venue":null,"work_id":"bc7ecf01-00a0-4e3d-b7aa-b8bed8610e19","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.323430Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:cabd0bab502e3f3f6d4a2c9995180c6f6cf2316d723dcd1d3688cd700da1aa16","observation_id":"62556ec8-19e2-4526-b831-7f93dfe37da5","resolution":{"observed_at":"2026-08-15T16:32:04.994516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.02143","last_updated":"2021-03-19T21:24:06Z","snapshot_observed_at":"2026-08-13T20:05:15.114581Z","submitted_at":"2021-03-03T02:48:56Z","title":"Random Feature Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.02143","snapshot_observed_at":"2026-08-15T16:32:03.332917Z","title":"Random feature attention.arXiv preprint arXiv:2103.02143, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.332917Z"},"links":{"cited_paper":"/paper/2103.02143","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6086cfbd20dcad333c06b04b571ee91cfb67df08fb9a5c3f86f3c9a2f80718e6","observation_id":"0554f798-9c13-4e51-881c-71471344b083","resolution":{"observed_at":"2026-08-15T16:32:03.332917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.340929Z","title":"Skyformer: Remodel self-attention with gaussian kernel and nystr\\\" om method.Advances in Neural Information Processing Systems, 34:2122–2135, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.340929Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:94683ab0d5064f795d8fc26458dabed1fcd882e35ba600681950740d9db4fff3","observation_id":"da608b2d-cd50-4437-8ab0-3fccb3b16c01","resolution":{"observed_at":"2026-08-15T16:32:03.340929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.354871Z","title":"Fastermoe: modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.354871Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1f3b0d1f6a4cd3f46c7ed4d1e4da7fd173c07b852dfb6d92ccfb8a1baae2954c","observation_id":"58f8d87c-1034-4894-a51a-7c7ba397f406","resolution":{"observed_at":"2026-08-15T16:32:03.354871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15841","last_updated":"2022-11-29T00:27:08Z","snapshot_observed_at":"2026-08-14T06:23:10.369442Z","submitted_at":"2022-11-29T00:27:08Z","title":"MegaBlocks: Efficient Sparse Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15841","snapshot_observed_at":"2026-08-15T16:32:03.365892Z","title":"Megablocks: Efficient sparse training with mixture- of-experts.arXiv preprint arXiv:2211.15841, nov 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.365892Z"},"links":{"cited_paper":"/paper/2211.15841","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:ae69d596ecf58115d6cf994a89c06be730344433a2aacec5b09e01150886a9a1","observation_id":"d3dd0fbf-0933-4c95-937e-b3e43f08fe74","resolution":{"observed_at":"2026-08-15T16:32:03.365892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.939176Z","title":"Flex- moe: Scaling large-scale sparse pre-trained model training via dynamic device placement.Proceedings of the ACM on Management of Data, 1(1):1–19, 2023","venue":null,"work_id":"216c933f-94b8-42f3-b0b1-0fb928b0e968","year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.381550Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:228d76290e8d0d3ada453ebc921662a9193464d95892905aa31780973ed43b84","observation_id":"e0d273da-fc0a-4fcb-811e-48df01efc227","resolution":{"observed_at":"2026-08-15T16:32:04.947004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.917950Z","title":"Go wider instead of deeper","venue":null,"work_id":"c1d4587d-76d0-4b3f-a436-c1c465625416","year":2022},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.388315Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:5f5e762ef2f5d49cc1052783fbc94b8c133f44c275a78c9cd0af5e73a48b7c57","observation_id":"89e83ad8-8caf-4f34-9518-5d356499d39d","resolution":{"observed_at":"2026-08-15T16:32:04.923186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-15T16:32:03.398538Z","title":"Albert: A lite bert for self-supervised learning of language representations.arXiv preprint arXiv:1909.11942, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.398538Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:2311f611b00e666c0b1181435d49ba057e5862a2105a27ed056383624f4d8fa2","observation_id":"14c12484-f515-47ff-be29-bd1b956b6f9f","resolution":{"observed_at":"2026-08-15T16:32:03.398538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.406558Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.406558Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:83505592c2d00ac78e7356eddf3118a34b507ad29e618dda637f2399ea0d8e98","observation_id":"9bdc8378-f738-437a-8556-561e68ffe5d0","resolution":{"observed_at":"2026-08-15T16:32:03.406558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-15T16:32:03.413681Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications.arXiv preprint arXiv:1704.04861, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.413681Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:d9ab024d8b7613b0023d9f22d71c1e05f5c6ddb146cc519f1f06fd51213f3169","observation_id":"62fac901-0581-4402-8615-6888bd3ccf09","resolution":{"observed_at":"2026-08-15T16:32:03.413681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.422607Z","title":"Dolan and Chris Brockett","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.422607Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:5ff9a7d12faa60265691a20724cd47076f5a242c58d310369542f9e02feb13ae","observation_id":"22b8ed44-bf7b-4baa-891a-8711216a334a","resolution":{"observed_at":"2026-08-15T16:32:03.422607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-13T17:11:57.530107Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-15T16:32:03.432673Z","title":"Efficient large scale language modeling with mixtures of experts.arXiv preprint arXiv:2112.10684, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.432673Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:fe653c29bee25be6edaaacf9fdf5fca77c87c9c7baf047abba2565ff9380c7a1","observation_id":"21cc405f-e474-4077-9ae3-3fe9aaad2f20","resolution":{"observed_at":"2026-08-15T16:32:03.432673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-15T16:32:03.440111Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding.arXiv preprint arXiv:2006.16668, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.440111Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:11d0b4b295d703fce0d1e58149d6c2e9c42eb8e253b858728b711374ca59616a","observation_id":"d8b27b0d-4fc7-4af9-a25c-c2708bd6bcc1","resolution":{"observed_at":"2026-08-15T16:32:03.440111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-15T16:32:03.462100Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.462100Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:90d1d5684f592619d29934089e7b3081d461b110e6472fb22e1b0b312e3610a0","observation_id":"6f302862-a9a5-4880-bb6a-98b23e3ba248","resolution":{"observed_at":"2026-08-15T16:32:03.462100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T16:32:03.473597Z","title":"Reformer: The efficient transformer.arXiv preprint arXiv:2001.04451, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.473597Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:765a4d0a5b912334dcf42aa602f6d117f821b03ce1c0ac0c3d58c59c92414e87","observation_id":"94e832ac-c52b-4e3c-be74-d4fbef186d24","resolution":{"observed_at":"2026-08-15T16:32:03.473597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T16:32:03.482557Z","title":"Rethinking attention with performers.arXiv preprint arXiv:2009.14794, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.482557Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:244424c7ebba634f66a246c825f317794a96bacd68565738c154c506c69ef28e","observation_id":"923ac743-556d-46f9-a7ea-c4b6c7c65b90","resolution":{"observed_at":"2026-08-15T16:32:03.482557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.505998Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.505998Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:33e1987d0b5b733be00568f409e2dc269fe0d03857746aab45b876e40bfa968b","observation_id":"9c1f67ac-16a8-476c-82fa-13aa06552c53","resolution":{"observed_at":"2026-08-15T16:32:03.505998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T16:32:03.516804Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.516804Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:06a4263e1d936a0c9b304d84efb1a4d63d7a0a1a8aa8bdb4e650236ed9d96ff0","observation_id":"39b74526-d5c2-4629-bf7c-b2179ccb8030","resolution":{"observed_at":"2026-08-15T16:32:03.516804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-15T16:32:03.530148Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding.arXiv preprint arXiv:1804.07461, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.530148Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:9232d935d2f5b896e0833158c287b4d8a5ec164dc7cadbc3da475a959c1692d6","observation_id":"fea4b75b-7025-4fd8-b160-97d4ce5e80af","resolution":{"observed_at":"2026-08-15T16:32:03.530148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.542392Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.542392Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:32e6ad7d106228340b9ccf07a4b7ad8c2680a09d23c2e091e63bb6adf064abd8","observation_id":"67704a54-058a-4ec7-8875-311ae2f4964d","resolution":{"observed_at":"2026-08-15T16:32:03.542392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.836820Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations, 2021","venue":null,"work_id":"3339805a-7002-45e7-b10f-5a68e5fdd561","year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.549030Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f8c7aa36e3b6cb743934a9352ca56fc1838891479dcfda6c467a9e1d64482a49","observation_id":"eb2e7070-68de-4329-a7f9-3679667f5e83","resolution":{"observed_at":"2026-08-15T16:32:04.842222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-15T16:32:03.557780Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese.arXiv preprint arXiv:2306.09212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.557780Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f930bbed326e2f4f2e16a473c78e56a045e5a96763d5d55b4a22da594d35d67c","observation_id":"7767dbbf-f17c-4873-bfe0-d3410182ba68","resolution":{"observed_at":"2026-08-15T16:32:03.557780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-13T11:42:53.314611Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-15T16:32:03.566309Z","title":"C-eval: A comprehensive chinese evaluation suite for foundation models.arXiv preprint arXiv:2305.08322, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.566309Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:f86c1727044935cbb9abb4ad8fe4f42f8a5cb317f7435448a6e33481c911ec6a","observation_id":"4ccf242e-1ea1-4eeb-9979-d6badaa23c22","resolution":{"observed_at":"2026-08-15T16:32:03.566309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-15T16:32:03.573573Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them.arXiv preprint arXiv:2210.09261, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.573573Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:7e6d4c8617b57aba0e3cc53ee9583d55d67679f28a2e1f3f7345d21d4f96a54b","observation_id":"20cff156-4cbb-4f87-9db4-a7e43b3891fa","resolution":{"observed_at":"2026-08-15T16:32:03.573573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T16:32:03.580103Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.580103Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1442a73449920f67730b0eebd31d859aa9347a7727282aa49ff2514d95978c91","observation_id":"ef53fdfa-93b6-4e3a-9271-161471d16a54","resolution":{"observed_at":"2026-08-15T16:32:03.580103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T16:32:03.587345Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.587345Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:790ac1050306f0ce889a37113e85e79879e0c077af3970187a7347e58f8939c0","observation_id":"ebc47581-586c-4aff-8f88-cc0b5bc31742","resolution":{"observed_at":"2026-08-15T16:32:03.587345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T16:32:03.598148Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.598148Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:6f1f0958e6a14c708b8140bd6668b96efd17a19fa8c0ea0f85c2bfef7faeec9e","observation_id":"81b3adbe-ecf5-4878-91fb-9c0b0dc9c85a","resolution":{"observed_at":"2026-08-15T16:32:03.598148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T16:32:03.605123Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.605123Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:d0c898e3d452ad8f6bc5b935b25f71824dae7aa457bfa0f7f0b0349fd99c5dc8","observation_id":"f5338c63-003a-49a5-83da-7e989e0e3965","resolution":{"observed_at":"2026-08-15T16:32:03.605123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.613500Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.613500Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:18886ab0319dd9e5081b6ccc906976866a06921cf22af03ce8d0e54d95c5d892","observation_id":"d36177ae-036b-41b6-8caa-36cf8829469b","resolution":{"observed_at":"2026-08-15T16:32:03.613500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.619572Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.619572Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:4bab379f67d68b657a9c95ef3416fe613df526ce0397384ddd5d11edfd609bee","observation_id":"23e9b094-a44d-403a-a3ec-2ea2b7caa112","resolution":{"observed_at":"2026-08-15T16:32:03.619572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.793188Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":"50045183-e44a-4a0d-ac97-371f36f6fa23","year":2025},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.625468Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0e969561df845113454010d4370d53720be8b1c45aa8acadbd645650397cc942","observation_id":"4aec8be8-f622-4277-958d-21d921fe120e","resolution":{"observed_at":"2026-08-15T16:32:04.798914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.770476Z","title":"The Llama 3 Herd of Models, 2024","venue":null,"work_id":"1339d268-bde9-47c4-94e2-04405f3918a6","year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.631773Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e77334442414b656adcf1f92498d4a97287065e66e2f160a26c40af81c8fd623","observation_id":"5bcd0223-bb1a-419a-9456-10ab6af55da1","resolution":{"observed_at":"2026-08-15T16:32:04.777934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.748678Z","title":"Hewett, Mojan Javaheripi, Piero Kauffmann, James R","venue":null,"work_id":"dfee9b27-afe8-42c4-8094-bae2d810e12e","year":2024},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.640184Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:4c667e9f93782360a15a6d79fe62878fb86e5b38cf8733cb8c00163a8518cab9","observation_id":"37a12c06-9543-4e0c-bb9f-ddcf54f92780","resolution":{"observed_at":"2026-08-15T16:32:04.754191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09844","last_updated":"2018-06-07T14:39:29Z","snapshot_observed_at":"2026-08-14T21:09:29.929249Z","submitted_at":"2017-03-29T00:19:20Z","title":"Multi-Scale Dense Networks for Resource Efficient Image Classification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09844","snapshot_observed_at":"2026-08-15T16:32:03.650932Z","title":"Multi-scale dense networks for resource efficient image classification.arXiv preprint arXiv:1703.09844, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.650932Z"},"links":{"cited_paper":"/paper/1703.09844","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e808ada9eda8036b01fc6edc118a466e43cf04cbc8105a4a0306dc2a80b4091f","observation_id":"8f61c776-484d-4836-ab5f-6d27171eb856","resolution":{"observed_at":"2026-08-15T16:32:03.650932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.664409Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.664409Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:e3753286d9d11d81384958d5d056b4a965710debff1f106cab79e2563420d207","observation_id":"368fc9a0-32e7-48e7-81f4-69853d82ec85","resolution":{"observed_at":"2026-08-15T16:32:03.664409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.714248Z","title":null,"venue":null,"work_id":"5a254687-e912-4953-a175-ecd2755f5610","year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.675879Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:0506701e33f93a8f8fd39853a414dacd51a6c5d55987143294fa3df69e6e0f56","observation_id":"6b4450c4-38db-4f31-b009-ecea4e70e44d","resolution":{"observed_at":"2026-08-15T16:32:04.720488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.694932Z","title":null,"venue":null,"work_id":"195c1144-f0c0-4d7c-9972-10b218e6a5b9","year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.681799Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:9a138e5ad544c293ab4f61369e9956259a2cf3679698a821f8782e0f6d14ad2a","observation_id":"6e7cf706-c3cc-450b-9e5a-57ffaaadb444","resolution":{"observed_at":"2026-08-15T16:32:04.700027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.676353Z","title":"Squad: 100,000+ questions for machine com- prehension of text","venue":null,"work_id":"11fd41de-fbb9-439e-956c-d0eb6201b0e1","year":2016},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.687831Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:93b016f3f274778c3184602558c6ecccce52b7823986d77ad681ddaa3048687a","observation_id":"a72df6b2-87ca-4b4b-a0f8-eb6ad8848330","resolution":{"observed_at":"2026-08-15T16:32:04.681840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:04.655134Z","title":"The pascal recognising textual entailment challenge","venue":null,"work_id":"e5e09d62-6ea4-45a7-a8c2-d4e6096e24a4","year":2005},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.693730Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:053bf2a20909c9b27f0960ca7f0dc3869681e5030a645552e41a561bd8f44bce","observation_id":"f607e9a1-5cd4-4e2f-84d4-3f398bb577c9","resolution":{"observed_at":"2026-08-15T16:32:04.662745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-15T16:32:03.698662Z","title":"Palm 2 technical report.arXiv preprint arXiv:2305.10403, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.698662Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:cdfdc248200b865b8dc49d5f6a3fd5a0fd5d02f687fa77d4a86c8fe4fbf81420","observation_id":"8f91b630-358f-4061-8801-cb20e554f439","resolution":{"observed_at":"2026-08-15T16:32:03.698662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01082","last_updated":"2024-03-13T16:48:27Z","snapshot_observed_at":"2026-08-13T14:50:40.876812Z","submitted_at":"2023-10-02T10:48:42Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01082","snapshot_observed_at":"2026-08-15T16:32:03.704458Z","title":"Linear attention is (maybe) all you need (to understand transformer optimization).arXiv preprint arXiv:2310.01082, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.704458Z"},"links":{"cited_paper":"/paper/2310.01082","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:1960d9d9c2fd96c1e7c7a96cf9897afa6522c3d0bbc3932d69a401d26bf7289f","observation_id":"8a9d747b-9a42-4583-9d1b-02b07b4e6363","resolution":{"observed_at":"2026-08-15T16:32:03.704458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:32:03.714918Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.714918Z"},"links":{"citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:90546be107025fdf0293c544c771004a9263bf92698c59bac6bd26f38d3c6e01","observation_id":"fc30f7b7-3e5a-4e4a-80ed-637a98deb910","resolution":{"observed_at":"2026-08-15T16:32:03.714918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03824","last_updated":"2022-05-26T18:50:20Z","snapshot_observed_at":"2026-08-03T17:35:52.520891Z","submitted_at":"2021-05-09T03:32:48Z","title":"FNet: Mixing Tokens with Fourier Transforms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03824","snapshot_observed_at":"2026-08-15T16:32:03.720600Z","title":"Fnet: Mixing tokens with fourier transforms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.720600Z"},"links":{"cited_paper":"/paper/2105.03824","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:8a934235f7603298ed1e0145c5956c9d5b5219e421cb8f250f7f6995a8023877","observation_id":"440c65a9-df59-4eaa-99f9-ad67e76f2045","resolution":{"observed_at":"2026-08-15T16:32:03.720600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.06993","last_updated":"2018-01-28T17:12:02Z","snapshot_observed_at":"2026-08-14T21:42:53.838437Z","submitted_at":"2016-08-25T00:44:55Z","title":"Densely Connected Convolutional Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.06993","snapshot_observed_at":"2026-08-15T16:32:03.727373Z","title":"Densenet: densely connected convolutional networks.arXiv preprint arXiv:1608.06993, pages 362–371, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T16:32:03.727373Z"},"links":{"cited_paper":"/paper/1608.06993","citing_paper":"/paper/2509.10530"},"observation_digest":"sha256:45cbf49e388befc74eb41cb351da2d2a609b877961daf6952084073ae177bb9b","observation_id":"598c47b0-3365-4852-a613-acafa17a55f4","resolution":{"observed_at":"2026-08-15T16:32:03.727373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10530","last_updated":"2025-09-05T02:49:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T16:25:33.624740Z","submitted_at":"2025-09-05T02:49:15Z","title":"Dynamic Adaptive Shared Experts with Grouped Multi-Head Attention Mixture of Experts"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2509.10530."}