{"as_of":"2026-08-13T09:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dee6a913fd460312c1eb9394f6f6e511ba428f7c62f2a9b4bebf4c82a977294","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:36:22.161515Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T07:09:48.239662Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T07:11:53.241949Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2411.16205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16205","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c63c2fc-976d-4719-bcb0-0a1a4d38a08e","year":2024},"citing_paper":{"arxiv_id":"2604.16930","last_updated":"2026-04-18T09:28:23Z","snapshot_observed_at":"2026-08-11T15:51:22.254006Z","submitted_at":"2026-04-18T09:28:23Z","title":"CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T07:09:48.239662Z"},"links":{"cited_paper":"/paper/2411.16205","citing_paper":"/paper/2604.16930"},"observation_digest":"sha256:c3c6e72eddf2268b585ec46674838df5d497d1e52904acd66bb86960f66188f9","observation_id":"3a1c93c9-6a87-46ad-9b8d-ebeba8ea395b","resolution":{"observed_at":"2026-05-10T07:11:53.243173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.16205/citation-record","integrity":"/paper/2411.16205/integrity","json":"/paper/2411.16205/citation-record.json","paper":"/paper/2411.16205"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2202.01169","last_updated":"2022-02-09T11:07:21Z","snapshot_observed_at":"2026-08-09T22:43:05.276517Z","submitted_at":"2022-02-02T17:58:52Z","title":"Unified Scaling Laws for Routed Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01169","snapshot_observed_at":"2026-08-12T13:36:22.060160Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.060160Z"},"links":{"cited_paper":"/paper/2202.01169","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:de7cce0714130c1da8c151daf234fc91aa4a77430f34fac20ad277de01d634bd","observation_id":"9f772b9f-db1b-4702-acc0-211d23f566d6","resolution":{"observed_at":"2026-08-12T13:36:22.060160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.532697Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"b883f973-a02e-4fbc-9a07-c2ad521ba92e","year":2022},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.066880Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:47236e36ea009e8b9db883a893424184bf475cc184b8c3be38405c685bc2161b","observation_id":"55be5405-1829-435d-ab92-8b65b5b0a414","resolution":{"observed_at":"2026-08-12T13:36:22.538281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.074453Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.074453Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:d7392505352a944ec3acdc0d0ea6a9f9a9bfa5dcabe02dec5f54f3082af448e9","observation_id":"dbaff43e-891c-4416-8036-fd6580c6873e","resolution":{"observed_at":"2026-08-12T13:36:22.074453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T04:34:04.793994Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T13:36:22.080452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.080452Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:8a0f5f6b86775d6808e8fb79049bbf402abbe6584ee503ebe4e81869487c8c5a","observation_id":"92bc78df-b855-43ef-9d3a-6da1f4159854","resolution":{"observed_at":"2026-08-12T13:36:22.080452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-12T13:36:22.087205Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.087205Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:8e7ee3663cfcdc8b89c41eca1baf5bc9ef0b0248b65ee699cd5e03907aa62c1e","observation_id":"3512a424-659b-4d05-8c2c-aeccb0abaf4f","resolution":{"observed_at":"2026-08-12T13:36:22.087205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T13:36:22.094853Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.094853Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:85a76cb03de3546bd3cf28b084867137892572c4bb3556f5667a6752b46cfff2","observation_id":"e40960bd-62b0-4b0e-8396-f6a4bb71df0f","resolution":{"observed_at":"2026-08-12T13:36:22.094853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05820","last_updated":"2022-01-04T06:15:24Z","snapshot_observed_at":"2026-08-09T14:15:42.938765Z","submitted_at":"2021-12-10T20:37:03Z","title":"Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05820","snapshot_observed_at":"2026-08-12T13:36:22.102485Z","title":"Building a great multi-lingual teacher with sparsely-gated mixture of experts for speech recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.102485Z"},"links":{"cited_paper":"/paper/2112.05820","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:9f42348960bd46c34bc6f1ef86f4aafa1b26a2c7666e2a6042bc700ef02d6472","observation_id":"c5d00a8c-1b1a-463e-aefc-eada142594db","resolution":{"observed_at":"2026-08-12T13:36:22.102485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-12T13:36:22.110704Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.110704Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:4f91e7f6f2d3c6f871c25dabbedca21f0d7240b7da1af5dfca0b7c5b4c6ed1b8","observation_id":"ace33193-78a4-4200-afb9-43bb5dc90c2a","resolution":{"observed_at":"2026-08-12T13:36:22.110704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-12T12:22:25.664363Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-12T13:36:22.116961Z","title":"The era of 1-bit llms: All large language models are in 1.58 bits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.116961Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:7e665fe30168bfe1dca98ecaed71e9314c39b7428b65a806f59f059f3d1009f4","observation_id":"db7bfbcd-d3b1-4bb7-a5b9-42a4fd43a481","resolution":{"observed_at":"2026-08-12T13:36:22.116961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15772","last_updated":"2023-10-24T22:59:26Z","snapshot_observed_at":"2026-08-12T02:15:39.886884Z","submitted_at":"2023-08-30T05:41:29Z","title":"Task-Based MoE for Multitask Multilingual Machine Translation","version":3},"cited_work":{"arxiv_id":"2308.15772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.15772","snapshot_observed_at":"2026-08-12T13:36:22.206098Z","title":"Task-Based MoE for Multitask Multilingual Machine Translation","venue":"cs.CL","work_id":"65f0f814-5f7c-4112-83f7-7a6f84b6e19e","year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.122709Z"},"links":{"cited_paper":"/paper/2308.15772","citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:5f134c11e2357526ad1f8f1d897069d3dca29250e9d79028f04d56edf6dcd0d3","observation_id":"008f5eab-48bc-4fc2-a7bc-761799eff79c","resolution":{"observed_at":"2026-08-12T13:36:22.214087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.128726Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.128726Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:e61d3cf8e5796fecebb5e7916403d1441ced25b08b8520cadd3a120affa22ed6","observation_id":"317e6bd1-2d98-465c-a436-3c3c3e857a66","resolution":{"observed_at":"2026-08-12T13:36:22.128726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.481037Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"0002e837-2324-4240-b823-c266409f5f15","year":2019},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.135594Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:d1a6b07314d937cfe02fbdbec9ad2ee0e564a7d9046c4416b7866c220c24afac","observation_id":"f2fe8c18-f4c9-4840-b3c8-5dd8a333a288","resolution":{"observed_at":"2026-08-12T13:36:22.487038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.140800Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.140800Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:a3e081edc8e3431b8221df5d09ab7ea1ef2d9083ce6b7b79b5c4cbd38b648098","observation_id":"81c405ce-8d53-4abb-b2d8-484bd882e0a7","resolution":{"observed_at":"2026-08-12T13:36:22.140800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.448284Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"61a53c70-996b-474f-9f97-e4f26deef921","year":2017},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.145987Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:0fe1be34f93040b72c6fc8067f7652f02533d0493604beeadfd29d02418bc939","observation_id":"6ead7d61-f527-4df4-b62a-9c54c92cab1b","resolution":{"observed_at":"2026-08-12T13:36:22.454163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.150888Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.150888Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:c2eabfc06dd2307911170de9822a4f58e036218ecb73f079f1c1dd14d5ea93b4","observation_id":"21a5d4f9-0246-4e28-b23e-fda064011781","resolution":{"observed_at":"2026-08-12T13:36:22.150888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.417685Z","title":"Multi-head mixture-of-experts, 2024","venue":null,"work_id":"b82b123b-d997-4315-a169-92261a8ffdbe","year":2024},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.156005Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:d4f706cc7bab8f3f0df335fc94ac73e8c9377cf3108ef4aded0e6d314daa9606","observation_id":"27c9b5cb-6aff-4ab6-a9ce-a943f1d78f36","resolution":{"observed_at":"2026-08-12T13:36:22.423691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:22.396984Z","title":"Sparse moe with language guided routing for multilingual machine translation","venue":null,"work_id":"b2cfee10-c3c5-48bf-a990-116a2acd2ff1","year":2023},"citing_paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:22.161515Z"},"links":{"citing_paper":"/paper/2411.16205"},"observation_digest":"sha256:cc1eda099fa35d7b9a33a27a2029518038f093d561e2bfcdbee6b47f53e0463a","observation_id":"cf163fbb-fc4b-4516-949e-008540e77a9e","resolution":{"observed_at":"2026-08-12T13:36:22.404450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16205","last_updated":"2024-11-29T08:48:17Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T13:20:32.910479Z","submitted_at":"2024-11-25T09:05:36Z","title":"MH-MoE: Multi-Head Mixture-of-Experts"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2411.16205."}