{"as_of":"2026-08-14T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdc9c280ebe3a2da2be7e70cbcc492d0704d7151a4a8078defbaf5c8baaf5aaf","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:18:10.327777Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T17:58:10.323354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T06:55:43.518608Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"cited_work":{"arxiv_id":"2411.19402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","venue":null,"work_id":"8253940e-4815-41ca-82f0-b71b4ef0c19a","year":2024},"citing_paper":{"arxiv_id":"2605.04952","last_updated":"2026-05-06T14:15:10Z","snapshot_observed_at":"2026-08-11T00:51:15.346895Z","submitted_at":"2026-05-06T14:15:10Z","title":"Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T17:58:10.323354Z"},"links":{"cited_paper":"/paper/2411.19402","citing_paper":"/paper/2605.04952"},"observation_digest":"sha256:dfaaa0e31395d4d5d52da22facd6208f43ab8c53d7f5a16133068f7d3042e95c","observation_id":"2b288f98-93b1-4f67-b6c0-e60f2a090441","resolution":{"observed_at":"2026-05-09T06:55:43.520404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19402/citation-record","integrity":"/paper/2411.19402/integrity","json":"/paper/2411.19402/citation-record.json","paper":"/paper/2411.19402"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.188979Z","title":"Efficient large scale language modeling with mixtures of experts, 2022","venue":null,"work_id":"f599b74c-019a-4e33-9727-b82e66b2b340","year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.054003Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:6963a8d0935822b0a5252c3dced86d5bd551e6deccade9b556baa127b19e7781","observation_id":"0bf07535-c30f-41f3-a21a-47150f0dc76e","resolution":{"observed_at":"2026-08-12T10:18:11.192620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.058908Z","title":"Efficient intent detection with dual sentence encoders","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.058908Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:f5655122df4d8723034762fc8b8a28bd3e6108464ace18ddba079a19124b6f92","observation_id":"448260a3-2bca-4e4b-972d-11dac7800331","resolution":{"observed_at":"2026-08-12T10:18:10.058908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-05T11:04:54.095339Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-08-12T10:18:10.063584Z","title":"One billion word benchmark for measuring progress in statistical language modeling, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.063584Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:5e1d6ad65426e7d784ca80a00d6ea3a4b11ceb9db73a59533e85f9a8c510b691","observation_id":"efe22ff5-ec38-4543-8405-e4d982a53e82","resolution":{"observed_at":"2026-08-12T10:18:10.063584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.177550Z","title":"Sparse moe as the new dropout: Scaling dense and self-slimmable transformers, 2023 a","venue":null,"work_id":"7ce29c8d-7143-4ec2-af5d-b01fe6aef2c0","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.067998Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:36d1eba0922f3bd6ecacd95c901bb339766e3ad0544d4642e988dab2341b62c6","observation_id":"e4bd61e2-5755-44d1-a716-128ad8d53330","resolution":{"observed_at":"2026-08-12T10:18:11.181478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.165799Z","title":"Learned-Miller, and Chuang Gan","venue":null,"work_id":"c2ee779b-e87f-4f7b-80db-268df1b6092d","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.072312Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:1b994395f48039988a06d3b32e41a255b5ffdf3f34d915595cedd666a4ccb8d5","observation_id":"31b20158-c1fa-4194-9531-cfc4329e5640","resolution":{"observed_at":"2026-08-12T10:18:11.169991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.152813Z","title":"Towards understanding the mixture-of-experts layer in deep learning","venue":null,"work_id":"15de4460-2c2d-4be8-8cad-3ad2aa431a45","year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.076330Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:e4af58c8f17aaf0c687b4f908b4c0a58d05d1c86e0654e603e894e5c88f8b12b","observation_id":"a8834f9c-2ebe-42f8-b314-f5fdba61527a","resolution":{"observed_at":"2026-08-12T10:18:11.156932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.139661Z","title":"On the representation collapse of sparse mixture of experts, 2022","venue":null,"work_id":"f8677527-327a-494c-9680-76deae63330a","year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.080427Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:59794b2f113ee7ba74879982b2374e584ccf4d446054c60787e7b72ffd67fa9a","observation_id":"be6692a3-7e03-4d89-8b86-d7be5f57cb4e","resolution":{"observed_at":"2026-08-12T10:18:11.144413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-12T10:18:10.084159Z","title":"Generating long sequences with sparse transformers, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.084159Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:37c9d86a87b59da49af5bd54fb5543f9f0eca5b22ee118377e7bb841d334cfca","observation_id":"ca46056a-07ae-4117-a0e1-003eb1c3b48a","resolution":{"observed_at":"2026-08-12T10:18:10.084159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.128020Z","title":"An Analysis of Single Layer Networks in Unsupervised Feature Learning","venue":null,"work_id":"74edb834-5896-4d88-921f-5c246eb31a76","year":2011},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.088407Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:33842ba3b016a56cae1f398f367d8ae539916a1eb6df8ae115d84ecb4103734b","observation_id":"047405cb-b2b2-4d26-ab72-d71e695edada","resolution":{"observed_at":"2026-08-12T10:18:11.132196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.115960Z","title":"Stablemoe: Stable routing strategy for mixture of experts, 2022","venue":null,"work_id":"c7f81b9e-d201-4a3a-8117-1f9f19dfbc6f","year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.092360Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:44ceef34d863038cc284d3ee875b349612e03f5ae92b6a63c15238e83b173eec","observation_id":"cfbefab9-4bfd-44ca-9e8b-5f812de3f7f6","resolution":{"observed_at":"2026-08-12T10:18:11.120337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.095886Z","title":"Transformer- XL : Attentive language models beyond a fixed-length context","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.095886Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:92d3634ac40ffe47e03a3a79d5562a5040e10503922c94952ac3134babc2a1f3","observation_id":"d7871579-f38d-4941-a459-0347713b3117","resolution":{"observed_at":"2026-08-12T10:18:10.095886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.103735Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":"81594a87-8c87-4173-ad33-750e84d10c46","year":2019},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.100157Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:bd86dce7d0a4063124d2e4c0ad4af2a17df5e3c10dd841800dd921f9f840e196","observation_id":"23484aa3-f490-4348-bf84-9f8b9cffae01","resolution":{"observed_at":"2026-08-12T10:18:11.107912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-12T10:18:10.103647Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.103647Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:17134c801045e09d1ba6c09b4cd3844713f424f316cba5c48f6d9ef26d302796","observation_id":"9d4f648b-e15b-4c0a-9e28-5fc83d2ee87d","resolution":{"observed_at":"2026-08-12T10:18:10.103647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.107790Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.107790Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:33e7367a9355e02e6da03282bd01b3669a387539192b387c2661638464d706b3","observation_id":"c9b866cc-471a-4cb4-850c-a44f307ef531","resolution":{"observed_at":"2026-08-12T10:18:10.107790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.112155Z","title":"On the benefits of learning to route in mixture-of-experts models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.112155Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:5417614527050b62fe00651ed421308d2213b2982641ddb0f291ebfc5d3023ef","observation_id":"cc5e2895-2106-438d-b0d2-bcb1d8742c3a","resolution":{"observed_at":"2026-08-12T10:18:10.112155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.083818Z","title":"Nguyen, Chenghao Liu, Savitha Ramasamy, Xiaoli Li, and Steven Hoi","venue":null,"work_id":"df430b05-492d-4a3f-87f0-a9da72371717","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.115948Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:f018654ab6f9bdec609e6e5ed67d914ea0e522bd6cff712dd8f9545acb87e5be","observation_id":"8bfd9705-42df-4788-a850-06db7bb18dbd","resolution":{"observed_at":"2026-08-12T10:18:11.088012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15883","last_updated":"2024-06-22T16:10:45Z","snapshot_observed_at":"2026-08-12T23:36:57.414559Z","submitted_at":"2024-06-22T16:10:45Z","title":"SimSMoE: Solving Representational Collapse via Similarity Measure","version":1},"cited_work":{"arxiv_id":"2406.15883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15883","snapshot_observed_at":"2026-08-12T10:18:10.708149Z","title":"SimSMoE: Solving Representational Collapse via Similarity Measure","venue":"cs.CL","work_id":"5f1d05bd-7734-4639-9d50-9510a6c1fea1","year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.119867Z"},"links":{"cited_paper":"/paper/2406.15883","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:65b1e26b6bbfe233de21a9bc141bee3df08af53e7679f46931655e23e68c22bb","observation_id":"da02baf3-ac57-4c92-b477-8c22984074e4","resolution":{"observed_at":"2026-08-12T10:18:10.714559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T10:18:10.125006Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.125006Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:8824b182e8a7f1827819d8cbaee711c5c18c0656c25bdd53004e995c8edcfaa8","observation_id":"37f36431-4f4b-4e02-8a7e-2f93276165ce","resolution":{"observed_at":"2026-08-12T10:18:10.125006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.129473Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.129473Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:f1f30e104145e28bc6812cb8bc8e50af006eebcf005b72792833f42057e0c0a6","observation_id":"d6f09e1c-2485-4792-939e-54385718ad30","resolution":{"observed_at":"2026-08-12T10:18:10.129473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.133284Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.133284Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:c39024aa59e91ec1e08b94ba3f5f921bd355f3de810b1f0b49d6268d2ff8c246","observation_id":"945f9b33-1e80-441a-8d28-ba7acc541a86","resolution":{"observed_at":"2026-08-12T10:18:10.133284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.137032Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.137032Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:c03551a88a8f710117965df36aff6db4efee0cd1800eb4c67a37b16286b9a648","observation_id":"023d236f-f51a-490f-bc76-648115a7e827","resolution":{"observed_at":"2026-08-12T10:18:10.137032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12379","last_updated":"2024-07-04T02:55:57Z","snapshot_observed_at":"2026-08-14T01:02:48.299992Z","submitted_at":"2023-12-19T18:11:19Z","title":"Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12379","snapshot_observed_at":"2026-08-12T10:18:10.141045Z","title":"Kwok, and Yu Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.141045Z"},"links":{"cited_paper":"/paper/2312.12379","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:687f8e45e8b5549892fc76a1d0def11779a5d71ed72d1f36967263efb721fef6","observation_id":"49fb10d7-2997-454a-88fa-a598d0446a06","resolution":{"observed_at":"2026-08-12T10:18:10.141045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.058622Z","title":null,"venue":null,"work_id":"5d12cf24-1c63-4819-a90e-1e56cb840b27","year":2016},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.145040Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:6c20a4af80732fb32be70085bb7885444ad4756fbfa028af1e04b7eef8406b8f","observation_id":"d88d08e6-84c4-4967-8c79-0e120c7ed9aa","resolution":{"observed_at":"2026-08-12T10:18:11.062899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-12T10:18:10.149006Z","title":"Deep residual learning for image recognition, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.149006Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:a3880e64feed68a314583672bf76031e75a86a3aac1b2339e8d1d77aefbe3f18","observation_id":"fdc45329-9379-48f4-bb83-6367a7cea8a8","resolution":{"observed_at":"2026-08-12T10:18:10.149006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.046815Z","title":"Learning discrete representations via information maximizing self-augmented training","venue":null,"work_id":"27cfd233-cc1e-4fa3-aeaf-54027b7a2a68","year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.153120Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:ddec41b9f6a36e9bc10615757f4e6724d7da2597e5d8c833b98a20ee2980fc82","observation_id":"238754f5-1adb-46a8-a638-6101866d8fef","resolution":{"observed_at":"2026-08-12T10:18:11.050969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.034227Z","title":"Tutel: Adaptive mixture-of-experts at scale, 2023","venue":null,"work_id":"41b4e73e-cbfc-40f7-a8ec-4042a73b6053","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.157004Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:df4ddca81f2524ff41720e6f7ceac80fc0d653b4f338552b6a0bfe0a1e657a0a","observation_id":"c7bd1712-662e-43c5-b804-0a9cd99c5d32","resolution":{"observed_at":"2026-08-12T10:18:11.038650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.166845Z","title":"Jacobs, Michael I","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.166845Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:af24396d0d981775cb39d754fa63024e9cdbb4c4b954bdbc1b6727bb8f9f8d07","observation_id":"b0201b7f-dffd-4359-a428-2b55d03dc4ec","resolution":{"observed_at":"2026-08-12T10:18:10.166845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.170396Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.170396Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:adec18d6602bb30fb6d69f7e53fc25d99da2f5727bc21eb6f221f74f91974692","observation_id":"f100a521-24e2-42fd-95d2-82c4db0773c9","resolution":{"observed_at":"2026-08-12T10:18:10.170396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:11.015926Z","title":"Hierarchical mixtures of experts and the","venue":null,"work_id":"27c92870-3170-4fcd-aefc-9aec7a290542","year":1994},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.174184Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:6047227c6c0357cd36be03948551ae9e1eeb353912fe47dee9b7f83240016c77","observation_id":"37822b8d-d5da-4f8d-9a9c-efb1a1df114c","resolution":{"observed_at":"2026-08-12T10:18:11.019869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.177739Z","title":"Challenges and applications of large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.177739Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:75d8d9c09d1876fcd0590fb24088c5247b2d2287c5d221c0ed93448ca2827b56","observation_id":"1bd251da-0ec8-43ab-8059-2e7f7629647f","resolution":{"observed_at":"2026-08-12T10:18:10.177739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.181353Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.181353Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:9223892704b3fd8ea26450136bae0a1d3816383e43446b5b926b9798c1280d61","observation_id":"230f2c7c-50a4-4c6c-8969-e87c1ae35687","resolution":{"observed_at":"2026-08-12T10:18:10.181353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T10:18:10.184952Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.184952Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:4e03385a5e34efc26b51e0e68b50224ac75868070d408b053452e42dfa759c80","observation_id":"0b4478a0-34d4-4f70-9f79-b229cf0500e4","resolution":{"observed_at":"2026-08-12T10:18:10.184952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.189186Z","title":"Scaling laws for fine-grained mixture of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.189186Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:c3d4625a38b87fcb6fa72fde88f579aaa7337f2243d156e595a781ad7d80a865","observation_id":"5ae9508b-6465-4ada-a9dd-2dd16c2a77dc","resolution":{"observed_at":"2026-08-12T10:18:10.189186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.981207Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"69742c21-52f4-43d3-b5b8-4eb9b7513976","year":2009},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.192742Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:94d4a3a8984233a8d2ce1c3dd821a9c8027ef23e387fc88e340ccdf03851c956","observation_id":"bb29f43e-9268-4b53-930f-23cda318cbc4","resolution":{"observed_at":"2026-08-12T10:18:10.985201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.196514Z","title":"Mole : Mixture of language experts for multi-lingual automatic speech recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.196514Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:35a2124e30b117a20af3967c1875f7c3b44e13cba3680bbc87a2c65454e4e543","observation_id":"f3bb6d20-a858-4247-ad9c-19fdb12564bc","resolution":{"observed_at":"2026-08-12T10:18:10.196514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.200268Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.200268Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:9a70a3e9094754cb1f73742d91461b221aaaccf9c6e9819e34e4618d19aaaff0","observation_id":"c8ea616e-443b-43a9-bf53-cee8761494f3","resolution":{"observed_at":"2026-08-12T10:18:10.200268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.960753Z","title":"Moe-llava: Mixture of experts for large vision-language models, 2024","venue":null,"work_id":"dc4c1686-abec-4d51-a98b-d00b6e95294c","year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.204279Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:a8f31cdd8dbbd6031ed3f0a1e350b7c0287907c63f35ddf880086dc22fdbae10","observation_id":"291d04c2-d5de-42af-bc0a-da8bb4139aa5","resolution":{"observed_at":"2026-08-12T10:18:10.965256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-12T10:18:10.208101Z","title":"Sgdr: Stochastic gradient descent with warm restarts, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.208101Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:6a9d02cb75f95f10b0b2561cdb6d454d1576a340c7c267469b4c7845511719be","observation_id":"ab098bf4-0d14-45c1-8583-69885f78c6ff","resolution":{"observed_at":"2026-08-12T10:18:10.208101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.948919Z","title":"Maas, Raymond E","venue":null,"work_id":"c3c766ab-73b4-489f-a2e6-3bce87672a3f","year":2011},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.212411Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:65d4bd4abbb8f97b16ddbc823106a2b7e7e0215e883886e598c35498205e407b","observation_id":"cb62e6f5-8678-42ca-be9d-1582d56315f3","resolution":{"observed_at":"2026-08-12T10:18:10.952731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.937382Z","title":"Large text compression benchmark, 2011","venue":null,"work_id":"53aabf26-be3f-4fd7-a2e1-11dd883d3a04","year":2011},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.216414Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:700c82b88fc95a220764feebffef3b594737b8aa2d6750a3f5a0e4d373bcf0c8","observation_id":"7dcfe0de-b574-492b-a510-2434d6129fe1","resolution":{"observed_at":"2026-08-12T10:18:10.941489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10493","last_updated":"2022-04-02T01:51:00Z","snapshot_observed_at":"2026-08-13T17:30:29.649679Z","submitted_at":"2021-11-20T01:49:56Z","title":"Discrete Representations Strengthen Vision Transformer Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10493","snapshot_observed_at":"2026-08-12T10:18:10.220333Z","title":"Discrete representations strengthen vision transformer robustness, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.220333Z"},"links":{"cited_paper":"/paper/2111.10493","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:3d5d35e5df35f1e237edc5e0c1be375ae08612e668ac6ae435af14d3dc77ed75","observation_id":"b621e74e-3ed4-467e-afc8-b73be037dc33","resolution":{"observed_at":"2026-08-12T10:18:10.220333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-12T10:18:10.224432Z","title":"Finite scalar quantization: Vq-vae made simple, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.224432Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:366e06efda488eb815fbed6afa30c93ab7b09673fc17356a96af57b890fdb795","observation_id":"94a63665-e75c-4034-8fc4-3c76fd0fa5f6","resolution":{"observed_at":"2026-08-12T10:18:10.224432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-12T10:18:10.228563Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.228563Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:48743cee9e4a9338c1fff5a25a5eabe7f8045a5b46f51c67faeebc684666f905","observation_id":"e71c7c95-37dc-4f14-8a13-14a1810f0fd8","resolution":{"observed_at":"2026-08-12T10:18:10.228563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-08-14T05:00:07.792972Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-12T10:18:10.232614Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.232614Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:401c61f2f98758be95c72e4da6dbae8269f476291b5892cee1620dcbf1c689c5","observation_id":"19ac2baf-e50a-4c21-9bbc-2ce85440be43","resolution":{"observed_at":"2026-08-12T10:18:10.232614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-12T09:26:45.158981Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-12T10:18:10.236814Z","title":"Smith, Pang Wei Koh, Amanpreet Singh, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.236814Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:777cb168cc7b65f7ef813ea4cc215b9d3344d1227799f3220aae27f0e43cef51","observation_id":"988c0b00-9b6b-4d30-9e68-88e663485a80","resolution":{"observed_at":"2026-08-12T10:18:10.236814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.924764Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"72c276e4-0d09-413a-9abd-3654555603c1","year":2011},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.240745Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:9b00e8b5102f496d141fed601b22108b0031e13796410268a71ed22947cc811b","observation_id":"e9279c02-f88a-45c2-87b9-29225b2e3079","resolution":{"observed_at":"2026-08-12T10:18:10.929088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.911859Z","title":"Nguyen, Savitha Ramasamy, Xiaoli Li, Steven Hoi, and Nhat Ho","venue":null,"work_id":"dad00a56-5929-4846-b329-b0f055d0df0c","year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.244469Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:43c583d70be1152cfc08caaf3e64c278306ddb50173e9aa0ead3e3f818376a6a","observation_id":"edf5d1a1-e465-407b-aa8b-c1983b58870b","resolution":{"observed_at":"2026-08-12T10:18:10.916516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00951","last_updated":"2024-05-27T11:44:51Z","snapshot_observed_at":"2026-08-13T21:59:34.951949Z","submitted_at":"2023-08-02T05:20:55Z","title":"From Sparse to Soft Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00951","snapshot_observed_at":"2026-08-12T10:18:10.248168Z","title":"From sparse to soft mixtures of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.248168Z"},"links":{"cited_paper":"/paper/2308.00951","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:c6c36c9e73fdc5f385e0f6e980a31369dc1b7c8a0f518018a934e32a8cc1c75f","observation_id":"019f4633-c2e0-4d70-b6dd-a0f8a6b80087","resolution":{"observed_at":"2026-08-12T10:18:10.248168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05974","last_updated":"2021-06-10T17:10:56Z","snapshot_observed_at":"2026-08-13T19:05:40.642938Z","submitted_at":"2021-06-10T17:10:56Z","title":"Scaling Vision with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05974","snapshot_observed_at":"2026-08-12T10:18:10.252435Z","title":"Scaling vision with sparse mixture of experts, 2021 a","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.252435Z"},"links":{"cited_paper":"/paper/2106.05974","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:27484ea05561a9871147f9df470e92550ee841417c2a25af7b6b1db20ffbd98b","observation_id":"6ad9c062-943f-4147-a533-43b5df755db7","resolution":{"observed_at":"2026-08-12T10:18:10.252435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.898282Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"fcbb7b1f-bf79-4971-b0f2-6dcfe579d897","year":2021},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.256348Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:5e3fc1260b2b4616f4da18b26a1476fdc33b08c1656dcb7b6834484e90052cce","observation_id":"1bf06eae-dccd-4994-96c9-7f955f6b578c","resolution":{"observed_at":"2026-08-12T10:18:10.903120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.259987Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.259987Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:c9bcf0711ab729836b0632ca4eb71b808983a05a9fc9b67f7f51ab3399ed56bb","observation_id":"cbc8769f-b053-4e9d-bcaf-adafee7f60b9","resolution":{"observed_at":"2026-08-12T10:18:10.259987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.876114Z","title":"Mixture-of-experts meets instruction tuning:a winning combination for large language models, 2023 a","venue":null,"work_id":"daea8dfa-95dc-4958-a726-b6d88ce26827","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.263631Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:267a8520fe00ecf9562866a5cfd9f693a548fc74fc79b76c237c9bf0c98aed74","observation_id":"acdfaee2-acb3-4b63-b509-b260643a076c","resolution":{"observed_at":"2026-08-12T10:18:10.880177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.267999Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.267999Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:04fd3654a30900ada1bf43bdfef151f00567dd1759201538c4dbce8f7bcbf45d","observation_id":"a251bae3-10b1-43fa-91f0-0e4bb8c5f09a","resolution":{"observed_at":"2026-08-12T10:18:10.267999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.864396Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"48f55961-c3e6-43b1-a653-c2286fc27bbb","year":2013},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.272052Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:b8ff2b867d184caa1f72d020bfddcf0f4f679e1e13646de86264dd047f48866f","observation_id":"0c5d9585-55bb-4a67-ad8e-539a22308bd6","resolution":{"observed_at":"2026-08-12T10:18:10.868821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05633","last_updated":"2021-09-02T10:36:48Z","snapshot_observed_at":"2026-08-13T19:24:12.054855Z","submitted_at":"2021-05-12T13:01:44Z","title":"Segmenter: Transformer for Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05633","snapshot_observed_at":"2026-08-12T10:18:10.276837Z","title":"Segmenter: Transformer for semantic segmentation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.276837Z"},"links":{"cited_paper":"/paper/2105.05633","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:f2d15e9a48fe84fb2d5998e0cf246ce4790462719f8a564aed5a59abae70f228","observation_id":"4a135cc4-27ef-413c-9f17-64d6488407a2","resolution":{"observed_at":"2026-08-12T10:18:10.276837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.852115Z","title":"Neural discrete representation learning","venue":null,"work_id":"f2cae7a6-bf46-41bc-b198-31efdca942de","year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.280963Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:4c35335c79e5d123f3c27297e2585bf4a034ad9fbb6d619a075c097655ed08db","observation_id":"11b928b7-d279-47e4-afce-64fc990168b2","resolution":{"observed_at":"2026-08-12T10:18:10.856400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.284855Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.284855Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:0678cda7dc77e3a5b013d05fe496df40b62222efe73ccbb909ad8ae76ecd4995","observation_id":"03f10f1a-2853-4402-9d65-7bc7acf9453c","resolution":{"observed_at":"2026-08-12T10:18:10.284855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.829346Z","title":"Language-routing mixture of experts for multilingual and code-switching speech recognition, 2023","venue":null,"work_id":"ae316cd5-e45e-4c62-a15a-b6b6d0e117ce","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.288643Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:bde6c45a915ffc6e47f81b7e16d91cba5e0f16445b54ae60690f3b5df4449fe2","observation_id":"fbd96d97-05ed-41fe-b9cc-d05a1f42464e","resolution":{"observed_at":"2026-08-12T10:18:10.833868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.814806Z","title":"Openmoe: An early effort on open mixture-of-experts language models, 2024","venue":null,"work_id":"be2a5a63-9078-4a0f-b8b3-9c13122723c3","year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.292624Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:fffecbc3fccbbdd5905139afaee5b4ac32d243015183747fe4b4ca068d3dca24","observation_id":"5abe574b-03a3-4c7d-a5d1-c2b3acc20da5","resolution":{"observed_at":"2026-08-12T10:18:10.820464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-12T10:18:10.296519Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.296519Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:94669f105ea3f50050342feca782cba72ed35812471b72ea451f218a6acb4c84","observation_id":"9d89c4be-0e7a-49e0-90fc-f3820e4e4d24","resolution":{"observed_at":"2026-08-12T10:18:10.296519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.802204Z","title":"Taskexpert: Dynamically assembling multi-task representations with memorial mixture-of-experts","venue":null,"work_id":"75ca4d86-3427-42b2-bb95-915ed774810a","year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.300321Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:928e9faee0c5783f618eeb7d444cca0c1a85f12d9d40c29bf63b2b1aa360d6a2","observation_id":"50dcf086-aa74-4273-bc64-a4f28b230aaa","resolution":{"observed_at":"2026-08-12T10:18:10.806456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-12T10:18:10.303985Z","title":"Vector-quantized image modeling with improved vqgan, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.303985Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:cd34f4e443f0dc7e3ceed10c36f65f3cb274723ea6bab5428777ee6a9a7b4e6d","observation_id":"60d57dcd-19df-4da4-823b-0686565d5ce5","resolution":{"observed_at":"2026-08-12T10:18:10.303985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05199","last_updated":"2023-04-05T02:32:59Z","snapshot_observed_at":"2026-08-14T00:17:59.377084Z","submitted_at":"2022-12-10T04:26:32Z","title":"MAGVIT: Masked Generative Video Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05199","snapshot_observed_at":"2026-08-12T10:18:10.308188Z","title":"Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.308188Z"},"links":{"cited_paper":"/paper/2212.05199","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:6ae8007829d3b987bf50ab484e90917750377ef97f1637967ad00f0cea36c79e","observation_id":"87df392a-8895-4ec2-ae96-94b9d71f028e","resolution":{"observed_at":"2026-08-12T10:18:10.308188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.05442","last_updated":"2018-10-16T04:41:24Z","snapshot_observed_at":"2026-08-13T20:44:17.429228Z","submitted_at":"2016-08-18T22:23:13Z","title":"Semantic Understanding of Scenes through the ADE20K Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.05442","snapshot_observed_at":"2026-08-12T10:18:10.312265Z","title":"Semantic understanding of scenes through the ade20k dataset, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.312265Z"},"links":{"cited_paper":"/paper/1608.05442","citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:45f2806b98d8cc03f5e1985f190f7d9361b6e4e704666c24ccb670ef7ac88476","observation_id":"ef683283-733d-4650-bb9c-3ffc7da2b9cc","resolution":{"observed_at":"2026-08-12T10:18:10.312265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.789388Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"b5ab749f-8293-44d0-b02d-2eed79163f07","year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.316509Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:2806e3db11e53205df67a3755640474ef0fe5e1c17ad1d814efd0277e7e456f5","observation_id":"7cedfa38-407b-4220-8442-d018a9b2b0d0","resolution":{"observed_at":"2026-08-12T10:18:10.793814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.776745Z","title":"Brainformers: Trading simplicity for efficiency, 2024","venue":null,"work_id":"3f1f18a5-209a-4bd4-a0d1-4dfd23d303f0","year":2024},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.320344Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:10640c31f3662e666a53bbd4e45d869eddf3ab0060deab44fa33c2ffa6965281","observation_id":"51c2e18c-c547-4ef7-9bd1-92314ecef5b5","resolution":{"observed_at":"2026-08-12T10:18:10.781122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.324045Z","title":"St-moe: Designing stable and transferable sparse expert models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.324045Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:4ac66d86cf61ab6f24495eb0110085d7a45b1592f7c35a3a92ad82b9502fa818","observation_id":"e44dc1b5-f3c2-4d4c-b4cc-4d83966649e9","resolution":{"observed_at":"2026-08-12T10:18:10.324045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:18:10.327777Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T10:18:10.327777Z"},"links":{"citing_paper":"/paper/2411.19402"},"observation_digest":"sha256:8d43e13b66c833429bfb6e370a0580bcd165a62c3efde6b057f878f9a70e87a5","observation_id":"dd2b65f8-2031-4439-923c-07d7b9613587","resolution":{"observed_at":"2026-08-12T10:18:10.327777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.19402","last_updated":"2025-07-27T07:26:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:48:52.037112Z","submitted_at":"2024-11-28T22:32:01Z","title":"On the Role of Discrete Representation in Sparse Mixture of Experts"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2411.19402."}