{"as_of":"2026-08-19T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:188f4733daf76e69bef05610998e83ea7f9d1cb19925917e9ea93e004036de08","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:41:49.471089Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:50:21.977570Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:06:14.781833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":"2505.00792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-07-01T21:06:14.781833Z","title":"arXiv preprint arXiv:2505.00792 (2025) 10 X","venue":null,"work_id":"06111ff0-17d6-4b59-b471-d3fe7d944f18","year":2025},"citing_paper":{"arxiv_id":"2604.07298","last_updated":"2026-04-08T17:04:45Z","snapshot_observed_at":"2026-08-14T02:31:17.564550Z","submitted_at":"2026-04-08T17:04:45Z","title":"Region-Graph Optimal Transport Routing for Mixture-of-Experts Whole-Slide Image Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:35.473995Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2604.07298"},"observation_digest":"sha256:1a95ddf60f545bda7f73630a14f5f72779fc6a694931f0c7bebf8d02dec4096c","observation_id":"fab87040-c301-4cc4-86bc-988da245064b","resolution":{"observed_at":"2026-05-11T00:45:49.824512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":"2505.00792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-07-01T21:06:14.781833Z","title":"arXiv preprint arXiv:2505.00792 (2025) 10 X","venue":null,"work_id":"06111ff0-17d6-4b59-b471-d3fe7d944f18","year":2025},"citing_paper":{"arxiv_id":"2606.01047","last_updated":"2026-05-31T06:35:10Z","snapshot_observed_at":"2026-08-19T01:56:26.154206Z","submitted_at":"2026-05-31T06:35:10Z","title":"Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T17:26:36.956666Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2606.01047"},"observation_digest":"sha256:815dffad0a1df95493fe5274d97da477ce30030f35d4b8d4b8753b6a356c1461","observation_id":"25f7e56a-d0e9-436f-953d-d05851d0457b","resolution":{"observed_at":"2026-07-01T21:06:14.784737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-08-03T00:50:21.977570Z","title":"arXiv preprint arXiv:2505.00792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28670","last_updated":"2026-08-17T16:01:17Z","snapshot_observed_at":"2026-08-19T19:22:42.653232Z","submitted_at":"2026-07-25T12:43:47Z","title":"Hierarchical Copula-Gumbel-Top-K Routing: Two-Sided Dependence Control for Frozen Mixture-of-Experts at Fixed Per-Token Routing Laws","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T00:50:21.977570Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2607.28670"},"observation_digest":"sha256:468a3e98fbe3f40b9c595e03bcd637d9f2d792703104062e4d92bcc548e0f940","observation_id":"1c31456a-2839-4b42-93af-c031c34fedca","resolution":{"observed_at":"2026-08-03T00:50:21.977570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00792/citation-record","integrity":"/paper/2505.00792/integrity","json":"/paper/2505.00792/citation-record.json","paper":"/paper/2505.00792"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-17T06:02:42.650883Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-16T04:41:49.257916Z","title":"V., Du, J., Iyer, S., Pasunuru, R., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.257916Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d0eaf9a18d5dec59d1ce23f3b57bf0f44f8e5ed8b1553d0c92871658c804e0e3","observation_id":"23d172a2-a757-4c5d-951d-be49201300e8","resolution":{"observed_at":"2026-08-16T04:41:49.257916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.076132Z","title":"L., Darrell, T., Malik, J., and Efros, A","venue":null,"work_id":"f9c2ae55-5389-4387-8149-3f159ecd2ac8","year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.263438Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:58bc137eb992258c603b262bf598510b182c507fb2de58180a66bdd8f4f31094","observation_id":"4ec484d0-40e4-4490-9309-99010407acee","resolution":{"observed_at":"2026-08-16T04:41:50.080485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-16T04:41:49.267497Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.267497Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f11358433b48aac229874aa3c2291ebf22a8efc9da39caa43ee87c0544f41d3a","observation_id":"edfdad44-7cd8-4657-b019-ed497e1656ab","resolution":{"observed_at":"2026-08-16T04:41:49.267497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.272533Z","title":"K., Aggarwal, K., Som, S., Piao, S., and Wei, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.272533Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:4c371b92203ac6499ee88375dbbb25ee2b4a8147460dbc5b97a111471e1d1c17","observation_id":"dc96d33c-48fc-4d01-993b-51d7ef7dc488","resolution":{"observed_at":"2026-08-16T04:41:49.272533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-14T22:22:10.782232Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-16T04:41:49.276815Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.276815Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:b0661a109d4fb4eebf005fd3ca8c6054c0c4889033f8509b97601e7a328f4e3c","observation_id":"bf2f5b67-05f2-4084-bb11-55b6d07bd398","resolution":{"observed_at":"2026-08-16T04:41:49.276815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.053516Z","title":"and Svensén, M","venue":null,"work_id":"eabcb462-5f4a-4652-9dd9-a408f09931cf","year":2003},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.281587Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:16afe4c642682bcc28fdf223601b1916e335561c4af84a65dd26a46b127bd644","observation_id":"1c20dbd1-8982-499f-ab47-dc4f5af57601","resolution":{"observed_at":"2026-08-16T04:41:50.057706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T04:41:49.286518Z","title":"B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.286518Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:0b40f6c3a24451477ca3893f8823e34ccba3a3311a9f267e87952e978758955e","observation_id":"513cda42-5693-4cda-aa77-f04ea65c7034","resolution":{"observed_at":"2026-08-16T04:41:49.286518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04807","last_updated":"2020-03-10T15:33:54Z","snapshot_observed_at":"2026-08-17T23:59:15.683084Z","submitted_at":"2020-03-10T15:33:54Z","title":"Efficient Intent Detection with Dual Sentence Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04807","snapshot_observed_at":"2026-08-16T04:41:49.290923Z","title":"Efficient intent detection with dual sentence encoders","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.290923Z"},"links":{"cited_paper":"/paper/2003.04807","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:aca7c8acf4741bd5b9369704b4b6f2d17f0c8f174e69dcea93780b88594e0aff","observation_id":"81f4cbb9-bb2a-4e83-a54a-e6a156ac5a4a","resolution":{"observed_at":"2026-08-16T04:41:49.290923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.040248Z","title":"K., Liu, S., and Wang, Z","venue":null,"work_id":"551a002a-900f-40b0-b76b-2456ca4e0ab3","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.295286Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:9d684c3133cbad497156005ed92caf1ab86d5c68fc1ac54ed17b04d154a2b5ca","observation_id":"1d7d7e27-ba42-4690-bc98-9cf1bff41510","resolution":{"observed_at":"2026-08-16T04:41:50.044343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.026542Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"912dd9c1-0b2d-49ee-9689-b40de2d1b075","year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.299426Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d25794b749fdebe6bf8be81e8bed5f6a1fc0e1e146f86ca5ff5f1bc22c46625d","observation_id":"9fbbd6cc-d7db-4005-b80e-8469937dbcc3","resolution":{"observed_at":"2026-08-16T04:41:50.030597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.49","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.529151Z","title":"Approximating two-layer feedforward networks for efficient transformers","venue":null,"work_id":"99850c4b-a7b3-4d47-94f6-41784cc6eaff","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.303411Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f4e8a8de09897dd779d924fc198ca4c1c3d8ee688fa60b7765a8b5c23a0e32fa","observation_id":"5ef516f5-345d-48ec-bc22-71510977fad6","resolution":{"observed_at":"2026-08-16T04:41:49.535519Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.307818Z","title":"Stablemoe: Stable routing strategy for mixture of experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.307818Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:a41c26d9c85bcec4e20aa3b73b8349b9ae822723d8ededc27a486b7a9df2cda2","observation_id":"1564732f-ff9a-4194-b3ef-d3667dfa79cd","resolution":{"observed_at":"2026-08-16T04:41:49.307818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:41:49.311639Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.311639Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:3a29f889b94a84f819533a7ba5ed33e5230f62182ed1a2866813f5d90cc8fcaa","observation_id":"fbc00eb2-95f9-4cd3-9850-7c03039d5698","resolution":{"observed_at":"2026-08-16T04:41:49.311639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.315769Z","title":"G., Khiem, L., Pham, Q., Nguyen, T., Doan, T.-N., Nguyen, B., Liu, C., Ramasamy, S., Li, X., and Hoi, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.315769Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:0f8a5e1f1b9fc202a8e8303cdac4c8a7dafdab48d8bbfd8d106503ec6aaceeca","observation_id":"1e6176cf-9ede-4272-a5e1-f83a86dc3849","resolution":{"observed_at":"2026-08-16T04:41:49.315769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.319793Z","title":"M., Tong, S., Lepikhin, D., Xu, Y., Krikun, M., Zhou, Y., Yu, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.319793Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:642e29a933a53e03b42493ecc01acc201038285acad77b6081d05b0278286c44","observation_id":"c3de1a7b-b25a-4c50-bdc4-3617550f88af","resolution":{"observed_at":"2026-08-16T04:41:49.319793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-16T04:41:49.323771Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.323771Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:14dc059728e8ce901063b9715874941935bcc7650053a26f9103712bb34178f4","observation_id":"16ca6e7b-0172-4d75-b825-44897b7bfbcd","resolution":{"observed_at":"2026-08-16T04:41:49.323771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.328106Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.328106Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:eddb0b4b9e6945ae8d595b446d2c960d6e996734852fbd6432d3127949837740","observation_id":"42e4d662-7bc6-4cd4-b679-c85c0865159f","resolution":{"observed_at":"2026-08-16T04:41:49.328106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.987283Z","title":"J., Prasad, M., Ramabhadran, B., and Zhu, Y","venue":null,"work_id":"2e3e1242-0e36-4b2b-b874-ca5630a9109a","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.332165Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:7548fc2eb7d445e219ba0fd51f1d89144bc7de5980190c885f3a27ba74697e32","observation_id":"73a0f427-1f63-4f15-9e7e-e25108356697","resolution":{"observed_at":"2026-08-16T04:41:49.991461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.972633Z","title":null,"venue":null,"work_id":"e7cb9419-7ce6-4580-98cf-9fa8b1eba624","year":2011},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.336293Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:981d6eafd1ad774910d0053e3a232c1cc347c4db30229fed606dd532d4d4cb28","observation_id":"957cf370-fb1a-4110-ae3c-91cb635096b3","resolution":{"observed_at":"2026-08-16T04:41:49.977725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.340602Z","title":"The elements of statistical learning: data mining, inference, and prediction, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.340602Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:2bf0c5f4687ae5701d45d16b6228d04a91ac5548c1bfc783300c38bac6eaab09","observation_id":"1dba21a0-4bae-4d44-9cd0-6404ab2e0119","resolution":{"observed_at":"2026-08-16T04:41:49.340602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-16T04:41:49.344601Z","title":"and Dietterich, T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.344601Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:2842c66afd81bdc4e673d8cb972201105c88babb983a030257793521e67cda0a","observation_id":"98b30599-6ab8-49fc-ab05-16de505eb8fc","resolution":{"observed_at":"2026-08-16T04:41:49.344601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.348797Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.348797Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:c4f0b135a05c8c9e69be14db2b64d99066dcb6d31b66689424c95d7c5231d703","observation_id":"5f9e1791-0bc9-4922-a123-ebbe533a1144","resolution":{"observed_at":"2026-08-16T04:41:49.348797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.352768Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.352768Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:aa6833b7be6b71d7d165ef15fa00b01f6d6dcf02216e24f90eedac5f54718a09","observation_id":"a047196a-3ebe-4383-87c4-3235dafc592d","resolution":{"observed_at":"2026-08-16T04:41:49.352768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.356950Z","title":"A., Jordan, M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.356950Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:85d0a68b190fbeb1a4ae019b7d6307b3b7c944d3880d5aa0eb89eb42161a6b0f","observation_id":"c926046c-2596-4e17-9527-110298cb8ce0","resolution":{"observed_at":"2026-08-16T04:41:49.356950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.361254Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.361254Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f483ac8764a009d7845deebdc68d6368ab1c4d0195c37bfffb268ba2e0d24f32","observation_id":"0f491505-d430-46f3-babb-060f223958f5","resolution":{"observed_at":"2026-08-16T04:41:49.361254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T04:41:49.364738Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.364738Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:3ee96caf89b7c76fe025fdbe0c4c6959d3be9fa8838df2f46e461e50de42c3d0","observation_id":"426087ba-cedf-4afc-8029-89f5cc844366","resolution":{"observed_at":"2026-08-16T04:41:49.364738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-16T04:41:49.368162Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.368162Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:9856510273ccbd37a12b9af528e5dd9fe9bfeabb4cc7bf02cb3624c8e64494ac","observation_id":"4a77115f-3c83-475b-818c-3c219107f5dc","resolution":{"observed_at":"2026-08-16T04:41:49.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.915846Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"4cb647e5-dca9-421b-8ab4-253f918049d1","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.372332Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:3bf2581a52a151f3566a11df4d60eea31c6d78e96c23628abc9e2e804a7a1c62","observation_id":"6f14c2d6-2c07-44cb-afaf-74cd402ebbc6","resolution":{"observed_at":"2026-08-16T04:41:49.920036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.375894Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.375894Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:4260e626c89f4eb53391796465a9c88f09436341144fc34c5c7feeb10772fc28","observation_id":"c174c9ad-56b1-47f3-87d5-adda57024036","resolution":{"observed_at":"2026-08-16T04:41:49.375894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.893977Z","title":"Sparsity-constrained optimal transport","venue":null,"work_id":"858c66ef-cb65-4ead-a5e4-f458dbd10bff","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.379318Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:e9e77d4db3052e351450b4ef7388185cf6532a731d52f9bf048833515c52c7c4","observation_id":"c8b3506c-5a14-4f7b-91b1-176519a4802c","resolution":{"observed_at":"2026-08-16T04:41:49.898528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.880872Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"5e243ab2-2c00-4827-ab2c-a5e36f8a533a","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.383379Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:c05cc13bf73850b1fd5866f2913e6e9764fefe739d154395b4387903371d5bb3","observation_id":"c1bfdb5b-04ff-48bc-b22c-434db0a51333","resolution":{"observed_at":"2026-08-16T04:41:49.884648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T04:41:49.387051Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.387051Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:0e7ac2c2bfb94c4afb66bc60b0b476cdf50ddc1fbfba176b036096a5051a25b3","observation_id":"e1e34477-c18a-485c-9fa5-9ce15a9f582a","resolution":{"observed_at":"2026-08-16T04:41:49.387051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-18T03:04:28.486504Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-16T04:41:49.390654Z","title":"X., Lifland, E., Yoo, J","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.390654Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ee6d156c6a36245c7f69cbfcfaa7f904d7e5b3565d4b64a18687377d23a7edc1","observation_id":"8f6847ba-bca2-4b42-86d5-5839ccfc19f2","resolution":{"observed_at":"2026-08-16T04:41:49.390654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.868303Z","title":"and Dirk, W","venue":null,"work_id":"c0fe3fa5-b14e-46b3-9ef1-5cf0e48e6d02","year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.394960Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:3fec6a7d5bc924fb49746c0d06687b3f6c0e39544654dcb884207dbb76afc241","observation_id":"a886e4e1-41ab-462b-b3a2-0b137b38cd83","resolution":{"observed_at":"2026-08-16T04:41:49.872044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00918","last_updated":"2026-07-25T23:45:29Z","snapshot_observed_at":"2026-08-19T04:12:35.070005Z","submitted_at":"2024-11-01T14:04:36Z","title":"LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00918","snapshot_observed_at":"2026-08-16T04:41:49.399135Z","title":"V., Doan, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.399135Z"},"links":{"cited_paper":"/paper/2411.00918","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f813d3f1f408973f41a38c1417a00790c797d3ad9f9e0f3177ffceee25823c52","observation_id":"45268bf7-d89e-4381-8509-e04344eb0a69","resolution":{"observed_at":"2026-08-16T04:41:49.399135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.855452Z","title":"T., Ramasamy, S., Li, X., Hoi, S., and Ho, N","venue":null,"work_id":"60d09f8e-e810-4993-9bd5-3fce2c2b1302","year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.404333Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:14a10417d734f6eb44f46b1f2d78bd6bcb0b80c0de63ed623ef9e9d8ba814261","observation_id":"f513e85c-e0ab-48ba-89c5-a0d1606cb661","resolution":{"observed_at":"2026-08-16T04:41:49.859218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.408414Z","title":"A., and Levy, O","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.408414Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:dc19abee073c576ea4f63084818f7ed9c4698647064ab101d9ea53f5592206bf","observation_id":"1c772cb6-b7c5-4312-a532-6fb4a7d7a301","resolution":{"observed_at":"2026-08-16T04:41:49.408414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.413019Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.413019Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:e8543e65a6d8299c212ebf79c52b1becaabf6cb5da41e2520baaf779d136eef3","observation_id":"ac473c5d-26fc-4572-86b0-d1d6ebc826c3","resolution":{"observed_at":"2026-08-16T04:41:49.413019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.417426Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.417426Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:bba0f239a83ba2715d1f6f763d7ef4352728496494792e7b2c9aa9f017a30f06","observation_id":"3889dfe5-278a-4791-be5a-6ec13acf2478","resolution":{"observed_at":"2026-08-16T04:41:49.417426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.421935Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.421935Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:c62c5bc658dab548e1bf4dc4db2349c52f4573d8f6eb6af5b4c3637a1515c34b","observation_id":"11915f05-2819-44e8-b1e9-bd07e47430ae","resolution":{"observed_at":"2026-08-16T04:41:49.421935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.817339Z","title":"Hash layers for large sparse models","venue":null,"work_id":"98c0a47b-0f50-4ee4-9a3b-326df28bf592","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.426386Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:e2af7253e19cb85ecbed59e0477b80bb577e799120721ee49fa0fa1fcb3b0494","observation_id":"710b93d8-5638-4cf1-b985-d283d656fea2","resolution":{"observed_at":"2026-08-16T04:41:49.821877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-16T04:41:49.430656Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.430656Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ec9404e01301b77d8d6a6df4a61d0713d5d153b89d8867217f80813c0c6fe2d9","observation_id":"7c768ff8-7bc5-4a52-b381-687c19e78335","resolution":{"observed_at":"2026-08-16T04:41:49.430656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.435169Z","title":"D., Ng, A., and Potts, C","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.435169Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:640f352da5ca1feae5b9a07184403d3b0809acafa5533deca74d357874628750","observation_id":"68130f9e-97e9-4416-b0a4-57e8cbf423c5","resolution":{"observed_at":"2026-08-16T04:41:49.435169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09816","last_updated":"2024-08-29T08:45:58Z","snapshot_observed_at":"2026-08-16T13:34:33.201721Z","submitted_at":"2024-07-13T09:22:33Z","title":"MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09816","snapshot_observed_at":"2026-08-16T04:41:49.439539Z","title":"Maskmoe: Boosting token-level learning via routing mask in mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.439539Z"},"links":{"cited_paper":"/paper/2407.09816","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:acd2d4daadfbc837ac35c804ad190384e716fc3ed04eaf3b8b8790f9e4ed061e","observation_id":"1904b808-0b12-40dc-9745-fd0543cd9fa8","resolution":{"observed_at":"2026-08-16T04:41:49.439539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.444109Z","title":"W., and Gholami, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.444109Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:7d091d09d5f88d13fcaaa11911a2130614b33097a6f7c3462f87c7f1532052f7","observation_id":"637516eb-f620-47d3-8e10-c2fb903c6228","resolution":{"observed_at":"2026-08-16T04:41:49.444109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.448298Z","title":"Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.448298Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:acc0728e96ed71ff3e7be9d27b263f29a21892c8abf6e01f6668ed3455f9bc12","observation_id":"52583df4-7607-4081-a8c2-755b67dc95c4","resolution":{"observed_at":"2026-08-16T04:41:49.448298Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-16T04:41:49.452860Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.452860Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:11d826ebea096fcdab929bf743ad7e0fca66b2317f7e61f93499da12cfd38532","observation_id":"ab945936-77cb-49d1-9189-410bafbe265d","resolution":{"observed_at":"2026-08-16T04:41:49.452860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.457379Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.457379Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:380ff1d7d0b42e2afa1282d4c8a2c7c3d00d1d0fb0cb673e4e8dfc5686f52885","observation_id":"454c4dcf-a6fd-41cf-94e8-4d904121c53f","resolution":{"observed_at":"2026-08-16T04:41:49.457379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.462470Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.462470Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:15e0a8041fe7a5a4f3067824802090be39a49f9cec556601bdf30172d45552a0","observation_id":"f39ae6b2-0c51-4699-8da3-cd486cf3c9f4","resolution":{"observed_at":"2026-08-16T04:41:49.462470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.466997Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.466997Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:98a540fd0a70a6caafd76fb39b5f4902f343c11f08c8fd5e3561c30c98b7a123","observation_id":"dab9066e-411f-475e-85ac-3a84faef658d","resolution":{"observed_at":"2026-08-16T04:41:49.466997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.759484Z","title":null,"venue":null,"work_id":"ccfe77e0-fd6b-4ca9-91f5-d9c1db3d7a3d","year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.471089Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:1df2a8ba013a2322821729c3e8cb5e1292b40a5b94050079acc9b7fbd38c8710","observation_id":"2cf6e69d-da46-4b9d-9ca4-048135bd3a12","resolution":{"observed_at":"2026-08-16T04:41:49.763846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:32:27.057855Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2505.00792."}