{"as_of":"2026-08-07T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7b54806d20ffa46805f58c05153aabb89facb303a4df62c2405320275d79301","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:52.247745Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22919/citation-record","integrity":"/paper/2506.22919/integrity","json":"/paper/2506.22919/citation-record.json","paper":"/paper/2506.22919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:55.430257Z","title":"Le, and Geoffrey Hinton","venue":null,"work_id":"c95c5268-459c-40c0-9a7b-17ad90396c0d","year":2017},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.496787Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:891a148ed21b66c2f0745736c0d3eef8750c82e60b4006de69733d83e2f82999","observation_id":"60bdd10f-92ae-471f-a03a-a76dbbab877d","resolution":{"observed_at":"2026-08-06T21:59:55.630496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:49.606183Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.606183Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ca9e6d66fd3aa99251cc23ba88f829965263af710d2c8165deed637db2704260","observation_id":"309b2c77-a360-4830-851b-86e9fbb54a21","resolution":{"observed_at":"2026-08-06T21:59:49.606183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-06T21:59:49.709718Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.709718Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:bb2dd49c5690fffe8d2f83ec23c3c69480da7af0e589284f71f1daabdedb131b","observation_id":"0d8f1028-5cec-417d-bc00-149ebfb90d3e","resolution":{"observed_at":"2026-08-06T21:59:49.709718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-06T21:59:49.832400Z","title":"Deepseekmoe: Towards efficient mixture-of-experts with generalist routing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.832400Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ca4c2f72ad1dcae5d2c0f1a345c3721b94a1f7968ed049835f62131c28f76168","observation_id":"d8dbf301-52b4-4a64-825b-30a86a5fd31d","resolution":{"observed_at":"2026-08-06T21:59:49.832400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13491","last_updated":"2022-11-24T09:31:02Z","snapshot_observed_at":"2026-07-06T14:22:36.024831Z","submitted_at":"2022-11-24T09:31:02Z","title":"Spatial Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2211.13491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.13491","snapshot_observed_at":"2026-08-06T21:59:53.072109Z","title":"Spatial Mixture-of-Experts","venue":"cs.LG","work_id":"d8d4c63a-536e-4bcf-93ef-3182f387d8bc","year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.913942Z"},"links":{"cited_paper":"/paper/2211.13491","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:d466fee97017823e46871393da4c38156ed97754172582e9e116ac4f7b5db85c","observation_id":"1b363b70-7006-47b6-831d-004f74b004b4","resolution":{"observed_at":"2026-08-06T21:59:53.127458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-07T01:23:19.488468Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-06T21:59:50.065384Z","title":"Mixture-of-experts with expert choice routing.arXiv preprint arXiv:2202.09368, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.065384Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:61eff27c45401fca6ffa3d86b19e482a955aeb7497367d77db1f4d2eaaffd6fa","observation_id":"be5941ef-23e5-4c87-a329-368af8cb73fe","resolution":{"observed_at":"2026-08-06T21:59:50.065384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12066","last_updated":"2024-04-27T09:11:44Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T11:25:37Z","title":"Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference","version":3},"cited_work":{"arxiv_id":"2308.12066","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.12066","snapshot_observed_at":"2026-08-06T21:59:52.903235Z","title":"Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference","venue":"cs.LG","work_id":"94858427-fa88-407a-88db-d34f2691d204","year":2023},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.163344Z"},"links":{"cited_paper":"/paper/2308.12066","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:8f4ca176d3b049adfe4afe35b4a144e9f5de6433ef4d91ede62109cfeb3338f4","observation_id":"e256eb57-97a2-4c87-8379-42a0163b7606","resolution":{"observed_at":"2026-08-06T21:59:52.966451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:50.227752Z","title":"Spectra: Specialized experts from prompt tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.227752Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:c77a5a864d0607be26db2d506b66aeff9427d51e5ac8b9ca341e5d4157205b8e","observation_id":"ba70103b-0b5a-4fe0-bf73-ccdcf82fb49b","resolution":{"observed_at":"2026-08-06T21:59:50.227752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06491","last_updated":"2025-03-09T07:24:36Z","snapshot_observed_at":"2026-08-07T17:19:20.639630Z","submitted_at":"2025-03-09T07:24:36Z","title":"MoFE: Mixture of Frozen Experts Architecture","version":1},"cited_work":{"arxiv_id":"2503.06491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06491","snapshot_observed_at":"2026-08-06T21:59:52.698537Z","title":"MoFE: Mixture of Frozen Experts Architecture","venue":"cs.CL","work_id":"dec3fcfe-19bf-4a80-a811-a42a82dc8e84","year":2025},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.311502Z"},"links":{"cited_paper":"/paper/2503.06491","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:36d88bb26a3930b5d86f78795f36f73a7a7f3ca4d6fed776be98e707d13ed1df","observation_id":"3469579c-4014-4539-b71a-7695b16064fb","resolution":{"observed_at":"2026-08-06T21:59:52.757826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04640","last_updated":"2023-09-11T19:31:26Z","snapshot_observed_at":"2026-08-05T03:29:35.055063Z","submitted_at":"2023-06-07T17:59:57Z","title":"ModuleFormer: Modularity Emerges from Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04640","snapshot_observed_at":"2026-08-06T21:59:50.455762Z","title":"Moduleformer: Modu- larization of pretrained transformers with self- supervised mixture-of-experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.455762Z"},"links":{"cited_paper":"/paper/2306.04640","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:1873a64e5b9623c17485babda3dd3ea1bf656277594687db4af7e8868340bddc","observation_id":"c59ac4f5-1fb6-458c-b1c8-f48982e6a70f","resolution":{"observed_at":"2026-08-06T21:59:50.455762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07535","last_updated":"2023-06-07T22:41:40Z","snapshot_observed_at":"2026-07-06T14:05:06.502938Z","submitted_at":"2022-10-14T05:32:17Z","title":"AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"2210.07535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07535","snapshot_observed_at":"2026-08-06T21:59:52.566478Z","title":"AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine Translation","venue":"cs.CL","work_id":"dbf1b9a0-6b7f-492c-b95e-8ab595facd9f","year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.614447Z"},"links":{"cited_paper":"/paper/2210.07535","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ec1a2a7a763a15e6672cfd94b164e0e7db8725929e3483619ddbd9769d8489b2","observation_id":"a7f9b936-c339-4e02-8aaf-9e9055d6dcb1","resolution":{"observed_at":"2026-08-06T21:59:52.602236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14685","last_updated":"2022-11-17T11:30:17Z","snapshot_observed_at":"2026-07-06T12:53:10.263419Z","submitted_at":"2022-03-28T12:32:25Z","title":"HetuMoE: An Efficient Trillion-scale Mixture-of-Expert Distributed Training System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14685","snapshot_observed_at":"2026-08-06T21:59:50.741606Z","title":"Hetumoe: Towards training and serving heterogeneous moe models efficiently","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.741606Z"},"links":{"cited_paper":"/paper/2203.14685","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:3ceaf1296640c420476a273f9c956bcee55a935d3e814f1a506de1c24c9e75f0","observation_id":"cc7bfa8b-6dc4-47de-9f03-c8c844c7093f","resolution":{"observed_at":"2026-08-06T21:59:50.741606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05313","last_updated":"2025-01-09T15:29:33Z","snapshot_observed_at":"2026-07-06T20:18:49.251617Z","submitted_at":"2025-01-09T15:29:33Z","title":"Optimizing Distributed Deployment of Mixture-of-Experts Model Inference in Serverless Computing","version":1},"cited_work":{"arxiv_id":"2501.05313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05313","snapshot_observed_at":"2026-08-06T21:59:52.416593Z","title":"Optimizing Distributed Deployment of Mixture-of-Experts Model Inference in Serverless Computing","venue":"cs.DC","work_id":"f806ac6b-f76d-421e-b417-e9c6fb56dcbc","year":2025},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.912662Z"},"links":{"cited_paper":"/paper/2501.05313","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:c5374aa6f5b4527b8c6f4ea77c0d947e41772a309ee6da40ff74b363a517fb8c","observation_id":"a55f8727-180e-46d9-b188-4c0d8ee21fee","resolution":{"observed_at":"2026-08-06T21:59:52.473973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08982","last_updated":"2026-05-18T20:44:06Z","snapshot_observed_at":"2026-07-06T19:50:01.724540Z","submitted_at":"2024-11-13T19:18:08Z","title":"Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08982","snapshot_observed_at":"2026-08-06T21:59:50.990181Z","title":"Modular prompting via expert aggregation.arXiv preprint arXiv:2411.08982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.990181Z"},"links":{"cited_paper":"/paper/2411.08982","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ad1ea1623a6810718ea5b319bea9a1494a5e9f61274cdfda535dc758976a1e36","observation_id":"ffc2873b-1fa5-4fc2-b41e-70f1660cc949","resolution":{"observed_at":"2026-08-06T21:59:50.990181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07639","last_updated":"2025-03-05T17:40:54Z","snapshot_observed_at":"2026-08-07T17:26:56.743529Z","submitted_at":"2025-03-05T17:40:54Z","title":"Mixture of Experts Made Intrinsically Interpretable","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07639","snapshot_observed_at":"2026-08-06T21:59:51.114219Z","title":"Moe-x: Mixture of ex- perts made intrinsically interpretable.arXiv preprint arXiv:2503.07639, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.114219Z"},"links":{"cited_paper":"/paper/2503.07639","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:c2237401dee4ba491f3a24de853916ec9d32f1f959dd3a8b2a9469c06cb733ce","observation_id":"2daa65f7-25ab-441c-8a07-84edde042d01","resolution":{"observed_at":"2026-08-06T21:59:51.114219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-06T21:59:51.170050Z","title":"Deepspeed-moe: Advanc- ing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.170050Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:b7fc35d4ddfd51ac3d986ca877738a33af7838e4e6491447b30e7950bbec49e8","observation_id":"e60790ab-ee19-4e09-a1ef-42a9d02db857","resolution":{"observed_at":"2026-08-06T21:59:51.170050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08744","last_updated":"2025-03-23T17:26:23Z","snapshot_observed_at":"2026-08-07T16:43:01.273598Z","submitted_at":"2025-03-23T17:26:23Z","title":"ExpertRAG: Efficient RAG with Mixture of Experts -- Optimizing Context Retrieval for Adaptive LLM Responses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08744","snapshot_observed_at":"2026-08-06T21:59:51.219171Z","title":"Expertrag: Augmenting large language models with specialized experts for retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.219171Z"},"links":{"cited_paper":"/paper/2504.08744","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:721aa70e5014f156410905c1b558820b2e0f48147ec6cf1f33edde772792027f","observation_id":"044cc1e5-d93a-40d2-ac74-686209d5134c","resolution":{"observed_at":"2026-08-06T21:59:51.219171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01359","last_updated":"2025-03-03T09:52:46Z","snapshot_observed_at":"2026-08-07T17:34:14.706978Z","submitted_at":"2025-03-03T09:52:46Z","title":"DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01359","snapshot_observed_at":"2026-08-06T21:59:51.254870Z","title":"Ders: Decoding with expert routing and selec- tion for mixture-of-experts models.arXiv preprint arXiv:2503.01359, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.254870Z"},"links":{"cited_paper":"/paper/2503.01359","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:075ff4c852442d8d94cdfec9e03c4801cb7dec0a7d6edf38b3557b4d56869dd7","observation_id":"0b6b33a2-3f54-4fbd-9438-dc22301a1ed2","resolution":{"observed_at":"2026-08-06T21:59:51.254870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:55.140560Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"6d8a09e6-310a-4334-b912-ce8f990663d9","year":2013},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.299119Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:80cc4470b2423cc37d46c97461ce48baa156a2147d873c01041caea7c645c2a0","observation_id":"62c484b2-9f77-49b7-83df-7e7153903605","resolution":{"observed_at":"2026-08-06T21:59:55.249289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04308","last_updated":"2025-04-06T00:37:36Z","snapshot_observed_at":"2026-08-07T16:08:18.617168Z","submitted_at":"2025-04-06T00:37:36Z","title":"Gating is Weighting: Understanding Gated Linear Attention through In-context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04308","snapshot_observed_at":"2026-08-06T21:59:51.366299Z","title":"Gating is weighting: Understanding gated linear attention through in-context learning.arXiv preprint arXiv:2504.04308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.366299Z"},"links":{"cited_paper":"/paper/2504.04308","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:57922ce2de585353c69d6b93ecd21c09f59859fed0e95298b90b5336dbd96e3d","observation_id":"41bfd936-739a-4324-88b6-1a8545c93b0e","resolution":{"observed_at":"2026-08-06T21:59:51.366299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10034","last_updated":"2024-08-12T09:23:13Z","snapshot_observed_at":"2026-08-03T20:04:29.832038Z","submitted_at":"2022-05-20T09:09:27Z","title":"MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10034","snapshot_observed_at":"2026-08-06T21:59:51.427121Z","title":"Moesys: A distributed and efficient mixture-of- experts training and inference system for internet services","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.427121Z"},"links":{"cited_paper":"/paper/2205.10034","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:1a511c338d99fa76f5eae8a515e40941c7121481447f1a029d01fc17f02eb4aa","observation_id":"bba7f7c2-dd04-4b92-8ba4-29e4791a7706","resolution":{"observed_at":"2026-08-06T21:59:51.427121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11144","last_updated":"2025-03-14T07:22:07Z","snapshot_observed_at":"2026-08-07T17:04:48.503303Z","submitted_at":"2025-03-14T07:22:07Z","title":"MoLEx: Mixture of Layer Experts for Finetuning with Sparse Upcycling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11144","snapshot_observed_at":"2026-08-06T21:59:51.527234Z","title":"Molex: Modular and lightweight experts for efficient fine- tuning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.527234Z"},"links":{"cited_paper":"/paper/2503.11144","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:a8d4613b3e4331c11ded43e418bd7f1f5a07ff55e3ea3482efa3afb34fe1cad9","observation_id":"467ffaca-465b-4b9d-b1a1-7dc41a937277","resolution":{"observed_at":"2026-08-06T21:59:51.527234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.887834Z","title":"Two-expert routing adds a modest +0.58pp over Top–1, still below the GRU+GRU upper- bound (90.62%)","venue":null,"work_id":"f585c190-7f96-4f13-8a68-f53962138f21","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.607108Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:b35f2163b0b3a80f971008ce4f3c18f20b5960ed448445789991a2ae75f44ec1","observation_id":"be2399fe-57d2-4b30-ab5a-3fab6c346652","resolution":{"observed_at":"2026-08-06T21:59:55.019473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.485251Z","title":"Entropy plummets from 0.65 to 0.15 bits, indicating almost deterministic gating","venue":null,"work_id":"3d605632-d2e2-4949-9a72-617eee5e1780","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.691078Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:2d068e8b63e145e2a90b15d87d12b3686150c2a870d768a3bdc360b633f709a5","observation_id":"cf6e564b-14f0-49cb-957e-9aaf43c8ee4b","resolution":{"observed_at":"2026-08-06T21:59:54.651214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.049485Z","title":"always run the GRU","venue":null,"work_id":"671ee244-71eb-4448-be3f-be5a7409e154","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.774537Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:2a7901d37f699c80ae1f2169e442f847c6efcd9977720e4300191b48b9a11cc7","observation_id":"1ca250bc-f7a4-4ddf-bdd2-16dbebc8a751","resolution":{"observed_at":"2026-08-06T21:59:54.272552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.891729Z","title":"Because two experts fire per sample, single-expert attribution is lost - diluting the inter- pretability benefit of sparse MoEs","venue":null,"work_id":"7f524aba-abf8-47ef-a0a3-256fdf7defdc","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.841232Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:567f8b0d610af3326ceca17efffbdbc19f9deecbfd8313d2afad7d9487da45b2","observation_id":"7ea3c8ce-77c0-445d-bd01-b461f07fa6db","resolution":{"observed_at":"2026-08-06T21:59:53.922369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.845444Z","title":"Executing both lightweight heads adds < 0.1 ms on a T4 GPU; compute cost is negligible","venue":null,"work_id":"18ba3cf6-71d5-4d09-b222-7bd92972cacd","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.904877Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ce5c1097afad14d8bb70d0e198f3137fc9a15e21e6becc005fd3f9a397eb9698","observation_id":"bdb4b1ab-253d-43b1-ad49-de25eab26a27","resolution":{"observed_at":"2026-08-06T21:59:53.882957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.690137Z","title":"Removing both losses scarcely changes accuracy (+0.13pp difference)","venue":null,"work_id":"83088ec3-45f3-4ec4-bf8c-c47be41ad5fd","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.963610Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ec6e51301c98c312a1c16eefba4cbec9e97758da4060e619fe247cc7d19c84c4","observation_id":"ba82faa4-c5a1-4229-9187-39e6a55a3b6b","resolution":{"observed_at":"2026-08-06T21:59:53.761905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.575091Z","title":"Entropy collapses from 0.40 bits to 0.02 bits—the gate becomes almost deterministic","venue":null,"work_id":"5b3f19b0-5789-4bb4-9b23-7d2278f67a8e","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.043860Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:5e0f5beef70d47a262968d156b2fe986e55b46f152c5ddca5050e13ffa616838","observation_id":"1879f162-15cd-469b-9782-76d4f4cce305","resolution":{"observed_at":"2026-08-06T21:59:53.627356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.461534Z","title":"Without losses, the FFNN path receives 99.7% of inputs; the GRU is effectively bypassed","venue":null,"work_id":"57b39564-faaa-43c0-b1cd-02137d59e250","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.121778Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:297de284b850ad3d7c0948426c294f5d55a353619b77459f58a1a03e6906ccb6","observation_id":"efefa1ed-897c-4a86-8353-bf476bb6d453","resolution":{"observed_at":"2026-08-06T21:59:53.514368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.344353Z","title":"Regularisation preserves a bal- anced and interpretable routing pattern, while the un-regularised variant hides all computation in one expert","venue":null,"work_id":"aa7e49e6-e13e-4931-87d5-bee2ddc27f94","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.181090Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:75965ffbe49a35425199a5ef0227d3148eae27ec39acf9c6375d51e159ffc87f","observation_id":"f1e995ce-7be8-48a0-a5dd-591956d02d6a","resolution":{"observed_at":"2026-08-06T21:59:53.398974Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.214639Z","title":null,"venue":null,"work_id":"f2383507-7057-4076-a61b-92efda300f19","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.247745Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:97e405898ab33ac3e6131413d808e4b61679891b7765e5271815182474e12985","observation_id":"4415ca7f-80a4-49bf-a6e6-f7ea3a0cccc8","resolution":{"observed_at":"2026-08-06T21:59:53.261853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T21:52:40.852684Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":10},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2506.22919."}