{"as_of":"2026-08-18T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fdfc36b194530d228e1847e9314e032328c01f065f1e38a6d969068ab930d60","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:36:50.447487Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T23:45:19.279268Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T23:49:15.450399Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2509.10513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.10513","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.10513 , year=","venue":null,"work_id":"4060144e-7df9-461b-9f5e-b51cd672878c","year":null},"citing_paper":{"arxiv_id":"2605.16349","last_updated":"2026-05-08T04:17:10Z","snapshot_observed_at":"2026-08-15T07:08:51.815605Z","submitted_at":"2026-05-08T04:17:10Z","title":"Geometric Asymmetry in MoE Specialization: Functional Decorrelation and Representational Overlap","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T23:45:19.279268Z"},"links":{"cited_paper":"/paper/2509.10513","citing_paper":"/paper/2605.16349"},"observation_digest":"sha256:641ac1b16e7e2da3518c7a9753177f834693fea80e13dc2a5fd669f94c028d0d","observation_id":"2a06419d-e714-40d8-9619-9fbbfd3233d9","resolution":{"observed_at":"2026-05-20T23:49:15.453008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10513/citation-record","integrity":"/paper/2509.10513/integrity","json":"/paper/2509.10513/citation-record.json","paper":"/paper/2509.10513"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.235799Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.235799Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:f0f861bf20853af28ce550dfa2d5c3c227b810af9cd7dce44bc8cfd7619ff05a","observation_id":"0ffae220-67e1-46b6-aa93-15c0eb37a678","resolution":{"observed_at":"2026-08-15T16:36:50.235799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.240889Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.240889Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:a4832000c8d4a7f4c1ee4184a6af49ad53a57870e289ecfd1725182e52732607","observation_id":"9cc0e8cb-19c4-4700-824c-82db968ed28e","resolution":{"observed_at":"2026-08-15T16:36:50.240889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.245551Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.245551Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:429eb717cfa99ae8314f4fdb3ab381df18e2bcb46a89d3d33dec886ccf2403f7","observation_id":"482e8043-ed4d-486c-8cf2-07cddfe1a429","resolution":{"observed_at":"2026-08-15T16:36:50.245551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T16:36:50.249812Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.249812Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:df214bdfe6fedaaadb44c922aa2fcdacfa522681ab0cb5eef1735622093c0da3","observation_id":"9f8e8478-43c4-4f0e-adb3-0ac7484cb721","resolution":{"observed_at":"2026-08-15T16:36:50.249812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.254117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.254117Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:0f1aea2bc388a47148b4966b6e9729bb7757b16e12c155fe0386c4ad6b857f23","observation_id":"6284c5ca-2977-46f9-abac-73bed05fc6b4","resolution":{"observed_at":"2026-08-15T16:36:50.254117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.258173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.258173Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:24b5eaf0aef37656bb4ab2cda3b297864c9435e9945994755f2c219980755ea2","observation_id":"f5889ef3-2c20-4e26-a13a-384063181e98","resolution":{"observed_at":"2026-08-15T16:36:50.258173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-16T13:39:21.916392Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-15T16:36:50.261926Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.261926Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:39f0442ec45e5aced0dd7de1e145f2938c8a02254a31c0580d7ec07dbc3cdf9f","observation_id":"8119f35d-7010-4110-a370-461966d38b9b","resolution":{"observed_at":"2026-08-15T16:36:50.261926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T16:36:50.265922Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.265922Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:5b9813b6c9fd3bec18fefa24bb7cc59a94816dd5177fedc85c6606eff4374d50","observation_id":"0a113532-3456-4b09-a956-4cd3c626a789","resolution":{"observed_at":"2026-08-15T16:36:50.265922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:51.005831Z","title":null,"venue":null,"work_id":"8d03cf26-753a-4258-aedd-f9ddaf503d55","year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.270275Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:a291282b6e3b9bdd3e7d79891662df7b1aa541d42707a7990c9b60c690033d55","observation_id":"0851fe0a-770e-4369-8098-2cbc62fbf05a","resolution":{"observed_at":"2026-08-15T16:36:51.010531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T16:36:50.274041Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.274041Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:c95dd4d7c490051f113f53d6f1c6d69c712381201e3193f164ad5c8931f24ab9","observation_id":"e1ee7e08-ba46-4b9d-a461-b5a853eb30fb","resolution":{"observed_at":"2026-08-15T16:36:50.274041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T16:36:50.278163Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.278163Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:31e18ee88327ed15e7b0d7f64b2eaa5bc5590c7271a5bb331ccc5016e3558763","observation_id":"f2497cd1-e18d-490f-88cd-69cfb18dc0d9","resolution":{"observed_at":"2026-08-15T16:36:50.278163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.282520Z","title":"Xu, Huazuo Gao, Deli Chen, Jiashi Li, Wangding Zeng, Xingkai Yu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.282520Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:9850b8a705a14b0fe7354e480b36df5af44c7d215d558a35c7e62277b0c795b8","observation_id":"10573cd3-1df9-4c01-8f79-e322d51421a3","resolution":{"observed_at":"2026-08-15T16:36:50.282520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06126","last_updated":"2022-05-12T14:39:21Z","snapshot_observed_at":"2026-08-16T17:00:46.272100Z","submitted_at":"2022-05-12T14:39:21Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06126","snapshot_observed_at":"2026-08-15T16:36:50.286544Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.286544Z"},"links":{"cited_paper":"/paper/2205.06126","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:2e658ee920716a3b796025a86f84e324ab1373a3959737dc65b19863cdcb7bc8","observation_id":"77aaa8c6-8490-4ad2-8c1c-e98ac8d8bf52","resolution":{"observed_at":"2026-08-15T16:36:50.286544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.525635Z","title":null,"venue":null,"work_id":"79c4297f-112d-48e9-9154-3c54876590c4","year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.290720Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:af945467fc4538baea918c97605f70fad5807885e30d3a22a19c8aedebe79111","observation_id":"3a732358-014d-4bc3-9c90-1d08a09ea162","resolution":{"observed_at":"2026-08-15T16:36:50.531656Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.294628Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.294628Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:9f575ba211db1b26b40ac702ef92308313051629cfd8ff82bbc06a8b9122cb6a","observation_id":"dc128b3e-92d2-48b2-94cb-cad57c2a7c2f","resolution":{"observed_at":"2026-08-15T16:36:50.294628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.981965Z","title":null,"venue":null,"work_id":"6c3e52ae-06ff-48cf-a586-1d847b2cec3a","year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.298200Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:1ef82e48668aaeb9106d3af18562d31a2e6dbbc2c9528974a1d0efa1b4189e90","observation_id":"4c066b49-d147-44c8-a4cd-989386b9c9e2","resolution":{"observed_at":"2026-08-15T16:36:50.987391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.301852Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.301852Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:edd129807651bdce6d1a1196cce0e76fa0eeb887ed9261af6cfd507a7d3f82c9","observation_id":"c1ca2dd4-04d8-444d-97b0-59047ba91fb5","resolution":{"observed_at":"2026-08-15T16:36:50.301852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12379","last_updated":"2024-07-04T02:55:57Z","snapshot_observed_at":"2026-08-16T14:33:15.456228Z","submitted_at":"2023-12-19T18:11:19Z","title":"Mixture of Cluster-conditional LoRA Experts for Vision-language Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12379","snapshot_observed_at":"2026-08-15T16:36:50.305511Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.305511Z"},"links":{"cited_paper":"/paper/2312.12379","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:0b483e985ee762e3c708e04a3d3e34b6e3f161dc1d0f42cd321f724a96a5d9bf","observation_id":"8d6dc96b-e6bb-470b-90fa-1533a46f0918","resolution":{"observed_at":"2026-08-15T16:36:50.305511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.309812Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.309812Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:d9ab7daf13bc15a778554175f4dfcc380e35f06458b3f7aa1229d36a031bd0ec","observation_id":"c87327c8-afe9-4e43-b269-a70c16b80f4d","resolution":{"observed_at":"2026-08-15T16:36:50.309812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.313610Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.313610Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:2497bc4a7fe7f00a111e82ce3fb844b063fc07cd8b2fc1becb5a6cb1b60a5f5b","observation_id":"260bcfb3-d314-4c4b-a643-af7ac7f87a9e","resolution":{"observed_at":"2026-08-15T16:36:50.313610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T16:36:50.317131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.317131Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:55afaa504feb3615a788cf46728d50ae401aef67f4199fb09ba3be155d7fdc9d","observation_id":"087514fa-2d42-4f15-b226-27ec83944322","resolution":{"observed_at":"2026-08-15T16:36:50.317131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.321299Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.321299Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:d775db4b1e360cc2fbd59715ee732694d2a88df75f710c5be31006733a9ab3ce","observation_id":"ebf4f247-fb94-4dd6-83de-21ea083c7cbc","resolution":{"observed_at":"2026-08-15T16:36:50.321299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.325179Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.325179Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:59b71ad199a7ea090045f0990500228d093d880d5b696c98e68cd0758ccbb234","observation_id":"abc0f476-4ddb-4a9e-a72b-795080e62395","resolution":{"observed_at":"2026-08-15T16:36:50.325179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.956104Z","title":null,"venue":null,"work_id":"997ea2b1-8590-437b-b0b7-47a8d4419a55","year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.328889Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:40ec532ba55d90862acdeac140ec1d8cc9cc48b9ff561f5133e4a322b70c669b","observation_id":"c9f83832-05df-4d17-9732-bb203ff268cc","resolution":{"observed_at":"2026-08-15T16:36:50.960386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.332184Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.332184Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:f3941639a632a4ccd885dbd307e974f55e6b1ca5dcf378124144e82c3ee22caa","observation_id":"8b1b2c54-12e9-4afe-9bb5-7c7dafdd49b2","resolution":{"observed_at":"2026-08-15T16:36:50.332184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.335800Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.335800Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:71c9edd3ed1b62f664a6be184bb2f4493e80c92b2a09c8bc5cc6331ea31e3d9f","observation_id":"165fa70b-b1e1-4009-9289-83ae5d3b4bc2","resolution":{"observed_at":"2026-08-15T16:36:50.335800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.919284Z","title":null,"venue":null,"work_id":"86b2f848-1fdf-4050-8815-a0f4d68f68f0","year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.339514Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:b02eb5a0865d6678d5df92ccb2575e0d0fa2461bb7b560357c4966028450eb11","observation_id":"fa09086e-5520-4c2b-be7c-227f79451882","resolution":{"observed_at":"2026-08-15T16:36:50.924913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.902276Z","title":null,"venue":null,"work_id":"2b29b49d-32b2-41eb-b3d3-d8c11e8800a1","year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.343047Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:963044acdb53837f13801438dbe9b5c2b11a2f25d136ac5949f7137b7c8e15a5","observation_id":"45cd535b-38aa-4896-8fbb-8b71c8ae6626","resolution":{"observed_at":"2026-08-15T16:36:50.907057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T16:36:50.346697Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.346697Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:69faf215a8db7790d60682dff1a864b35a591eab1f3fd0a39f193e539afb72c9","observation_id":"2852ddc5-fb5e-49c0-97d3-13b0fdb70cea","resolution":{"observed_at":"2026-08-15T16:36:50.346697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.888175Z","title":null,"venue":null,"work_id":"f14774bb-d870-4a06-bc21-a7a7c9e6bdb9","year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.350652Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:41626048c7443594c2cad5344b7918ba14e92b8072edfce11c3f9ee45fa7269c","observation_id":"a95d1216-da27-432c-9349-f3074f49d229","resolution":{"observed_at":"2026-08-15T16:36:50.892933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-17T04:55:07.787141Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-15T16:36:50.354322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.354322Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:7c0f9c56d47bf679edd281b08372038d5e39dd56e98bd159695a50438a75959a","observation_id":"809fe16f-75c2-42b7-a9f7-b2baf10c330b","resolution":{"observed_at":"2026-08-15T16:36:50.354322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10845","last_updated":"2023-03-20T03:39:27Z","snapshot_observed_at":"2026-08-16T15:47:00.459506Z","submitted_at":"2023-03-20T03:39:27Z","title":"PanGu-{\\Sigma}: Towards Trillion Parameter Language Model with Sparse Heterogeneous Computing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10845","snapshot_observed_at":"2026-08-15T16:36:50.358163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.358163Z"},"links":{"cited_paper":"/paper/2303.10845","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:662062be85dc0f6033375ecae51188ddce2c8de7257b5ae4a860deac4e56f5d6","observation_id":"d4f9ec71-2ff4-4ae9-b6eb-66e4b6769594","resolution":{"observed_at":"2026-08-15T16:36:50.358163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.362168Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.362168Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:d24f32f2a5aca75cb64ff317e1edc446b2245072e779f758d31f243a0606266e","observation_id":"9bb6017e-f413-4026-b2ec-c9767e88ebc1","resolution":{"observed_at":"2026-08-15T16:36:50.362168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01483","last_updated":"2024-09-02T22:35:03Z","snapshot_observed_at":"2026-08-16T19:00:57.789308Z","submitted_at":"2024-09-02T22:35:03Z","title":"Revisiting SMoE Language Models by Evaluating Inefficiencies with Task Specific Expert Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01483","snapshot_observed_at":"2026-08-15T16:36:50.365951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.365951Z"},"links":{"cited_paper":"/paper/2409.01483","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:fbe5974bf8abe266a808ac9f9cc7d4c738a219e127829a17b9229b2174d4588b","observation_id":"f8b2e5a6-da3f-4725-9089-e75ba701cc4d","resolution":{"observed_at":"2026-08-15T16:36:50.365951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.370186Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.370186Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:1680b26c0cb8867be13923bb946757bf462b818a0fae308b5c18eb5e0b5d3cb5","observation_id":"c12cd55a-b19b-4e39-80da-b82405657034","resolution":{"observed_at":"2026-08-15T16:36:50.370186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.869488Z","title":null,"venue":null,"work_id":"7fda0954-d1e7-4dc6-be76-53719c9516e9","year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.373922Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:80f312e7092cefcddaa552712da7859fa985fb38172a526fd28a1dda547aee1c","observation_id":"d2c5fe3f-143b-4d6b-b275-a9e6d1bc1d0c","resolution":{"observed_at":"2026-08-15T16:36:50.873172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.377459Z","title":"Smith, Luke Zettlemoyer, and Tao Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.377459Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:08a3695a75a7b81c45ca7ee626575e9b71fb326273716d11abc79ca0ed5446e7","observation_id":"a405f648-1f55-44fc-94f4-39cbcae16290","resolution":{"observed_at":"2026-08-15T16:36:50.377459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.381317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.381317Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:178b67e17d757eff5a160bf31b353922fc560fc7b7d82735afd9a5c121d7e109","observation_id":"4c1aa492-5c7a-4988-88f4-40d1121d4a07","resolution":{"observed_at":"2026-08-15T16:36:50.381317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-15T16:36:50.385979Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.385979Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:4ed04408bb8c19737a6b673601463f9f9121e33ec9f173f3aee16a1a7c31eba7","observation_id":"1887c162-5404-47e1-9c0a-9bc438055543","resolution":{"observed_at":"2026-08-15T16:36:50.385979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T16:36:50.390407Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.390407Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:058d253f9fb013b25a6dff898f5337dd38c7598847048bcb3f416c551fde9602","observation_id":"f898ae24-00d9-464e-af65-7b6a6f1497ae","resolution":{"observed_at":"2026-08-15T16:36:50.390407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-15T16:36:50.394558Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.394558Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:fc4ddbd21aa68d7b34843ae0b0a95de4c1e99c908ea66f4bc59747793d86774a","observation_id":"da67a0a1-d9ee-4317-b55d-42857f03321e","resolution":{"observed_at":"2026-08-15T16:36:50.394558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.398960Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.398960Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:e83313ddd019c080693dbd9d6868ec399200d6a4a891627873461be9b544fe80","observation_id":"fdc94d2d-dbb4-4c1d-a39d-654a6212bf1c","resolution":{"observed_at":"2026-08-15T16:36:50.398960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.403499Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.403499Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:6587e3ee2d0e7947a5e17c8c97301429723b35cd354980b280c8d459d093ecdb","observation_id":"046162d9-3d3e-45d9-a349-dcc2e14907a5","resolution":{"observed_at":"2026-08-15T16:36:50.403499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-15T16:36:50.408091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.408091Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:da80ca2abc04f61b8108c47b1a739e33043db09a99a0d48f34e12e473934c784","observation_id":"39394248-7c1c-4238-8cd3-e2cf3e49bcee","resolution":{"observed_at":"2026-08-15T16:36:50.408091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.412248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.412248Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:558b3421f55d4e9c25157e5a8bb9017ae0092a6f6cbf499ec18327c15ebebfff","observation_id":"2847f4b9-5950-44a7-8bb1-383722f81e37","resolution":{"observed_at":"2026-08-15T16:36:50.412248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02731","last_updated":"2024-09-24T14:14:40Z","snapshot_observed_at":"2026-08-16T14:29:38.902237Z","submitted_at":"2024-01-05T09:58:09Z","title":"Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02731","snapshot_observed_at":"2026-08-15T16:36:50.416385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.416385Z"},"links":{"cited_paper":"/paper/2401.02731","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:1f3c7b9512a6463c0674c9e44635334ab0ad006b7c78cd8b0501e85202709b13","observation_id":"02d36d2d-3d50-4f71-ae6e-f90a3bcac7b8","resolution":{"observed_at":"2026-08-15T16:36:50.416385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.833438Z","title":null,"venue":null,"work_id":"e55391f3-8ca6-4147-a808-77ba44c99765","year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.420448Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:0505482b2cc20dff59e48ce8ccbaf900b2417f9ce633e90e642072be49c68418","observation_id":"a12dcd96-e63a-4e1e-983d-a655e87cd725","resolution":{"observed_at":"2026-08-15T16:36:50.838141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-16T14:23:40.641998Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-15T16:36:50.424235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.424235Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:527834f0f1a8467f2df6be8a73ab7ffc8e52b4f3d53e13bf69317c1b56cd458f","observation_id":"dec2604d-4126-407d-859f-dd871c803708","resolution":{"observed_at":"2026-08-15T16:36:50.424235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.428251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.428251Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:12d13d902400cc13d2a87bcb238e01d73733bba7ff02ac0f66790feb6d01ec77","observation_id":"2e5b9f12-8e42-45e3-afd9-c9c95a19ee2f","resolution":{"observed_at":"2026-08-15T16:36:50.428251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.812383Z","title":null,"venue":null,"work_id":"3466ee7d-984c-492e-8f4d-473d242caffb","year":2023},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.433300Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:61fd69a1f217326b70af37ec8e0567472c3e9072a4c8d74ec3e8a4f6a38d40cb","observation_id":"1adfc469-1381-4f22-8ae5-0aeb53ab771f","resolution":{"observed_at":"2026-08-15T16:36:50.816151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:36:50.798943Z","title":null,"venue":null,"work_id":"86c2dfd5-47bc-44ce-9108-a870b01f7d76","year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.439693Z"},"links":{"citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:63c4ceadc327029421852c8f59b20d02e5b767340f75805d40859e0d827182ab","observation_id":"f3d838a4-7bda-4bec-a30a-8f3511f55785","resolution":{"observed_at":"2026-08-15T16:36:50.803533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11256","last_updated":"2024-06-17T06:47:03Z","snapshot_observed_at":"2026-08-16T13:42:24.610574Z","submitted_at":"2024-06-17T06:47:03Z","title":"Dynamic Data Mixing Maximizes Instruction Tuning for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11256","snapshot_observed_at":"2026-08-15T16:36:50.443245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.443245Z"},"links":{"cited_paper":"/paper/2406.11256","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:14dd335d4db795c1bec55277fbc126016214a34c4dd7f1415be96503dd4e3223","observation_id":"af2a2846-6f1b-4689-ad35-bca8e2e2d71b","resolution":{"observed_at":"2026-08-15T16:36:50.443245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-15T16:36:50.447487Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T16:36:50.447487Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2509.10513"},"observation_digest":"sha256:2e183a7b22e9a45a9fcf7fbee90c84e3eb2fb0fd86f78f7e4fda37488c4f918d","observation_id":"70494478-6be3-419b-9f4b-55f9e1fc4723","resolution":{"observed_at":"2026-08-15T16:36:50.447487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10513","last_updated":"2025-09-03T07:17:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T21:42:04.087938Z","submitted_at":"2025-09-03T07:17:35Z","title":"Mixture-of-Clustered-Experts: Advancing Expert Specialization and Generalization in Instruction Tuning"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2509.10513."}