{"as_of":"2026-08-18T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0792a0030068128ca2a1ec4dd6e917a29f2e73af8aec9c3c40b8d6a582cbe74","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:28:03.497703Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09907/citation-record","integrity":"/paper/2608.09907/integrity","json":"/paper/2608.09907/citation-record.json","paper":"/paper/2608.09907"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.632606Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":"f4b1895f-71cf-421b-8412-43512c6cdb6b","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.223641Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:84d9df4fcc80523eb4aae8669f9ea56255577aebaa3ac3504b6898048b2c938a","observation_id":"334858df-7240-43a7-b16d-83096baeda08","resolution":{"observed_at":"2026-08-15T14:28:04.639653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.612429Z","title":"The revolution of multimodal large language models: A survey.Findings of the association for computational linguistics: ACL 2024, pages 13590–13618, 2024","venue":null,"work_id":"aeb0c23c-5ded-4a0a-be80-e60eb6c813b5","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.229672Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:8a7ec28f67f021324211c3c719b52eeb78ea4e8e1faa633e094343ed0e777e9e","observation_id":"ba29f426-5e72-44b1-bc25-5494617eeda7","resolution":{"observed_at":"2026-08-15T14:28:04.619524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.235214Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.235214Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:637067cd0ac10c226bfefba91c2119d213481c07d1319ceba27402a22941482b","observation_id":"366ac47f-dead-4af2-8181-7612d2141d0d","resolution":{"observed_at":"2026-08-15T14:28:03.235214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T14:28:03.240670Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.240670Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:0efb043de28e06b2b07efe25fb10c395755acdbd933670f32181efe429ad9b51","observation_id":"94c59ba7-3525-4d63-a396-d42ecd34fd5b","resolution":{"observed_at":"2026-08-15T14:28:03.240670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-16T15:17:42.537490Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-15T14:28:03.246532Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.246532Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:b6cd3a0405436f80d6b6e255b00768f1a477be2c306cc987fc1bef02abfb7c6f","observation_id":"c72adca5-ade3-400e-9386-1962ca20f2de","resolution":{"observed_at":"2026-08-15T14:28:03.246532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.252089Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.252089Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:cd41dcafc3be1b91f96633d33e55cb8e1b5cac1038c30249838b402338275037","observation_id":"b5a79f69-402a-4a7b-83d2-f9545b2606e4","resolution":{"observed_at":"2026-08-15T14:28:03.252089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.258123Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.258123Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:558fb5296080f12d4de3bf143449d9f24a9fdaba336a4034c95e1c159b26f0cc","observation_id":"91739d52-682a-4d82-a064-4e427a967fcc","resolution":{"observed_at":"2026-08-15T14:28:03.258123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.541117Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"f2a46d1a-9a3b-4f81-8508-eee8260f1ed2","year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.264372Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c22add50e8c0d483477eac94bc959a1176e2dcdcbf3e857b5c776c08c9adfc4d","observation_id":"dbc19120-ca1a-4a08-a5a0-58e345d36f9d","resolution":{"observed_at":"2026-08-15T14:28:04.550145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T14:28:03.269959Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.269959Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:a9ae2bd4043149e85351c4ff5a36b50a342e3106af2ef9b74827a30bfb215d28","observation_id":"9ec78643-ae4e-4410-81f5-5962a19bccc8","resolution":{"observed_at":"2026-08-15T14:28:03.269959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07816","last_updated":"2024-03-12T16:54:58Z","snapshot_observed_at":"2026-08-16T14:10:29.723801Z","submitted_at":"2024-03-12T16:54:58Z","title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07816","snapshot_observed_at":"2026-08-15T14:28:03.275507Z","title":"Branch-train-mix: Mixing expert llms into a mixture-of-experts llm.arXiv preprint arXiv:2403.07816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.275507Z"},"links":{"cited_paper":"/paper/2403.07816","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:9eb970f82322bd9829bbb38e1f7a00510c8f09cda5db6adf4d7c01d33d5a7965","observation_id":"3df57005-5817-4f7d-9d5b-44f82f23eed8","resolution":{"observed_at":"2026-08-15T14:28:03.275507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.520253Z","title":"Biomedical visual instruction tuning with clinician preference alignment.Advances in neural information processing systems, 37:96449–96467, 2024","venue":null,"work_id":"6e1121ca-8bde-4990-bd8b-1267e02ff05a","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.281395Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c4098bfbebb1a36d709769571cc1c77e886dae1c27151b63626993ed622ba39d","observation_id":"356b6255-c2ae-4714-a6ae-0b3dc5ecef43","resolution":{"observed_at":"2026-08-15T14:28:04.527786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07024","last_updated":"2025-08-23T00:44:49Z","snapshot_observed_at":"2026-08-17T11:14:51.272511Z","submitted_at":"2025-07-09T16:54:21Z","title":"FlexOlmo: Open Language Models for Flexible Data Use","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07024","snapshot_observed_at":"2026-08-15T14:28:03.286914Z","title":"Flexolmo: Open language models for flexible data use.arXiv preprint arXiv:2507.07024, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.286914Z"},"links":{"cited_paper":"/paper/2507.07024","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c8f930cc35c2740c095556bff1ecfc71f9b66216fef54f1d196ddcd43edc15b3","observation_id":"c6f6a0fb-f260-4526-8f71-63325011f901","resolution":{"observed_at":"2026-08-15T14:28:03.286914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-08-14T20:51:20.111244Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2604.18473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18473","snapshot_observed_at":"2026-08-15T14:28:04.027116Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","venue":"cs.LG","work_id":"73d67e5e-1816-4a1d-91f4-75cf87372a42","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.292526Z"},"links":{"cited_paper":"/paper/2604.18473","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d0fb813dad791d663e4e82af112db94d84ae763e3a47b14528befca3b0a0d095","observation_id":"0e738a17-8ef7-4eea-ad26-e93bfaf8648f","resolution":{"observed_at":"2026-08-15T14:28:04.033673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.498671Z","title":"Learning to instruct for visual instruction tuning.Advances in neural information processing systems, 2025","venue":null,"work_id":"ac018d3d-0b1c-48d6-ab7e-bd497e398c53","year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.298087Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:5248fd2e16073ba900dd0e88d16ffd938f8c476814375ff180b15ba21ac2ad43","observation_id":"c9bb56c3-53cc-4f0c-8270-321f09f60b18","resolution":{"observed_at":"2026-08-15T14:28:04.504628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-08-18T08:21:10.395771Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-08-15T14:28:03.303694Z","title":"Lejepa: Provable and scalable self-supervised learning without the heuristics.arXiv preprint arXiv:2511.08544, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.303694Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:3ea532583eded15b637aa0cb760bb279695606369586555a2eb292be955cf44d","observation_id":"9d474a29-4214-4402-918c-de2585c70acb","resolution":{"observed_at":"2026-08-15T14:28:03.303694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.309133Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.309133Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:7e27262bb4a18cf46777d3928435df59de4bbc9bfe374f80e954a5bb55908ebe","observation_id":"85546d3d-60d1-4803-a9eb-6eefab72f498","resolution":{"observed_at":"2026-08-15T14:28:03.309133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.314679Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.314679Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:2cfe99706e47f52a9befa52d0f98071a23469377234477e9735548144bbb803e","observation_id":"6a53dd71-0415-4882-a2b8-6edab3578e9f","resolution":{"observed_at":"2026-08-15T14:28:03.314679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.320123Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.320123Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:7342e414e95f46473693c1e0fc3d24cf8c2d68d7fb9414a83c61594a0b9f5c80","observation_id":"1c7c0de9-f5c9-4d80-8440-22babf1250cd","resolution":{"observed_at":"2026-08-15T14:28:03.320123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.326562Z","title":"Coin: A benchmark of continual instruction tuning for multimodel large language models.Advances in neural information processing systems, 37:57817–57840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.326562Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:bb6cf91f7be180b25d7b115772eea16335cb274d05c251cc58cfe8f32a39bd4e","observation_id":"f957e008-9515-4c7a-934f-39515723fb70","resolution":{"observed_at":"2026-08-15T14:28:03.326562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02486","last_updated":"2025-05-05T09:09:41Z","snapshot_observed_at":"2026-08-17T18:52:14.502183Z","submitted_at":"2025-05-05T09:09:41Z","title":"SEFE: Superficial and Essential Forgetting Eliminator for Multimodal Continual Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02486","snapshot_observed_at":"2026-08-15T14:28:03.331863Z","title":"Sefe: Superficial and essential forgetting eliminator for multimodal continual instruction tuning.arXiv preprint arXiv:2505.02486, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.331863Z"},"links":{"cited_paper":"/paper/2505.02486","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:bf747c9ad3a14b2d686421e01ae091b51c78c1a6b809a41b512a089c0f6100a4","observation_id":"283204ce-6ce1-4d69-83f5-43c51c6837dc","resolution":{"observed_at":"2026-08-15T14:28:03.331863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27481","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.957139Z","title":"On token’s dilemma: Dynamic moe with drift-aware token assignment for continual learning of large vision language models","venue":null,"work_id":"20c3b42d-8e53-4e11-bcf3-372575933717","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.337403Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:06ea77f0164daee7e02855c901776949b651dcdbcf6e3b2117cd032d63f28ba1","observation_id":"8e983215-5422-4db2-bcfc-4ed1f80d0641","resolution":{"observed_at":"2026-08-15T14:28:03.967685Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.422698Z","title":"Kss-moe: Knowledge space synergy framework in mixture of experts for continual visual instruction tuning","venue":null,"work_id":"08d3b1d4-7d15-45cf-97ac-999a52e51f9b","year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.342546Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:ee72fb0ccff739d570ef8be96794dc82380ab6bc9f4c55fceb01fa69e832d882","observation_id":"ef6921de-9f86-4de4-8985-bcf17cc5b6d8","resolution":{"observed_at":"2026-08-15T14:28:04.428889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.347249Z","title":"Continual instruction tuning for large multimodal models.IEEE Transactions on Image Processing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.347249Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:5040219f17545c9ba6192839c89988918f16c0e1c68c2d1892d25aae69d8c5fc","observation_id":"2b312b7b-e6c0-4a33-938d-7795c2297616","resolution":{"observed_at":"2026-08-15T14:28:03.347249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.381854Z","title":"Model tailor: Mitigating catastrophic forgetting in multi-modal large language models","venue":null,"work_id":"4caf2edb-924b-4e3a-aef3-8ec93c75b261","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.352307Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:1a723482ba5f11df77be0c8686ba4f3de9591410a235fd08b860b171bb5b3f39","observation_id":"c660ca03-e2c8-43e0-89f1-3ad909bc1319","resolution":{"observed_at":"2026-08-15T14:28:04.391623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-18T13:04:14.626779Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-15T14:28:03.357493Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.357493Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:5db4dfb8917c8cf67743451f29fbc2ce401f2d2c6bf12473924e55686e8a2d21","observation_id":"4244ccb7-abc3-4f0a-aa46-e3d037045424","resolution":{"observed_at":"2026-08-15T14:28:03.357493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00044","last_updated":"2024-01-20T19:15:21Z","snapshot_observed_at":"2026-08-16T16:27:44.954449Z","submitted_at":"2022-09-30T19:12:58Z","title":"Task Formulation Matters When Learning Continually: A Case Study in Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00044","snapshot_observed_at":"2026-08-15T14:28:03.362537Z","title":"Task formulation matters when learning continually: A case study in visual question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.362537Z"},"links":{"cited_paper":"/paper/2210.00044","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:6d5b60081a891eebcb0305eb9be87025e9178212ee2fa2a7c1c5a1146ebf25ba","observation_id":"48561d4b-d0da-4536-9d78-f7d1c1ef979d","resolution":{"observed_at":"2026-08-15T14:28:03.362537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.367486Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications, and opportu- nities.ACM Computing Surveys, 58(8):1–41, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.367486Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:6d213219206771e001ee20c177d2b68fac7ce0a71e4c0e8193f5ee265555a093","observation_id":"b436b3ea-ad3e-45dc-b150-66d4d66c2e70","resolution":{"observed_at":"2026-08-15T14:28:03.367486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.346860Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"65e977a3-562d-47ec-95a2-4765d7313df8","year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.372420Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:1fd5dbf3ca40b412313d44d924abfd1eb96b71589031aa8acd6ad0aaccbe5a8a","observation_id":"b3765395-7332-4053-b3be-6b8725727466","resolution":{"observed_at":"2026-08-15T14:28:04.352771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-08-18T13:05:31.068739Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-15T14:28:03.377249Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.377249Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:4096e477ec3f95b5b899fd35c6b4d2d28e0615b46cd2df7e16b0261d5bea0bb8","observation_id":"1802ec4e-ea08-40c8-95e5-34ed216ef2b9","resolution":{"observed_at":"2026-08-15T14:28:03.377249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.382633Z","title":"Ties-merging: Resolving interference when merging models.Advances in neural information processing systems, 36:7093–7115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.382633Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:179a9bf80a8dbc57f63570f4d237ad714d576529202966e21fe5a6fb72b49d9b","observation_id":"927032dd-58ed-4915-bd4f-835bfc739b9b","resolution":{"observed_at":"2026-08-15T14:28:03.382633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-15T14:28:03.387697Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.387697Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:2dd9de528c4b1d5c9435993f3323b41ec6b667337ecfdcad3242193bf6064a45","observation_id":"4dbafb39-c0b6-4cd7-bf74-14c8b2dc5fc6","resolution":{"observed_at":"2026-08-15T14:28:03.387697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.315568Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":"05448414-5107-4d7b-85da-ad139fa36fec","year":2021},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.392893Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:6dddd521fc06a92e86d6c31824930f241636ec8a2707a2df50c21e0b95be7f09","observation_id":"6c2103a6-a1b7-4e66-937d-4834e5eda2e1","resolution":{"observed_at":"2026-08-15T14:28:04.321415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.397929Z","title":"Multi- modal contrastive learning with limoe: the language-image mixture of experts.Advances in Neural Information Processing Systems, 35:9564–9576, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.397929Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:0364d03f5033e81f20455b72c96f3a9aabb2289b981eee9bd483681aa0149780","observation_id":"9e1ecebd-4e17-45b6-a978-512d5f7c5644","resolution":{"observed_at":"2026-08-15T14:28:03.397929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.402868Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.402868Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:dc477ca8f01e97c2c3eb0e364102e9a57263f3fbe78f15a98035ba8017ea7c18","observation_id":"b2002d57-cd4b-4aac-85ef-33999ed888b4","resolution":{"observed_at":"2026-08-15T14:28:03.402868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.408361Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.408361Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:cb9b2841d64596a9e390e0aead98c8d70e5bd725b38d311c7551e7f3d82cafc2","observation_id":"5c10a25a-2d1c-47f3-9f57-37c96c5da5af","resolution":{"observed_at":"2026-08-15T14:28:03.408361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.260489Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"92d8cc69-63fa-4703-b716-ce387076c876","year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.413277Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:9f6dc01039fa795fd0a967c4bfa0a7d07e8b62a558dc6a0d28e4440dede962c8","observation_id":"1502c9a6-9f85-42af-b24e-8700222cd88a","resolution":{"observed_at":"2026-08-15T14:28:04.266506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.418137Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.418137Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:f70c750a89083371d245645eff22d8c96808f95c99958e77ce482dca2d90b5ab","observation_id":"03a8c1c8-75aa-4965-9449-602721776b37","resolution":{"observed_at":"2026-08-15T14:28:03.418137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.422959Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.422959Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:9dc293c59f3ea4bdb7805e9bdf1233129611013e9e389feaa1c7e4e722efa4c6","observation_id":"0e0bf72d-2b72-4ef5-9749-bafbe7994992","resolution":{"observed_at":"2026-08-15T14:28:03.422959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T14:28:03.428023Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.428023Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:4b6a2073d987bd5fbd536d0a62458e744b31c39e483eb13aec6de784861d3297","observation_id":"9123a8bf-8b55-4a70-974a-507c59e8fddc","resolution":{"observed_at":"2026-08-15T14:28:03.428023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.217936Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"36acb9c4-84c4-468a-91b3-03c13191baa6","year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.433442Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:1123ac570669b922eb1b9b83284b5286e75aa8a88d9c5b274e91b8a0d93c55b6","observation_id":"17a2eb29-623b-4d65-9604-27ee01e025df","resolution":{"observed_at":"2026-08-15T14:28:04.224648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-16T14:14:46.903233Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-15T14:28:03.438930Z","title":"Stable lm 2 1.6 b technical report.arXiv preprint arXiv:2402.17834, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.438930Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d5383ac2d16e27f098abbc8d337dda90121ee0fc3ef77546139beabe5b6ea548","observation_id":"f58eccf1-afb2-4b72-b1f0-fa07de793470","resolution":{"observed_at":"2026-08-15T14:28:03.438930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.444345Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.444345Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:92e6e4393117c897c0c9f7cca7e5a5baf0a152a5a4367b5ab1489440fd51f507","observation_id":"d85702ac-6cc8-4a2c-b355-753fb2351244","resolution":{"observed_at":"2026-08-15T14:28:03.444345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.174072Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in neural information processing systems, 35:2507–2521, 2022","venue":null,"work_id":"9423876e-ce05-4143-af73-ffee72ccea45","year":2022},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.450070Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d070fdc662568e14c53fa293dade86d0cdfcd5aad54fb4dcaf32cda72b85cb3a","observation_id":"4d799211-7be4-4559-b49b-1c24a029d440","resolution":{"observed_at":"2026-08-15T14:28:04.179989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.456212Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.456212Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:9b44ef4e637613d53730acf37b5e5e7a7107e45ba4402ec66a212ba848da26de","observation_id":"6c674b43-3624-4908-a16d-8ee5946e1ace","resolution":{"observed_at":"2026-08-15T14:28:03.456212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-15T14:28:03.461847Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.461847Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:62f82055ceb28333add09074e2dceae816faf329c842c71e3dd1a008e538a236","observation_id":"ff8403b6-20bc-47d2-aace-131625843645","resolution":{"observed_at":"2026-08-15T14:28:03.461847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T14:28:03.467146Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.467146Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:c9aaba29ea678f086ab06f802c567542f5784b77f9ed53d23ed28d785af61975","observation_id":"e62497df-a008-4c92-8335-a53149475b65","resolution":{"observed_at":"2026-08-15T14:28:03.467146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T14:28:03.472506Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.472506Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:43f1de3e299968419e51b42eeee4aa43a9c8a4274fc83b3e785d5a3402cdd9c4","observation_id":"a0a5bfdd-ca85-4524-a12a-cdff0f782880","resolution":{"observed_at":"2026-08-15T14:28:03.472506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:04.139468Z","title":"Open technical problems in open-weight ai model risk management.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"f4aebef9-c7ab-43a2-974c-5e678957cefb","year":2025},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.477372Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d6314e0eaf7caf6087db6b0c7d7a0df744d2dd8829ddb67761ce7f847ed82196","observation_id":"7e61a100-a497-4616-9b73-f557a769f6a2","resolution":{"observed_at":"2026-08-15T14:28:04.145289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-16T14:43:40.784191Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-15T14:28:03.481999Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.481999Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:697d7e330805d182baa5fa110b57acadfc0ef18f691b2eb538fcdbaa26cd63c5","observation_id":"39244b89-6a3e-4823-8faa-1fa97e178d37","resolution":{"observed_at":"2026-08-15T14:28:03.481999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-15T14:28:03.487166Z","title":"Aligning large multi-modal model with robust instruction tuning.arXiv preprint arXiv:2306.14565, 2(3):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.487166Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:d4c10b9a3cf5529c6e4219336f556656af0ccad93bafa341f31d85b37165c3fa","observation_id":"c6cc7074-b024-47ca-876d-a851c4191c9a","resolution":{"observed_at":"2026-08-15T14:28:03.487166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-15T14:28:03.492492Z","title":"Mimic-it: Multi-modal in-context instruction tuning.arXiv preprint arXiv:2306.05425, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.492492Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:87d4745e37a7bbfd4614ae6ac2a9cc14052fa4ab08d07a6dafea764df591d1bb","observation_id":"a5396789-b7bf-476a-87ae-b47731077739","resolution":{"observed_at":"2026-08-15T14:28:03.492492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7540.7986","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:28:03.647507Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"6fd9b442-0050-4b72-af32-008b88d9d98d","year":2024},"citing_paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T14:28:03.497703Z"},"links":{"citing_paper":"/paper/2608.09907"},"observation_digest":"sha256:12037df4735c734d2d68be64bffdc0d2ae317f52ed39914faec0a6d6169b961f","observation_id":"a254c35e-5805-4286-8ac8-7d48549f39c1","resolution":{"observed_at":"2026-08-15T14:28:03.659876Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09907","last_updated":"2026-08-10T17:52:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:28:08.405749Z","submitted_at":"2026-08-10T17:52:14Z","title":"DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.09907."}