{"as_of":"2026-08-08T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5048e98cc532a75f5d420e53fc3c0b35ae73a9fc6cf557e81c7f744c2d1e6c71","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:28:31.007992Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01805/citation-record","integrity":"/paper/2508.01805/integrity","json":"/paper/2508.01805/citation-record.json","paper":"/paper/2508.01805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:37.771893Z","title":"Attention is all you need,","venue":null,"work_id":"0f1639ce-ad8c-4775-b55a-63ca9c8eb0df","year":2017},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.162115Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:ca0fc38201a6ab0ac55407f856c30a652c8d2f8b10e911bc331bde10722c8401","observation_id":"58c4b7eb-5136-45ed-9d07-f7ef1e6eed79","resolution":{"observed_at":"2026-08-06T05:28:37.887978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:37.608174Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"3b50f3db-ccf1-4859-9f4b-f97e20e0dbad","year":2022},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.244021Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:47931b7c22bd033658d9dc1f6e393a85f2601a56b117fa3c09989ce2d760e36d","observation_id":"ed321ea6-c919-4db1-908b-82444a3d586c","resolution":{"observed_at":"2026-08-06T05:28:37.678178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:37.313756Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"e93f7f0b-90f0-4572-a225-0f1d47f6dbb4","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.357176Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:0864ccbecd1442119b9139e579ff348395e7766d9c0227bbeaaf37b5b0dd0212","observation_id":"b15e45c5-ffd7-4bc5-a1bc-8c6eecc18dd3","resolution":{"observed_at":"2026-08-06T05:28:37.468973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:37.034321Z","title":"Visual instruction tuning,","venue":null,"work_id":"79825ab6-1352-496e-a45a-84e681c68728","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.480107Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:7d0bb7fbae9b420edf14bb8622b2a0f446db38a945e1583ff292196290116a32","observation_id":"77a02c35-d8e1-46ea-aab5-a0461c5db666","resolution":{"observed_at":"2026-08-06T05:28:37.154463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:36.804074Z","title":"GPT-4V(ision) system card,","venue":null,"work_id":"c6069be5-de5b-481c-9b64-d58d63e27553","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.566506Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:6bc00e9c4a18108bf751472338dbbf1ab57caf28dcf349772cb95d5504fbc543","observation_id":"d7c8ea46-75e0-40fd-a5c4-67bee9205e83","resolution":{"observed_at":"2026-08-06T05:28:36.901875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T05:28:27.682913Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.682913Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:ed9c8543b402f6d4a5f0c1381c88a13e150821ab24e318d18ec522e85e10cebb","observation_id":"a7de76dd-a279-4fba-bad9-47a991aed3c7","resolution":{"observed_at":"2026-08-06T05:28:27.682913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13165","last_updated":"2023-11-22T05:15:12Z","snapshot_observed_at":"2026-07-06T16:50:58.750467Z","submitted_at":"2023-11-22T05:15:12Z","title":"Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13165","snapshot_observed_at":"2026-08-06T05:28:27.791343Z","title":"Multimodal Large Language Models: A Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.791343Z"},"links":{"cited_paper":"/paper/2311.13165","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:913572a641dab7793e06acc3303d6bf199b715b5f75b6c8586aa58a38c4d705e","observation_id":"3a6a6579-913a-4db8-8c3f-40291285f713","resolution":{"observed_at":"2026-08-06T05:28:27.791343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:36.519797Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"06b43905-df7c-4e25-b266-e52fb0708cda","year":2021},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:27.907772Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:62640ff8965064935efe6dd037be9a8aa4e58da7623eaaf82421dfa4aafdaa6a","observation_id":"4b7ad9f2-723d-495f-8c70-bbbcceb3df7e","resolution":{"observed_at":"2026-08-06T05:28:36.663757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:36.281518Z","title":"GPipe: Efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":"6184156e-c381-42b3-9b97-db956a526676","year":2019},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.008715Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:d4f4c7df972ab0ed2962d0e3733c056c1839d959ece702a25118f6916b3a4881","observation_id":"1c579584-1d74-401b-bf4d-c766e6744607","resolution":{"observed_at":"2026-08-06T05:28:36.382048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:36.103471Z","title":"Are we ready for autonomous driving? The KITTI vision benchmark suite,","venue":null,"work_id":"a2880b5e-3790-4589-8d01-5f4f69c0a860","year":2012},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.112758Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:a114aad4afc6ee15cb407c458f172238b3033b0cbbe19af20ed59dc10bc8068f","observation_id":"2fc2a36b-fc36-4aed-bc34-11bb0d7e18c6","resolution":{"observed_at":"2026-08-06T05:28:36.161539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:35.861328Z","title":"CheXpert: A large chest radiograph dataset with uncertainty labels and expert comparison,","venue":null,"work_id":"eace71c8-0a59-4aee-8799-e648924dd732","year":2019},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.245719Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:88ff04d6550d58a2091ad5b4bea355fcd407dc51d58304e64c7fc5d2496a9829","observation_id":"e968f2ef-eb65-473b-a658-f297bfcc937b","resolution":{"observed_at":"2026-08-06T05:28:35.979321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T05:28:28.330922Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.330922Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:879a517cc37ca777b0699069de9c5d0fc89362ffa27d854d8d03c06809e9e076","observation_id":"4693fc8e-b960-4e65-a0da-3112d475814f","resolution":{"observed_at":"2026-08-06T05:28:28.330922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:35.611999Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":"c0783660-d3d4-414a-b3aa-ed84d35c672f","year":2017},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.464722Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:fabac40c80ad9abd6612801670c493303f4662264f74e8b6636d7b254740644e","observation_id":"ded83ce8-1ede-430b-8f3a-0071dfc61015","resolution":{"observed_at":"2026-08-06T05:28:35.696692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13046","last_updated":"2024-10-31T17:39:34Z","snapshot_observed_at":"2026-08-05T02:05:40.291312Z","submitted_at":"2024-04-19T17:59:48Z","title":"MoVA: Adapting Mixture of Vision Experts to Multimodal Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13046","snapshot_observed_at":"2026-08-06T05:28:28.582750Z","title":"MoV A: Adapting mixture of vision experts to multimodal context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.582750Z"},"links":{"cited_paper":"/paper/2404.13046","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:625e7c24f155ca62ec5d124fce0144e48c31e1c6384c4e23a330df5593dcff28","observation_id":"6dbc7e4e-478f-414e-ac8f-4d80661a55fa","resolution":{"observed_at":"2026-08-06T05:28:28.582750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-06T05:28:28.723551Z","title":"MoE-LLaV A: Mixture of experts for large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.723551Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:44c13efd217287ad0f69b2295e914b168479b034ba0616b9dc144fe828fdf000","observation_id":"fc9e6c91-c1ad-4e8a-853f-ccccfda0095e","resolution":{"observed_at":"2026-08-06T05:28:28.723551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11273","last_updated":"2024-05-18T12:16:01Z","snapshot_observed_at":"2026-08-03T11:46:26.153374Z","submitted_at":"2024-05-18T12:16:01Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11273","snapshot_observed_at":"2026-08-06T05:28:28.885000Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:28.885000Z"},"links":{"cited_paper":"/paper/2405.11273","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:f926cd3418805051ee4955ced055e9bda3c9b224a20b928878281e8c16e676ba","observation_id":"800b636e-a3e2-47da-b929-62c22976b28c","resolution":{"observed_at":"2026-08-06T05:28:28.885000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-06T05:28:29.028589Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.028589Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:01e3b9293614ff901512caff9319cd2b11485115aff85b3c69d7a1cda83cb079","observation_id":"5053dd87-4df4-425f-a960-ea5c9efa6517","resolution":{"observed_at":"2026-08-06T05:28:29.028589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:35.401499Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference,","venue":null,"work_id":"79511eeb-c716-4ee8-8551-957e73dcf11e","year":2018},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.118082Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:ec5da7746d0e0deeee6d8d9d86b2308c842ecc9b855987abae77087ea352452d","observation_id":"a1c95fab-a0bd-4c02-bdee-1baf6f6db446","resolution":{"observed_at":"2026-08-06T05:28:35.498999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:35.154455Z","title":"Semantic communi- cations for future Internet: Fundamentals, applications, and challenges,","venue":null,"work_id":"140194fb-13cd-48c2-aabc-03a01b49de8c","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.175454Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:310a7c7da92d0c7cac4b5043f854054fc9861691aaf15a06c76602ed41ecdd29","observation_id":"7f590711-5ed2-4868-9ad3-f1c73bf8941a","resolution":{"observed_at":"2026-08-06T05:28:35.259834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:34.890498Z","title":"Model Context Protocol: An open standard for connecting AI assistants to the world,","venue":null,"work_id":"bf0e1fff-47e8-46cd-9107-e487fd068a18","year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.274728Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:18ccf7f1f2f2fabad89c35236e65b487d0dc3b1a49e8db98acd3f9e46c5f0d52","observation_id":"7d2684f1-2d5e-4d65-bbb2-20e441305abc","resolution":{"observed_at":"2026-08-06T05:28:35.048642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:34.665510Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"4a146d9e-c680-4712-b69f-66a7306d1dbc","year":2018},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.371945Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:df4413c3284f874f5ceb5361c07bcca777471b5cedbf6fb3dc5750ac5e2e7355","observation_id":"2a38a444-a312-4dcd-892d-59ae20333ce1","resolution":{"observed_at":"2026-08-06T05:28:34.758087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:34.403085Z","title":"Variational inference: A review for statisticians,","venue":null,"work_id":"e8cabd0f-a4a2-4346-ac6d-321e9688368c","year":2017},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.453585Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:b93a0f90fd0639fe2bfbd0be27e3c776d727db022a73130150a97e0e56e30be0","observation_id":"cce9d416-f28e-4688-b77b-f1004b543d4d","resolution":{"observed_at":"2026-08-06T05:28:34.538165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:34.151400Z","title":null,"venue":null,"work_id":"a896408d-0a47-4ca2-999a-121cd2c8c5b6","year":2002},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.523900Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:2b066f1a2344b19646d34229068c3e8fe0b5c9fd0ff466e710c79cb4d732b4d5","observation_id":"91906a3f-c0c1-4c59-989a-69f55e9b67da","resolution":{"observed_at":"2026-08-06T05:28:34.258420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:29.582311Z","title":"Goldsmith, Wireless Communications","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.582311Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:4725796d717917df2a02aa10b855ad65889b937f3dea238d418ed8bbb8aad916","observation_id":"8d491f23-dcb5-4121-b3bb-c2effb726810","resolution":{"observed_at":"2026-08-06T05:28:29.582311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:29.658115Z","title":"Correlation model for shadow fading in mobile radio systems,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.658115Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:f33e46c0bf5c967e75aad3b0ac449a55904f461882bbf83604fcd0fed792c6da","observation_id":"0362e2d8-cdf2-47dc-a51d-fdc6fd1c5fe3","resolution":{"observed_at":"2026-08-06T05:28:29.658115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:29.723707Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.723707Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:e379b266c86e655a133642c889879afa27aa9065215ec21afd44070c57d79276","observation_id":"b0baa3cc-65b8-466e-955f-beb4bfd46632","resolution":{"observed_at":"2026-08-06T05:28:29.723707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:29.784574Z","title":"Billion-scale similarity search with GPUs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.784574Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:934b81e9523ce613685040b31d5f896600e8d71a67a169ecc73cfbdc62a83ca8","observation_id":"36a5f0af-7e02-4208-ac75-e46934ddb293","resolution":{"observed_at":"2026-08-06T05:28:29.784574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s13638-019-1517-y","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:31.600083Z","title":"Design of coherence- aware channel indication and prediction for rate adaptation,","venue":null,"work_id":"9b70cc42-3c35-4dd0-ad9f-f6d3b33c2803","year":2019},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.850481Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:821ab685e577fa85c3ae5a35aebabe2db5152291339078161413d9158bc703db","observation_id":"0da89616-29ca-4e87-a233-58bc37123e45","resolution":{"observed_at":"2026-08-06T05:28:31.716166Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/1271526","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:31.362823Z","title":"Bayesian Forecasting and Dynamic Models,","venue":null,"work_id":"aa2b3d26-32d1-4273-a00f-51228b293aac","year":1997},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.908023Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:635ef953226dd691c92adc89814a3938cae37b90c872c6eb43103c6c05fadd46","observation_id":"7ce1394c-4d72-4683-a49f-41b8d0a5dfd1","resolution":{"observed_at":"2026-08-06T05:28:31.477624Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/e26110959","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:31.176992Z","title":"Exact Expressions for Kullback–Leibler Divergence for Univariate Distributions,","venue":null,"work_id":"afc27183-503a-43f5-a1a9-3857ece92d1d","year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:29.970215Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:53e4cd1b85604081096d88cecf1fa61c433e42944ef17a867f679495e25d5ea4","observation_id":"28e9d839-f3f2-4cc9-8531-de9553b01419","resolution":{"observed_at":"2026-08-06T05:28:31.241572Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T05:28:30.019543Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.019543Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:767072bb47b736d859dad99eb0b8a2bf38c2b8676e4267eeb4eb9f5f958a01d4","observation_id":"f56c7da4-9cd1-4f91-9c7f-8c997624180d","resolution":{"observed_at":"2026-08-06T05:28:30.019543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:33.849253Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":"d698dd82-4a4b-4059-9147-2816057c566e","year":2022},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.065261Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:4bb981295be9c3294e45de5ccff0130a95ba8690b17367c6c7a511b3e7f5011f","observation_id":"a31d8df1-eb42-4528-9056-a0e2f1567566","resolution":{"observed_at":"2026-08-06T05:28:33.966178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:33.642340Z","title":"EdgeViT: Efficient visual modeling for edge computing,","venue":null,"work_id":"ae0f684a-0d97-4f94-be49-0f44419f1d9b","year":2022},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.150058Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:17fe5b0d4f801c7dc1b619e771de81340aa6f5611143fb60cc5e188b8547f8bf","observation_id":"95778c97-8116-42e5-b4f8-c7e2cab0d1e7","resolution":{"observed_at":"2026-08-06T05:28:33.744255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T05:28:30.225411Z","title":"DINOv2: Learning Robust Visual Features without Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.225411Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:805cebd2ffa61fb1affe339f6b973fdf17e367a581183cc0f8fa8b8a2c4d2653","observation_id":"08aff055-873e-4ef2-bb1c-568401557bfb","resolution":{"observed_at":"2026-08-06T05:28:30.225411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:33.439251Z","title":"Carion, F","venue":null,"work_id":"5ad47bd7-387c-4e48-a064-e5f60a1cd872","year":2020},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.260805Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:37d5824b0e027cb0fa83032ffb9aa662ec228b637be431935437a59ec781cac3","observation_id":"9058a541-53e6-438f-a111-27bfd4bec2f3","resolution":{"observed_at":"2026-08-06T05:28:33.517529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:33.169086Z","title":"”Segment anything.” Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"3c7e0bf2-b347-4e39-825f-0bd01170f8d2","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.311042Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:6579d128409d3c804902b1e79b871db2e34e889cd7abc3888e50abc0cbb5a7df","observation_id":"7863eb52-77b9-423b-a111-ea6429067e00","resolution":{"observed_at":"2026-08-06T05:28:33.272765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:32.991110Z","title":"”Pix2struct: Screenshot parsing as pretraining for visual language understanding.” International Conference on Machine Learning","venue":null,"work_id":"fa290a02-6b44-40c2-8d77-29fb8e77f2fc","year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.385137Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:b0e2c71b48b76a513e2a199bd4c7918f0cc43bb3492aae5c929f0700ad07f0dc","observation_id":"ce69559f-c102-46ab-b8e5-a147c4252005","resolution":{"observed_at":"2026-08-06T05:28:33.075370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:30.440513Z","title":"DePlot: One-shot visual language reasoning by plot-to-table translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.440513Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:669297376d6cea990a3aed1c498c6e4a47c16c2f60e4df4b0325fae7fef157c7","observation_id":"be705dd5-c18e-4b77-9ace-73c05ce9de7e","resolution":{"observed_at":"2026-08-06T05:28:30.440513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:32.750723Z","title":null,"venue":null,"work_id":"29aaf821-e45d-44b4-93b6-ff901de46d8c","year":2024},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.521602Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:fa178f376b8668b29b543cafc7a0266f4b05141f2549318b38e635f1c7bfcd32","observation_id":"2746403a-70de-4f48-8073-6af1059634fe","resolution":{"observed_at":"2026-08-06T05:28:32.867902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-06T05:28:30.630380Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.630380Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:91ea98d5425a9151291f8b0e965b673b39237c8458173952ebd868e6d0a224cb","observation_id":"50dad1d6-a554-4ca9-a40a-e9e7f5189ced","resolution":{"observed_at":"2026-08-06T05:28:30.630380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00445","last_updated":"2022-05-01T11:01:28Z","snapshot_observed_at":"2026-08-07T07:47:07.886786Z","submitted_at":"2022-05-01T11:01:28Z","title":"MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00445","snapshot_observed_at":"2026-08-06T05:28:30.709973Z","title":"MRKL systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.709973Z"},"links":{"cited_paper":"/paper/2205.00445","citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:5e2abde5b94db5395479d43f7664e38b2c5ab471a6c4e2d6cfc3c420605171a2","observation_id":"6da73563-e187-441f-8a2f-5f71241f4148","resolution":{"observed_at":"2026-08-06T05:28:30.709973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:32.555802Z","title":"Resource manage- ment with deep reinforcement learning,","venue":null,"work_id":"bcd57615-432e-4cdb-81a9-d1edad3c07d2","year":2016},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.819463Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:ee2c5d98ef8970c9ce2858cbe861e1c5d81af50bd89af55c2c920375a8e21ca4","observation_id":"c4d33446-d77e-48f7-a07a-b4a0f4f72c5a","resolution":{"observed_at":"2026-08-06T05:28:32.621476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:32.416166Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"b0a9dc7f-f7d5-4902-9ff7-0dad7cdaedec","year":null},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:30.918159Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:b57b2db99fd60ee7a2377b1c025bef80cc76d6bb415f743f630a943fcc49720b","observation_id":"c0ffb6cc-622d-4746-a4ae-1b65ca98c86e","resolution":{"observed_at":"2026-08-06T05:28:32.486135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:28:32.216276Z","title":"Adaptive computation time for recurrent neural networks,","venue":null,"work_id":"bc1b0921-3cc9-41b5-b02d-9b68b09daf07","year":2016},"citing_paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:28:31.007992Z"},"links":{"citing_paper":"/paper/2508.01805"},"observation_digest":"sha256:235ec901a7bd905dd3d29bf87ae25a09ffc0c3642a228bf94b4914974b13e032","observation_id":"46009e0b-efe7-40a3-a11a-4b523ee682f1","resolution":{"observed_at":"2026-08-06T05:28:32.290618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01805","last_updated":"2025-08-03T15:42:05Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-08T06:11:52.776407Z","submitted_at":"2025-08-03T15:42:05Z","title":"M3LLM: Model Context Protocol-aided Mixture of Vision Experts For Multimodal LLMs in Networks"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2508.01805."}