{"as_of":"2026-08-13T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c07d462bda48c7150b2621dae8125c2ac81eb1f02d4368b9039903b44b3fbe9","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:27:13.689128Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:57:21.526961Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:57:29.885926Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"cited_work":{"arxiv_id":"2501.01709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01709","snapshot_observed_at":"2026-08-06T23:57:29.885926Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","venue":"cs.CV","work_id":"d01fc27b-b849-4405-8535-526169cc6c09","year":2025},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.526961Z"},"links":{"cited_paper":"/paper/2501.01709","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:aca1766f1cfc6f9358a23c0dd0170c12246fc41c7cce507afb003df802563734","observation_id":"67cb66a0-1f7c-4564-97a1-625fa7ed7c47","resolution":{"observed_at":"2026-08-06T23:57:29.890113Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01709/citation-record","integrity":"/paper/2501.01709/integrity","json":"/paper/2501.01709/citation-record.json","paper":"/paper/2501.01709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T22:27:13.382925Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.382925Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ab2a31730d509298a0817196ada61f56cbaa8d66c9b5027a0fbea0708225be95","observation_id":"cf6a0da2-a87d-43cc-8679-884247b53839","resolution":{"observed_at":"2026-08-10T22:27:13.382925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.389227Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.389227Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:757f987aa8aa54b4f18f8fd831baf669c3ba8938de18afcc5941acb2c7418640","observation_id":"72bc8d5d-2859-488b-9811-fdd6089aacd4","resolution":{"observed_at":"2026-08-10T22:27:13.389227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15414","last_updated":"2024-02-23T16:20:29Z","snapshot_observed_at":"2026-08-13T04:12:00.339250Z","submitted_at":"2024-02-23T16:20:29Z","title":"Does Combining Parameter-efficient Modules Improve Few-shot Transfer Accuracy?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15414","snapshot_observed_at":"2026-08-10T22:27:13.394598Z","title":"Does combining parameter- efficient modules improve few-shot transfer accuracy?arXiv preprint arXiv:2402.15414, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.394598Z"},"links":{"cited_paper":"/paper/2402.15414","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:46baebf98b6911573ee5bcda0c50a602e545d982c474efb9699fffe22b65af00","observation_id":"394a6094-ea0f-44c6-aa33-56a8d98c6341","resolution":{"observed_at":"2026-08-10T22:27:13.394598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T22:27:13.400410Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.400410Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:52034d43fb90bfeb0ad335aa1f3999e8c6fc46d85c7201bd8c72fe9fadc18cc7","observation_id":"29eadd2a-b321-4116-aaba-f565bcd3dc3b","resolution":{"observed_at":"2026-08-10T22:27:13.400410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:27:13.406616Z","title":"Qwen-VL: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.406616Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:e6bfa39ff13f4fc13467e333eabaa234bf7d7fd35324b0cf85171b3bb0440537","observation_id":"c1af4069-2089-434c-a895-c190c413f8ee","resolution":{"observed_at":"2026-08-10T22:27:13.406616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-10T17:03:38.042994Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-10T22:27:13.412710Z","title":"Deepseek LLM: Scaling open-source lan- guage models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.412710Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:fdc375754552b7830a466d4aa193da80cff61756b047071c3bf905591a483778","observation_id":"2687125c-24e1-48de-ab2e-96b715d75515","resolution":{"observed_at":"2026-08-10T22:27:13.412710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T22:27:13.420168Z","title":"InternVL: Scaling up vision founda- tion models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.420168Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:7f4186d23e053602b4bab61160a326b61ee47cc3d0faaef3c536fb69bd7e5873","observation_id":"e50f52a4-ca56-4c32-a693-2cd55c8f7e59","resolution":{"observed_at":"2026-08-10T22:27:13.420168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-10T22:27:13.427397Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.427397Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2a57aecfa93d4e06e2c15a48cb0849a8ed9818c7b1da8a8f72ac19cd86ac621c","observation_id":"f2fa7aa1-aa03-43d2-87b6-742b494381e7","resolution":{"observed_at":"2026-08-10T22:27:13.427397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.620889Z","title":"Vision transformers need registers","venue":null,"work_id":"f383b7d9-657d-44fc-9c1d-8bd7819aceda","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.436265Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:32e5b7f4592d63bd933a47b09a2f5f684b1a0b8af960a9c6977b0e4d65334897","observation_id":"4034b046-be82-4ccd-ac3f-6a160a373862","resolution":{"observed_at":"2026-08-10T22:27:14.627450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.441521Z","title":"Eva-02: A visual representation for neon genesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.441521Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:6aa4d92e14daf3b596e74964ebc528437ee9af57eb84647bc0c32f593222f170","observation_id":"8aec9829-59fc-488c-b5c1-76ea0e4368cd","resolution":{"observed_at":"2026-08-10T22:27:13.441521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T22:27:13.447468Z","title":"MME: A comprehensive evalu- ation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.447468Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:e4a4aaff0e8d5b0c914988f00fa43f150e201ff5f8e07c2c0b566dcf840400f5","observation_id":"65d36236-5e96-4cbd-9627-66da1a147166","resolution":{"observed_at":"2026-08-10T22:27:13.447468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.452669Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.452669Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1d4092c71acfd5d3642daa5825c2c816a7e3ec2effb0ef2797923c6129ba79b2","observation_id":"578d87cc-5f4c-4c24-8401-dedc8188ec17","resolution":{"observed_at":"2026-08-10T22:27:13.452669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.458349Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.458349Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2375b4e8dcba76f10b716686102089ee59aa80d3b4e41e954bb4d3208f5664f2","observation_id":"daca6a56-0b16-47e8-b833-314ee6d83281","resolution":{"observed_at":"2026-08-10T22:27:13.458349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.464635Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.464635Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:9fb52fafcbafa6df8be47438a5ed17c16a66b3996b8bd5000876be9dba82182b","observation_id":"bba2ffc5-ee89-464a-9fbc-86b4d9ca3449","resolution":{"observed_at":"2026-08-10T22:27:13.464635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T22:27:13.470237Z","title":"Distilling the knowledge in a neural net- work","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.470237Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2071508792e468c63b44a8be336dca913de23d37cc72adb409e7df4690ef97ec","observation_id":"488b43f6-0e74-4076-bee2-cd45e28ef5b9","resolution":{"observed_at":"2026-08-10T22:27:13.470237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:27:13.475542Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.475542Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:4e14156e6c17abf3b2b96e67c44a2918ce25cb670770b993bfd8431222449db6","observation_id":"5271c9cd-2ae0-461f-85cc-35d4c849efe7","resolution":{"observed_at":"2026-08-10T22:27:13.475542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14589","last_updated":"2023-03-02T14:10:40Z","snapshot_observed_at":"2026-08-11T05:21:07.129406Z","submitted_at":"2022-05-29T07:32:00Z","title":"Masked Distillation with Receptive Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14589","snapshot_observed_at":"2026-08-10T22:27:13.480425Z","title":"Masked distillation with receptive tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.480425Z"},"links":{"cited_paper":"/paper/2205.14589","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:9d34ef09b46ea885e0a828fe30a69eb78d766668334949e54202922bbf3d097c","observation_id":"d5f3b0c7-f067-4180-a8e8-8e2f027fb0d0","resolution":{"observed_at":"2026-08-10T22:27:13.480425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.563041Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"75b14c9f-45cc-4379-8d44-c4379b5b52d1","year":2019},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.486669Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:7f51dd8792adcf988eaa3744f6900e9178c0c70f2b5e14b484b01091212318e2","observation_id":"f62af99d-6761-4c4f-8e45-5d29316f57ed","resolution":{"observed_at":"2026-08-10T22:27:14.568334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.492983Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.492983Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:05133c53f504ccde0d4fe6f80a0881396a104f86ff89e5a0a121553cd1c887d6","observation_id":"87fc07ba-5945-4995-863d-0ebb0777647d","resolution":{"observed_at":"2026-08-10T22:27:13.492983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.534970Z","title":"Lift3d foun- dation policy: Lifting 2d large-scale pretrained models for robust 3d robotic manipulation, 2024","venue":null,"work_id":"63476f54-d696-4cf8-a812-941fc3e93616","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.498263Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:f2a36061297818f4ef5d3b5114c291693481433c56e040c0e62abf98f38a082b","observation_id":"6154a4ab-ccde-4993-8d97-e860da380d1c","resolution":{"observed_at":"2026-08-10T22:27:14.540306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.507315Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.507315Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1ff06159d6b8964e210ead19c2cb7df5f7fdfd189e946945988fd664aab08218","observation_id":"abd0a356-d95e-490c-9744-21e05817f992","resolution":{"observed_at":"2026-08-10T22:27:13.507315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-10T22:27:13.513574Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.513574Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ec6e2ca976dee8c9c3cc93a83597345034aa7aaa3ff608fde3cd7f6fbce0d561","observation_id":"6c29da05-1f08-4f24-a27b-e8095cba03dd","resolution":{"observed_at":"2026-08-10T22:27:13.513574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11273","last_updated":"2024-05-18T12:16:01Z","snapshot_observed_at":"2026-08-13T00:04:37.436381Z","submitted_at":"2024-05-18T12:16:01Z","title":"Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11273","snapshot_observed_at":"2026-08-10T22:27:13.519870Z","title":"Uni- moe: Scaling unified multimodal llms with mixture of ex- perts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.519870Z"},"links":{"cited_paper":"/paper/2405.11273","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:3fb4974f05a60e6ca29925278f1e7add5ccea32e073c6d3fffe54cba10a62bfd","observation_id":"cb110152-8f13-4916-a61a-3729b7c2f7d1","resolution":{"observed_at":"2026-08-10T22:27:13.519870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T22:27:13.527145Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.527145Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:c21842327bc9b2961460c7e30d26200ef09a9010321e887e2468b1da87d433bd","observation_id":"101b2808-9905-4246-8aaf-4da0ed31e7c7","resolution":{"observed_at":"2026-08-10T22:27:13.527145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-10T22:27:13.532542Z","title":"Moe-llava: Mixture of experts for large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.532542Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:6a9b437422a082e0764e969105763bc427269d6004089b503dcc6ca237726827","observation_id":"c2d3d16b-74e6-4b1f-8485-73d85e27d9b2","resolution":{"observed_at":"2026-08-10T22:27:13.532542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-13T00:41:56.015469Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-10T22:27:13.538320Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.538320Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:5e422e8f0307eb8d16366d5e54f84731c221a382fc48486cc4c94dc3b43b2cbc","observation_id":"3b8063a9-da3c-4c10-9bca-b042bab36ae5","resolution":{"observed_at":"2026-08-10T22:27:13.538320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T22:27:13.543646Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.543646Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:c154647a4cc9ee1f2e42533cb933b0900d38e78f3dff0878a7780c98e3e1e3df","observation_id":"6f68b4fa-2d80-436e-85a4-0f58ef3f9bdc","resolution":{"observed_at":"2026-08-10T22:27:13.543646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.548511Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.548511Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:2330ce03b59971bbf0611c5af43de931cf7e3eda6e9cae3d86c2d205fb14702b","observation_id":"2974143e-4c3f-48c8-b346-855f5fb5070f","resolution":{"observed_at":"2026-08-10T22:27:13.548511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.497542Z","title":"Visual instruction tuning","venue":null,"work_id":"7fdbfdf0-a8b2-4b73-9fa5-69a5f44d2193","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.553737Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:b3095d88f2dd7c1e6c85f41ff0c7cf39c8eebdadbb8ff16973f446cee3f3f14f","observation_id":"50f0df7c-440d-4b04-9783-e3aab29c2115","resolution":{"observed_at":"2026-08-10T22:27:14.503141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-10T22:27:13.558488Z","title":"MMBench: Is your multi-modal model an all-around player? arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.558488Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:711fad7d048d9d4df5c4fb37a466888d6bd52381b60398afcb984cdd9af309dd","observation_id":"7eb9eb38-33d2-4e57-b0f5-ef1c3e9b7ff7","resolution":{"observed_at":"2026-08-10T22:27:13.558488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.564407Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.564407Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1db88d7e33f9094ae9bd9250c8f71551b6e015d945bc10efb29a52dc64910207","observation_id":"cbafa25b-627d-46b0-85b8-438fd0be0cda","resolution":{"observed_at":"2026-08-10T22:27:13.564407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:13.570609Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.570609Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:d2ccab8c06af47658deaa5abc5c593311351c8b7127d13fb29f81a0c0a90df48","observation_id":"205b5671-f1d1-48e7-9646-48d2498a0787","resolution":{"observed_at":"2026-08-10T22:27:13.570609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.454672Z","title":"Llm as dataset ana- lyst: Subpopulation structure discovery with large language model","venue":null,"work_id":"cd805172-1d9c-4850-9889-2ac7cb9cd205","year":2025},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.575854Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:b49d58c332a43080ca5d7c0765534789bec9e6fa9486b89bb4bd8e5260d765bd","observation_id":"80498a9c-ada8-4563-95bd-d9a85ce414c6","resolution":{"observed_at":"2026-08-10T22:27:14.460442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T22:27:13.581901Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.581901Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:9eefec8c6eda1f18b290996b8b9f4e8629adaa88805e2ef4e8c51b9bf818092a","observation_id":"2607c897-9f4b-40d7-b82c-a561a42ab248","resolution":{"observed_at":"2026-08-10T22:27:13.581901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.436097Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"05e7e657-dcde-47ac-9854-48a9d0e5634b","year":2021},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.589164Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:6e4115c20479bbd0e5ebab9bbe31708a960984b49f70859903b4437bc1003022","observation_id":"12b5d433-b490-4924-927a-714bfe6a51f1","resolution":{"observed_at":"2026-08-10T22:27:14.442625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.412636Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"1f8c8807-6348-4001-8323-89844b8625c1","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.594849Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:fad58c7ae0b96ac57a915ac0f96ae912e635255a65b65585a7afba8b808ba5c5","observation_id":"fdfdba85-9aec-4478-9b2c-c5f8a7ad38ee","resolution":{"observed_at":"2026-08-10T22:27:14.419028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.392310Z","title":"When do we not need larger vision models? In European Conference on Computer Vision, pages 444–462","venue":null,"work_id":"2ab6eaf4-3cf6-4f59-a1e8-29f989ae7687","year":2025},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.600081Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:f21a213ce937e685716b83e3227d9abacc599c979c83827a4cff6a6acb8919dd","observation_id":"b8b51a70-6c67-4186-bf91-29f9eda3a3ca","resolution":{"observed_at":"2026-08-10T22:27:14.397989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-10T22:27:13.606238Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.606238Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:840f77de563df34aa009de305d691826c2f6c93378584f5bbc85793d72685d2c","observation_id":"cea5852e-cdf8-4cd4-90d7-0adf3091d588","resolution":{"observed_at":"2026-08-10T22:27:13.606238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15881","last_updated":"2024-10-23T09:52:23Z","snapshot_observed_at":"2026-08-13T09:19:56.915294Z","submitted_at":"2024-08-28T15:52:23Z","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15881","snapshot_observed_at":"2026-08-10T22:27:13.611917Z","title":"Llava-mod: Making llava tiny via moe knowledge distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.611917Z"},"links":{"cited_paper":"/paper/2408.15881","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:7fb723e0848cc3922f0762b7d5d562964f6ae6e44637b2bba8e82bd7e76ebc2c","observation_id":"1fb87df2-bf6a-4d24-86d2-b06f143106d1","resolution":{"observed_at":"2026-08-10T22:27:13.611917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.370513Z","title":"Towards VQA models that can read","venue":null,"work_id":"64d978f3-f881-4b58-827a-9ab5c7b66515","year":2019},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.617983Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:4c68a7aa51cc54eb999e1743ce6ed5c3a60b3326a469cf8f071bce02ebb7a643","observation_id":"feab3b34-00d0-4463-af1b-f2373b6e3400","resolution":{"observed_at":"2026-08-10T22:27:14.376638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T22:27:13.623266Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.623266Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:92e9d1ffa4d1f6f619826e78fa268a9c374a70e5eedbcb11115f2c94675d8da6","observation_id":"537f842c-2f51-4b1f-a934-71619aa3f266","resolution":{"observed_at":"2026-08-10T22:27:13.623266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-10T22:27:13.629155Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.629155Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:8175630068031d7664bd3f8f5c6ea02f3608b83dd2f4f635ba0233157d30f13b","observation_id":"06dddca7-3899-4452-a179-9dfe1bb073dd","resolution":{"observed_at":"2026-08-10T22:27:13.629155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T22:27:13.634602Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.634602Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:95078f84efaa90546f17802f1fc7e1cb577110ac3be154c6822db7520518aa74","observation_id":"cc810408-1203-4a73-b879-54a5a7f7a875","resolution":{"observed_at":"2026-08-10T22:27:13.634602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14141","last_updated":"2022-08-24T16:48:09Z","snapshot_observed_at":"2026-08-12T06:47:43.129335Z","submitted_at":"2022-05-27T17:59:36Z","title":"Contrastive Learning Rivals Masked Image Modeling in Fine-tuning via Feature Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14141","snapshot_observed_at":"2026-08-10T22:27:13.640466Z","title":"Contrastive learning rivals masked image modeling in fine-tuning via feature distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.640466Z"},"links":{"cited_paper":"/paper/2205.14141","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:ea559c6f61f56a5e522cd88f168f33adb63fb9a0c47d0417504f57a3b90b7ee2","observation_id":"6fd74cd9-03fe-46e4-b28b-161e108eac19","resolution":{"observed_at":"2026-08-10T22:27:13.640466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.353664Z","title":"Beyond full fine-tuning: Harnessing the power of lora for multi-task instruction tuning","venue":null,"work_id":"ebe94af2-d12c-4629-9739-71bf84a8a405","year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.645663Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:1805226752a3110159c43721c33d3448c5e8993f55d88670691d5744e2a14dbb","observation_id":"f461571d-9743-41b5-a747-724556a9ebd8","resolution":{"observed_at":"2026-08-10T22:27:14.358827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10890","last_updated":"2022-10-25T08:07:05Z","snapshot_observed_at":"2026-07-06T12:31:27.444916Z","submitted_at":"2022-01-26T12:11:02Z","title":"One Student Knows All Experts Know: From Sparse to Dense","version":4},"cited_work":{"arxiv_id":"2201.10890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10890","snapshot_observed_at":"2026-08-10T22:27:13.832367Z","title":"One Student Knows All Experts Know: From Sparse to Dense","venue":"cs.LG","work_id":"f562b9b0-1ba3-40bd-a771-b19503b47389","year":2022},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.651129Z"},"links":{"cited_paper":"/paper/2201.10890","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:18dff55a3e5d7225330c1a070f7e95c3d8d07c8e0643a90982798ffb13e06ab4","observation_id":"aeb84c7c-b67b-4163-8095-7d3114642c16","resolution":{"observed_at":"2026-08-10T22:27:13.840003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T22:27:13.656119Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.656119Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:8b171e989e1822e5c0e83d6ae9fa938825e2d6143530bd35d99860a83e439445","observation_id":"360e5dd2-430c-497c-b871-c338e1d837f6","resolution":{"observed_at":"2026-08-10T22:27:13.656119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-10T22:27:13.661456Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.661456Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:bd4012e91a048766462b73fddee6fb8aedf559904370ea9fb12c4de790b77117","observation_id":"739e32ef-aa33-4050-b254-3065d0eade26","resolution":{"observed_at":"2026-08-10T22:27:13.661456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.336064Z","title":"Learn- ing from multiple teacher networks","venue":null,"work_id":"6a903135-0271-40c2-8758-b65c3df46da6","year":2017},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.667871Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:e5a56cfc13a5299443f4bf568fe9ed0f605ed5e948c1e19190e39ea9ec8564aa","observation_id":"70e96a49-6bc9-4699-b345-d73b97b094ee","resolution":{"observed_at":"2026-08-10T22:27:14.341911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-10T22:27:13.672970Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.672970Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:cee6bff02de57dfb15a465af485a9e19bd018560137dcd96992675791cdbf9dd","observation_id":"99d02520-c2a3-488b-b4a0-cf37515833be","resolution":{"observed_at":"2026-08-10T22:27:13.672970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-10T22:27:13.678455Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.678455Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:08e44b6d4411c42739163f9f9f38ad9bf92fb8159b9138baa42f8f803a613b4e","observation_id":"44a85115-9640-4250-aeab-06739e43206d","resolution":{"observed_at":"2026-08-10T22:27:13.678455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T22:27:13.683823Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.683823Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:3c705e5c06f356ff7a1e22969f81d4ac956f7b7720693ef44d8ceab425db6003","observation_id":"df1d01a3-4cf9-421d-9494-3812d1d04ec7","resolution":{"observed_at":"2026-08-10T22:27:13.683823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:14.316664Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"b09bc625-7c14-4213-9111-db496640eaa6","year":2023},"citing_paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:13.689128Z"},"links":{"citing_paper":"/paper/2501.01709"},"observation_digest":"sha256:f5549cec7be48a15e031e4d91c8babead75b0122efe64ac8268272c91a4583c8","observation_id":"a5c23181-1923-488d-a002-443d8b833862","resolution":{"observed_at":"2026-08-10T22:27:14.322850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01709","last_updated":"2025-03-18T07:34:44Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T03:33:34.200698Z","submitted_at":"2025-01-03T09:10:34Z","title":"MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2501.01709."}