{"as_of":"2026-08-06T09:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffe50eb25cea4410671083eaafeb73c476f1aaace6540ee8c7de5596c27808c8","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T15:27:51.839171Z","state":"measured"},{"denominator":115,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":115,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:57:51.203800Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T11:37:03.180051Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:c532b82480fbc712216ab3b35f7efe9d7161efacf9ea8cfb5b88d153d12d4cfb","observation_id":"263d85c1-f1d6-4364-b24b-a71a956863f9","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T22:48:36.010306Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2404.14396"},"observation_digest":"sha256:fdea45c0fe29ec217481fae294827e1d6757fbd7f69423215d0ff3837fe54773","observation_id":"1503c723-328b-4cac-a9aa-56a377499b70","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:628fccf62185d54c444e62abdda2e9ad23258a001fa8d8963ff292f9cd869576","observation_id":"46e295f0-9a91-4c7b-bdbb-717cd03e1184","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T16:12:25.980853Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2409.12514"},"observation_digest":"sha256:f3e6c13ede3e04930a5f6e96f220e58acbf5d965cdd245847074e202535ac89a","observation_id":"c0a91e8e-e316-4caa-96c1-5f67b4ca59b0","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:1af43a3cff5648b67390372fb03600d0da8a2f00ef5b9076fff4db989502597f","observation_id":"344e15de-5299-43a4-ae83-9383e3b1709f","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T08:14:52.890145Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2501.17811"},"observation_digest":"sha256:c6fec1ec31af029fecec2590ba85e7926a4fe0f1f7c80e462481fd31c12ae8c7","observation_id":"9ada2901-c73a-4a18-8701-75ddf83dc74a","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2505.05472","last_updated":"2025-05-11T18:47:18Z","snapshot_observed_at":"2026-08-04T22:02:38.792513Z","submitted_at":"2025-05-08T17:58:57Z","title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T07:24:04.460276Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2505.05472"},"observation_digest":"sha256:7f658a0c8df0b02dc7ba068fd5f852a6534c98476cf06603de9a3053eb6684ef","observation_id":"8ce9c562-fcff-446c-8640-5f2324255869","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T05:57:51.203800Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01057","last_updated":"2025-08-12T12:29:02Z","snapshot_observed_at":"2026-08-06T05:57:50.237296Z","submitted_at":"2025-08-01T20:16:04Z","title":"Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:57:51.203800Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2508.01057"},"observation_digest":"sha256:bb69eb10b1614ee1d4bbad14826441b7fa50bad6b96753efea80045f7fe506c0","observation_id":"10e90e2a-2391-46d1-ba25-090cfe54c8e6","resolution":{"observed_at":"2026-08-06T05:57:51.203800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T05:36:17.214634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-06T09:00:55.701513Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:17.214634Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:c207b3116ad640a7fb86841710c2ea0c747e8b3fcfe2cec8ee08a03906c5d5da","observation_id":"d4b12cfc-f810-4ba5-b98f-1a3ff685a3d2","resolution":{"observed_at":"2026-08-06T05:36:17.214634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-05T13:05:54.046573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-05T13:05:51.875633Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.046573Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:e5a3f164e05838a44e009c02432aeaf806ceb808019ada31a33d38588f591518","observation_id":"52e0de29-c462-44ec-9e5c-e515c51147a4","resolution":{"observed_at":"2026-08-05T13:05:54.046573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-04T18:58:12.612496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09560","last_updated":"2025-09-11T15:51:43Z","snapshot_observed_at":"2026-08-06T08:07:46.063667Z","submitted_at":"2025-09-11T15:51:43Z","title":"Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:12.612496Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2509.09560"},"observation_digest":"sha256:f61df13777b411a587ac787238e8179b8bbc2ac13c6adeb2deabf1e1bc1381da","observation_id":"28e53504-3766-4af0-9e9b-137aa3ed3238","resolution":{"observed_at":"2026-08-04T18:58:12.612496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2509.21912","last_updated":"2026-04-15T06:09:32Z","snapshot_observed_at":"2026-08-02T07:15:59.205489Z","submitted_at":"2025-09-26T05:51:31Z","title":"Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T14:13:48.523955Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2509.21912"},"observation_digest":"sha256:753fdbd5de18587904afe119a1525632c2e03d9adfe54e07bb0e4e54536d1e04","observation_id":"8e437234-3ca9-455e-a694-cee88a569e27","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-04T14:41:47.089958Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24380","last_updated":"2026-07-04T03:50:21Z","snapshot_observed_at":"2026-08-04T14:41:42.802868Z","submitted_at":"2025-09-29T07:29:18Z","title":"Agentic Services Computing","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T14:41:47.089958Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2509.24380"},"observation_digest":"sha256:05b3d8b069b58df535187a0e6e06c371e1121fc8b1ee6cc3eaaeab57dd10b03a","observation_id":"fefafde8-9ebd-465c-bba6-06632c49f513","resolution":{"observed_at":"2026-08-04T14:41:47.089958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-03T09:54:55.990620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12349","last_updated":"2026-07-15T15:32:11Z","snapshot_observed_at":"2026-08-04T21:39:28.308547Z","submitted_at":"2026-01-18T10:54:54Z","title":"Mind the Gap: Action Rebinding Attacks against Android GUI Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:54:55.990620Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2601.12349"},"observation_digest":"sha256:e2d3d38b2fd154560e9ef9ab4b613b11a0f0a84aac227f5f34a67c16efc343cc","observation_id":"d9a9b26d-283c-4c63-a30d-df97864bca55","resolution":{"observed_at":"2026-08-03T09:54:55.990620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2601.21531","last_updated":"2026-05-17T03:22:07Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T10:47:21Z","title":"On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T15:09:25.818449Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2601.21531"},"observation_digest":"sha256:f03d43a87ecc4129273b3e44c4b3b9b0901b75d05ffc622bde966b680d5caa6f","observation_id":"fa6fc2fc-95c7-4f4f-a501-fdb244ebeeb3","resolution":{"observed_at":"2026-05-21T15:10:16.499228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T07:48:23.272002Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2602.04476"},"observation_digest":"sha256:ab242a86056e63a00a3d4110505c1058b5ce7f612ed765839e37d4cfaa390a8a","observation_id":"48311f00-544d-4618-9e59-65ecc5517e89","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2603.02123","last_updated":"2026-04-11T07:33:14Z","snapshot_observed_at":"2026-07-06T22:47:33.195274Z","submitted_at":"2026-03-02T17:42:33Z","title":"Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T17:43:32.593075Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2603.02123"},"observation_digest":"sha256:a11360bb10adeb2f3db20ea0b1f9f523047180edcbf020850eeb7adc54d2c460","observation_id":"aef52343-ad2f-448b-8775-3a031ebe0551","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.02689","last_updated":"2026-04-03T03:32:55Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T03:32:55Z","title":"Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:33.950587Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.02689"},"observation_digest":"sha256:911b51132727378f85ce2c807a286f56eb8a2df680158d07fce4c81c57b9dd21","observation_id":"24be7692-d81e-462a-83b6-fc10da143e59","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.04579","last_updated":"2026-04-07T05:30:10Z","snapshot_observed_at":"2026-07-06T22:53:33.177713Z","submitted_at":"2026-04-06T10:25:16Z","title":"Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:01:18.334371Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.04579"},"observation_digest":"sha256:f17cba0dd61f6ed748ac13214ce3b2a66522440531cff0df858a98334185849e","observation_id":"d1f4314d-bbc1-4a66-bc8d-f81ca829cfbe","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.08050","last_updated":"2026-04-09T09:58:56Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:58:56Z","title":"ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:12.551127Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.08050"},"observation_digest":"sha256:597881aac99a4a92b06d8a7c1ea3b0b798c03e74179664bde6520db0c0d84038","observation_id":"f73e3e90-fb04-424f-826d-9ae0b3fd6f3e","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:272548984eff4f860c816cb06d6c95f4620d5ec481bb8b04b80941baa5039fdb","observation_id":"e560d582-a4c4-4dc7-a0ba-46d3dd9acccc","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:641b992cec3e2e6a378c4c7f9517339732f3594bbd80becd6b78fc07acd15be7","observation_id":"66deedc9-2dc7-486d-9b70-61735715618a","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.14629","last_updated":"2026-04-16T05:13:57Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:13:57Z","title":"Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:46.371799Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.14629"},"observation_digest":"sha256:9050f3d2a2755c6701ccfb854692ece1e47dcffae86e1d0991fa93ed24dacacc","observation_id":"74dba68e-92bd-47b6-bab3-46d01fb03e80","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2605.10641","last_updated":"2026-05-11T14:28:44Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:28:44Z","title":"LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T05:10:56.991368Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2605.10641"},"observation_digest":"sha256:422c964c3ac9267cc3cc48fa52b76dc300925c6d1eb3a6cb19d6927c509500fe","observation_id":"7ed7f7c2-ee9d-4265-bb9d-a3ecfbc1d01b","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2605.17954","last_updated":"2026-05-18T07:09:46Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:09:46Z","title":"A More Word-like Image Tokenization for MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T12:46:04.946489Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2605.17954"},"observation_digest":"sha256:75f671c2641d09536dbbc5643f45211490380a479605779aacf56e1e78857dbe","observation_id":"ed8d7760-2a87-436a-be4b-7cf844f4ee7c","resolution":{"observed_at":"2026-05-20T12:48:17.437221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2605.26038","last_updated":"2026-05-25T17:05:52Z","snapshot_observed_at":"2026-08-06T06:20:36.576402Z","submitted_at":"2026-05-25T17:05:52Z","title":"DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:52.992152Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2605.26038"},"observation_digest":"sha256:ecc6bc06d759a9f56f372bbdaa9335e8db4465dbdb6ae5bb7f87f0dfe5a11c35","observation_id":"638883d0-c9e0-4ffc-bd30-9c572fb44799","resolution":{"observed_at":"2026-06-29T22:54:00.644566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2605.31080","last_updated":"2026-05-29T09:47:45Z","snapshot_observed_at":"2026-07-06T23:40:17.605034Z","submitted_at":"2026-05-29T09:47:45Z","title":"A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:53:36.990878Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2605.31080"},"observation_digest":"sha256:3fef73d14ae61354c6f6cce2359498eb7a54e2590c1138c32d39e0498121293e","observation_id":"5bcd4345-234b-4e9e-adfd-ee4c9180f3b3","resolution":{"observed_at":"2026-06-28T20:22:37.629087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:2561e641e5aca645211a7964f287071f2d97afca18f04bb9291ac806e894ea7a","observation_id":"81f8c5a9-11d6-4e4b-892d-6b6bc179103d","resolution":{"observed_at":"2026-07-01T10:15:44.628186Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2607.00302","last_updated":"2026-07-01T01:02:41Z","snapshot_observed_at":"2026-07-07T00:05:59.073754Z","submitted_at":"2026-07-01T01:02:41Z","title":"Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-02T15:35:51.205304Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.00302"},"observation_digest":"sha256:5e15cff8834e6fd68640905b52fbad4ac50dd38e59c5b211c1cbf5d0236d7036","observation_id":"e2ea1e56-24c1-4c16-b19b-b10eaeded060","resolution":{"observed_at":"2026-07-02T15:37:05.784201Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2607.02158","last_updated":"2026-07-02T13:31:29Z","snapshot_observed_at":"2026-07-07T00:07:37.820438Z","submitted_at":"2026-07-02T13:31:29Z","title":"Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T15:21:11.367562Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.02158"},"observation_digest":"sha256:795c2d318f6caaf511fa1464ab68c8b97354b539541949ba12bf5142cf9b5c87","observation_id":"778d258d-89df-462f-9886-ecf1f382baae","resolution":{"observed_at":"2026-07-03T15:28:33.781917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2607.08194","last_updated":"2026-07-09T07:50:49Z","snapshot_observed_at":"2026-08-06T01:16:56.040734Z","submitted_at":"2026-07-09T07:50:49Z","title":"Dive Into the Implicit Biases of Low-rank Vision-language Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T11:34:56.843122Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.08194"},"observation_digest":"sha256:a91a3882888368622173d7cbbb99ebf4f3b398ba836e352c1268f5732eb41fd2","observation_id":"8a4add3f-3d63-4946-9eed-ffb010edd213","resolution":{"observed_at":"2026-07-10T11:37:03.181759Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-13T02:27:00.146927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09520","last_updated":"2026-07-10T15:31:06Z","snapshot_observed_at":"2026-07-15T23:18:28.436625Z","submitted_at":"2026-07-10T15:31:06Z","title":"Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T02:27:00.146927Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.09520"},"observation_digest":"sha256:5b65bc04832a19d4afe8693038c381687810167705ccf577a94d8616fddef106","observation_id":"020bc01c-66c8-4479-bebc-9c0864555736","resolution":{"observed_at":"2026-07-13T02:27:00.146927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-01T10:06:48.180556Z","title":"arXiv preprint arXiv:2402.03766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20357","last_updated":"2026-07-22T16:43:27Z","snapshot_observed_at":"2026-08-01T10:06:46.754637Z","submitted_at":"2026-07-22T16:43:27Z","title":"Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T10:06:48.180556Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.20357"},"observation_digest":"sha256:3cb0fbd7039407fed71df9fe1d24f3a45ddaf8194b750dec73486ed22f392924","observation_id":"334e0b21-23cc-4d92-a6f9-0c5ebd2ea163","resolution":{"observed_at":"2026-08-01T10:06:48.180556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-01T11:49:57.818624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22726","last_updated":"2026-07-22T05:17:38Z","snapshot_observed_at":"2026-08-05T17:48:01.260980Z","submitted_at":"2026-07-22T05:17:38Z","title":"PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:49:57.818624Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.22726"},"observation_digest":"sha256:e7a829091d9bdd2d2ed97825a2dc1682ac63fd4c116a8a60d7de45061881122c","observation_id":"9784806a-cd1b-4c70-b5a9-c2e9048b3ee2","resolution":{"observed_at":"2026-08-01T11:49:57.818624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-31T00:01:33.718457Z","title":"arXiv preprint arXiv:2402.03766 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23373","last_updated":"2026-07-25T21:31:40Z","snapshot_observed_at":"2026-08-01T17:10:45.801228Z","submitted_at":"2026-07-25T21:31:40Z","title":"UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T00:01:33.718457Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.23373"},"observation_digest":"sha256:b1d6d98b97f994fb5d66c4412e54464aad328b6dc45ee140b43312568c68ade4","observation_id":"ccfa5a24-c162-4fba-9837-a13979c35d7a","resolution":{"observed_at":"2026-07-31T00:01:33.718457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-31T12:15:59.654246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24536","last_updated":"2026-07-28T20:41:00Z","snapshot_observed_at":"2026-08-02T11:35:46.215669Z","submitted_at":"2026-07-27T15:14:50Z","title":"RemiAssist: A Therapist-Supporting System for Photo-Based Reminiscence Therapy in Dementia Care","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T12:15:59.654246Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.24536"},"observation_digest":"sha256:914cfde5c4737e1df09e5b5d64a552ae25690593a8cd5a5235619976da982347","observation_id":"4eedcb01-ff63-42b9-bef7-2073b8388be6","resolution":{"observed_at":"2026-07-31T12:15:59.654246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-01T02:14:09.815337Z","title":"arXiv preprint arXiv:2402.03766 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25527","last_updated":"2026-07-28T10:12:06Z","snapshot_observed_at":"2026-08-03T21:55:22.610961Z","submitted_at":"2026-07-28T10:12:06Z","title":"Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T02:14:09.815337Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2607.25527"},"observation_digest":"sha256:ae6a15371d074c6d6ff2ea045a280131fcb1f9261c77d6241f5a424a946e66b1","observation_id":"1fee9ea4-365d-4765-a35f-c423d3ef6543","resolution":{"observed_at":"2026-08-01T02:14:09.815337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T00:51:57.723161Z","title":"MobileVLM V2: Faster and stronger baseline for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03141","last_updated":"2026-08-04T05:14:08Z","snapshot_observed_at":"2026-08-06T09:37:53.890116Z","submitted_at":"2026-08-04T05:14:08Z","title":"Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:51:57.723161Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2608.03141"},"observation_digest":"sha256:c7eb1b27ab002c006aa9370e995e0040b5b2a26da892851c0cae607d8343cee5","observation_id":"15f98822-efca-476e-a94c-f2048e67ec07","resolution":{"observed_at":"2026-08-06T00:51:57.723161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-05T16:41:28.904035Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03580","last_updated":"2026-08-04T12:34:46Z","snapshot_observed_at":"2026-08-06T09:40:32.827570Z","submitted_at":"2026-08-04T12:34:46Z","title":"SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:28.904035Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2608.03580"},"observation_digest":"sha256:6511eb78017f454b9a9060ccf57a0977c7f586600075c66eec904ab689c142da","observation_id":"147f2d56-c4fd-4482-b478-3970180b19b6","resolution":{"observed_at":"2026-08-05T16:41:28.904035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.03766/citation-record","integrity":"/paper/2402.03766/integrity","json":"/paper/2402.03766/citation-record.json","paper":"/paper/2402.03766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11444","last_updated":"2023-12-24T12:25:10Z","snapshot_observed_at":"2026-07-06T17:04:46.288600Z","submitted_at":"2023-12-18T18:47:42Z","title":"An In-depth Look at Gemini's Language Abilities","version":2},"cited_work":{"arxiv_id":"2312.11444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11444","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An in-depth look at gemini’s language abilities","venue":null,"work_id":"0a08125e-c6a1-40ab-99aa-8357f934a3d4","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.11444","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:1c6573fe1afb5fa8967269cb3304189ab08cbad0667b115c4c555943f9b65d80","observation_id":"4ac961fb-dca6-47d3-99ad-aef19c168c0e","resolution":{"observed_at":"2026-05-18T15:27:51.898125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openflamingo, Mar","venue":null,"work_id":"650bdadd-6874-4047-9197-677097e0a80f","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:58daa16295311024a1de117a4959f44a1e0c28224cb88a90898013c366773d74","observation_id":"48f4433e-68f3-436b-b359-702e70248174","resolution":{"observed_at":"2026-05-18T15:27:52.164502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:8f2d43a3fbd0d35314f2eb043aef157f9dec3b97438f709d3e01de4b53e9468c","observation_id":"6bf6961b-baf2-4dc7-bb68-eb062984e149","resolution":{"observed_at":"2026-05-18T15:27:52.149961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:2e274dfea774e32cc87dd1475737c195d6e5a9895ad7a134ec5cfeed2bc7e9ff","observation_id":"575954b2-bb8d-4e90-ac67-4b1066b40578","resolution":{"observed_at":"2026-05-18T15:27:52.155838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pythia: A suite for analyz- 8 ing large language models across training and scaling","venue":null,"work_id":"6c4f3f03-7416-43ca-bcdd-a1c2e06f3f1c","year":null},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:9779b3502c00fb075ea60b7709fc0f51053ef7110953a82effa87469e4ca5cf5","observation_id":"0cd1f460-d9fd-41d7-9627-acdad45b0736","resolution":{"observed_at":"2026-05-18T15:27:52.176346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"6925c699-5c76-4809-8f89-814203b16b9f","year":1901},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:88b04e1bca7021e7642f730efd7bd176be1c3860d3703034065b20986930a121","observation_id":"7d66992c-c8e1-4071-93c1-51f8fa90e963","resolution":{"observed_at":"2026-05-18T15:27:52.180340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":"2312.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-07-04T06:39:37.566373Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"fc187c8a-06af-4a3b-b67d-c5db265b73f4","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:a5f760943d5527943f280886afb85d1f5c3716fca6359e51874bd5a18ec7161b","observation_id":"c81e777f-0216-4db0-932d-039692b34c9f","resolution":{"observed_at":"2026-05-18T15:27:52.160774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:1bff008f4d26c96009431bc7183aad603a34a7826f51ea9454e09d949c197cd2","observation_id":"aca742c5-3139-4668-9931-e8d7e9b14bf5","resolution":{"observed_at":"2026-05-18T15:27:51.907150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:3ed9817c2b38dfe02c8994664142232c2ec7caee620b41382bf8bc78b6b23af6","observation_id":"df2417ea-5092-4817-bdea-feb8b540397c","resolution":{"observed_at":"2026-05-18T15:27:51.915673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:2114129803a14b822ab7e76cfa27cf8c49023bf607abe2cefce593443b279244","observation_id":"d9c1dc2d-4e6b-4eff-9e9e-417bad7381f6","resolution":{"observed_at":"2026-05-18T15:27:51.921563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zit- nick","venue":null,"work_id":"90c72244-da9f-4151-8e08-dc91890fa00a","year":2015},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:c46b5d58a56de224d74350ecf6a89e4309c6a0ed7c9d7f7d786d4d6a2d81d7bc","observation_id":"3ef7bb48-4db9-4437-a7db-99e14d1cd6be","resolution":{"observed_at":"2026-05-18T15:27:52.201043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unifying vision-and-language tasks via text generation","venue":null,"work_id":"0bc0e82d-0c1b-47db-9573-03948f60ef2c","year":1931},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:a533138206bb38e62f8b63bf873526998073ca96640ab50f70e5c992d939745e","observation_id":"a9dfdb84-7400-4b96-9c6f-82231d804e86","resolution":{"observed_at":"2026-05-18T15:27:52.204821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:ea6c5bfa0ae28a7b2d757198824482842a9c49ee99b4b85ed853a42b7585b0ad","observation_id":"520d1d09-1e61-406e-9b58-a8fdd3ec07c8","resolution":{"observed_at":"2026-05-18T15:27:51.927007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Make repvgg greater again: A quantization-aware approach","venue":null,"work_id":"f0c005aa-a342-4c06-9ca9-a221dc5ce7b0","year":null},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:83fb627c451574f6f1a94dda83901ebae62f691d8d12d06dbadfa7bd79106392","observation_id":"1ab7ef83-c59f-4a6c-ba2a-b6ab7e23f2c8","resolution":{"observed_at":"2026-05-18T15:27:52.212777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:27429e9b5645f4985758898c83ee872203bef859644b3678777f849a0712bf56","observation_id":"b230a10c-ff3d-4239-9288-978f8af0d072","resolution":{"observed_at":"2026-05-18T15:27:51.932747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional positional encodings for vision transformers","venue":null,"work_id":"fdb1ec53-6e31-4d6e-9e1b-fefba7aa1cc2","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:28350722b015a807dabb6e1c10088c9092ad60f0786e80791da39654c02bc2c0","observation_id":"a5fe84c8-e652-4310-aab8-7611bf2d211a","resolution":{"observed_at":"2026-05-18T15:27:52.219900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Redpajama: An open source recipe to reproduce llama training dataset","venue":null,"work_id":"ab57b7bd-3bc2-4822-b97d-28e70a9e3205","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b2778dba6bbeb56faf7741e807af0daece191c0bc8c63a6076acb191447a8fd4","observation_id":"e4940fbc-0982-4ed0-ae52-83bcfbb8aa0e","resolution":{"observed_at":"2026-05-18T15:27:52.224508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:37e8dc9a77f54528b13aaccd81bfabdfbc6d5220aa7563f1df719e35b5874229","observation_id":"319b4c68-b983-4269-be0e-fa8dd74a6b49","resolution":{"observed_at":"2026-05-18T15:27:51.938461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual dialog","venue":null,"work_id":"0fee4f36-e705-444f-b72b-56087d0b1212","year":null},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:5ab30d647d704bd64466a2960f12ca842ed05d29b1b93433a7418a55db6958a4","observation_id":"b8ddaba5-2bde-40d0-a9e7-8c809dc86717","resolution":{"observed_at":"2026-05-18T15:27:52.232481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":"2401.16420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-07-04T19:50:11.273770Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","venue":"cs.CV","work_id":"93411487-d575-4b44-9d9e-2374874a66bd","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:89d5dd103862ec1ebfea2f5af284a9dbce04d49e23e0f8c661adc3edb23f54ee","observation_id":"63fa8dd1-b041-4d49-8d28-0c39051f0031","resolution":{"observed_at":"2026-05-18T15:27:51.944490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"7ac76a8c-0081-4d02-8724-04aa65f013e6","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:03911e2612dd4315953b27cd89e3e78621bfa94b41ed7fd5e99d41fd6fdb6ca4","observation_id":"44b10e6b-9730-447b-b5d2-2ac64cf4cce7","resolution":{"observed_at":"2026-05-18T15:27:52.240418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning factored representations in a deep mixture of ex- perts","venue":null,"work_id":"7b50f288-047c-42f0-8831-8a4106f05b2b","year":2013},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:f20d27cfb4f694801ea026b7a5f3acf254dfae47e977063c1a3b1d9fbab34866","observation_id":"3445fc17-4be6-4ad5-96b3-8cce65eb9628","resolution":{"observed_at":"2026-05-18T15:27:52.244358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"2abbd249-5797-481f-af1e-4ed79b548542","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:c6a18410a5674ac5e31da3e9d326b5d1391c4064640467b004a6ff6a8bbf93c2","observation_id":"234ed899-9e02-4f85-ab2f-bb234a2d9d61","resolution":{"observed_at":"2026-05-18T15:27:52.248167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:416291670f41a404141d318f206ddf7df1af5d9233384f5825a83af21b0619dc","observation_id":"6994e6a0-6d2b-41bd-9cd1-c5b9536a85fd","resolution":{"observed_at":"2026-05-18T15:27:51.950905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:548c9e7d7cfd389b1c1a3a2a2fd9e3c9005449306dc2a37903eabdfaf246eb3e","observation_id":"1d439e00-5349-4238-8a67-9c212505d4e3","resolution":{"observed_at":"2026-05-18T15:27:51.964698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12436","last_updated":"2023-12-20T12:40:47Z","snapshot_observed_at":"2026-07-06T17:05:31.586924Z","submitted_at":"2023-12-19T18:59:22Z","title":"A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise","version":2},"cited_work":{"arxiv_id":"2312.12436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A challenger to gpt-4v? early explorations of gemini in visual expertise","venue":null,"work_id":"05e8c0d7-6676-46bf-b64f-97140c19f4c5","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.12436","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:0354f73e86137641b1616164e4d0146d894fd4b885e8e473b7b0e9d126e87472","observation_id":"026ec8cd-05d3-41ab-9ba2-5bd5371627b9","resolution":{"observed_at":"2026-05-18T15:27:51.971525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"llama.cpp","venue":null,"work_id":"d0bbda35-200f-4217-a996-6b1415eb83d9","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:086412d0b5d39a9df1f8a0fe292db0c83e8df678cf8685b4e85dda1d5a787e91","observation_id":"744c4b3b-8881-40bc-83d1-604db3c97a31","resolution":{"observed_at":"2026-05-18T15:27:52.262562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:08b4d4fe3eae29f3ec7271879eceb3f0e51b1d60b887ba7800624a96cbce661a","observation_id":"a273e820-2090-4d8f-bf92-569cdde06982","resolution":{"observed_at":"2026-05-18T15:27:51.980287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"f86ef70c-a230-46db-8746-d537fcab9843","year":2019},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:837ab9f3ec6c61c7d19132b5f7c202fe307a0466e5c986245931900e8517236a","observation_id":"92eeb03f-c69c-438a-a535-7012e4a99e4d","resolution":{"observed_at":"2026-05-18T15:27:52.269265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"090a0ca6-6f61-4c58-a309-d4193e623e23","year":1991},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:5260e2305abb42f2cfe916c81c764f463e1afb053fada189583e6d4f625d1a51","observation_id":"b40d2e1b-5a5d-4e5f-84ce-bf0d4469ac32","resolution":{"observed_at":"2026-05-18T15:27:52.272557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:64eef2dde2c5d10bb9932047dc1b710df5bd561dd781f5d32901a16769d59ec4","observation_id":"da3db281-051c-4ce1-b300-d929e23af9bb","resolution":{"observed_at":"2026-05-18T15:27:51.987624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13823","last_updated":"2023-06-13T21:54:58Z","snapshot_observed_at":"2026-07-06T14:46:41.380338Z","submitted_at":"2023-01-31T18:33:44Z","title":"Grounding Language Models to Images for Multimodal Inputs and Outputs","version":4},"cited_work":{"arxiv_id":"2301.13823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.13823","snapshot_observed_at":"2026-07-04T19:20:06.458730Z","title":"Y ., Salakhutdinov, R., and Fried, D","venue":null,"work_id":"ad5b0825-15c0-403e-b730-8d783363d623","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2301.13823","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:caaa98f8c939fd77d82e399ec4d3a0ca45f43d213ef247e67846ccb4c8c8caba","observation_id":"966822c7-3917-4dac-86a2-54ec9ae3d0f6","resolution":{"observed_at":"2026-05-18T15:27:51.994241Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:cd7ca2e77aeefb7f6d00a40111ef22e7e83703b4642bb9c7b69a6f7575202131","observation_id":"f2f92ab5-4202-4cf0-a0bd-328334a5928e","resolution":{"observed_at":"2026-05-18T15:27:52.005910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":"2306.16527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-07-01T22:26:17.906208Z","title":"Obelisc: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"74ebae26-b926-4191-8a01-1743f30cca60","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:3cd744b27a00b271832645a56aff128cf5d3239747b2519d85fe7a97a8562c4c","observation_id":"db62ab0b-ac30-4e00-a10c-c0e73749223f","resolution":{"observed_at":"2026-05-18T15:27:52.015246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:d80d5197b2f6a81cf7e4e5f4cab7a81eeb17bffde85d03c354bf4686af2fefff","observation_id":"63a8860f-f4a3-49db-ad62-1148186d497b","resolution":{"observed_at":"2026-05-18T15:27:52.023205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":"c3429aa3-1d51-4ef5-96ed-e3cc42603751","year":2021},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:910e8eeaa273408bf8f661ee01e17516cc2fd90566b4a4ad26efc13eddce20a6","observation_id":"a7e1164e-7e3d-4a85-a07f-cbe081b9fe9f","resolution":{"observed_at":"2026-05-18T15:27:52.293074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Norm tweaking: High-performance low-bit quantization of large language models","venue":null,"work_id":"aa22d691-9580-45d2-80c9-0fe1c74986d6","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:343d4fc7f98b86de8c2a99a473b005978f7a845cc0eaf914fe7d1ab717aa25d0","observation_id":"0b57c595-8d08-4ea6-b2a8-6bc299ae5607","resolution":{"observed_at":"2026-05-18T15:27:52.296557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09550","last_updated":"2023-11-16T04:11:19Z","snapshot_observed_at":"2026-07-06T16:48:21.364659Z","submitted_at":"2023-11-16T04:11:19Z","title":"A Speed Odyssey for Deployable Quantization of LLMs","version":1},"cited_work":{"arxiv_id":"2311.09550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.09550","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A speed odyssey for deployable quantization of llms","venue":null,"work_id":"33334fe7-69f3-493b-9976-a74506519b3e","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2311.09550","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:84652c434dcff4d8f8b34e3d4e603e2f8dfc9f2d8403f8f3147968c74ed3424f","observation_id":"e2eb03ca-d5c7-4e71-9617-76217e8c8511","resolution":{"observed_at":"2026-05-18T15:27:52.029371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":"571a7df9-c405-4aef-a2aa-0e781400ee52","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b173e8b472efc0bd33e601ae31fa98a4a58e36c982840f0dd61b1e0c5e2ea01b","observation_id":"6383d318-68d6-4012-833e-d8df8fa8039f","resolution":{"observed_at":"2026-05-18T15:27:52.172274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:0e0827b7ace0748fb0dc65dfb56eae7a54e85cd41a859746aa64fc08d58637a8","observation_id":"6e2685a1-7425-432c-bb01-612a73767871","resolution":{"observed_at":"2026-05-18T15:27:52.036310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":"8fcb8f29-1967-4abd-9166-52e41d5db59f","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:22a1f639b5391f92679d3e1261593b13e7817db55bb5ddce00639bb27c1121bb","observation_id":"489f0fd0-9082-421a-b621-7bebd5eef3b3","resolution":{"observed_at":"2026-05-18T15:27:52.188906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"e5324608-3ab9-4aa9-95c8-2bbe9ec501f7","year":2014},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:a215413a80fe0b13d10ef6b28f059aed324a8016e66b9bb886a0ba728c0ea6b4","observation_id":"b28d5e23-754b-4146-b66c-2edc1b02d9f5","resolution":{"observed_at":"2026-05-18T15:27:52.193336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual spatial reasoning","venue":null,"work_id":"3ca26b73-3737-447f-9df8-618d654f842a","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:e17df1418532ab9dba71072a5d5ae2c9459d3d301ca8407522b71a1b3a56e53c","observation_id":"4fa4aae8-e89c-4984-9d94-c984b02c4190","resolution":{"observed_at":"2026-05-18T15:27:52.197388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:52f58e89508911b83ea0aaa2aa23c9ba637f9190fb00bf38f18beedf4338f5a3","observation_id":"393415f0-7035-4ceb-ac53-54562d4a00d4","resolution":{"observed_at":"2026-05-18T15:27:52.046756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b671e30896d6860f596730baaf0613e7245fc36dfe74fdfd496b6c8e1c72c9c1","observation_id":"cc8325f2-a57e-4d56-a780-8c7af5cd2464","resolution":{"observed_at":"2026-05-18T15:27:52.052441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:a1e573784feea575db15de7e96062bb4dccafd053c23bea9dab5a55ff88ced58","observation_id":"b70fd953-5cde-479d-92b6-714a256bc42e","resolution":{"observed_at":"2026-05-18T15:27:52.057371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:dfb0fa1c849fe46819fd87d57ba6ecbec210390cb858233a1340d34e9a7bc37c","observation_id":"845ea1f4-c9ad-4d34-9c49-10df387590df","resolution":{"observed_at":"2026-05-18T15:27:52.065471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ab9dfa33-08b4-4092-848e-d37fe63ffb4c","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:2d51ebcbb975aa79f95c6c945feb0c0d66857441b917f36719163310d7ec7eb7","observation_id":"b8662f6d-a0d7-469d-88f2-a5c2818da2c8","resolution":{"observed_at":"2026-05-18T15:27:52.251859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":"2110.13214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-07-10T11:37:03.154319Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":"cs.CV","work_id":"e5046a8f-5c72-46fd-baba-98ea6bce6d5a","year":2021},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:515e86592dc686ac64592cc5291c77d8f40d70a1137f723a9698f0096ebb5b08","observation_id":"83dc7c90-425f-4be1-ac92-cc3f3d854e24","resolution":{"observed_at":"2026-05-18T15:27:52.071527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"78b17a17-99c0-4a6b-b5dd-073ba531b12c","year":null},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:59c9aa2b7b081e9f6f494cedbbb41439eea1cbc4c9a2460f633d3d807776b5f5","observation_id":"934f6e7b-7d22-4a00-806a-38e62fedbe67","resolution":{"observed_at":"2026-05-18T15:27:52.259168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d551ad19-6500-43f4-8202-adf2e39ed06d","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:7233fc4578f2925aeed44d30c48c66aa4784020aafe86f226d21b507dd26593b","observation_id":"dca8226b-6241-4580-8eb0-c6c5bf74c7ce","resolution":{"observed_at":"2026-05-18T15:27:52.265804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"e6473933-6442-4310-9ef5-7a7801d2d0fe","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:83f746c8a131772b13b574852a2865c9bcb9b34d46fa0993791de6836f02d04b","observation_id":"a918778e-858d-49a1-b1d0-d507df791c4d","resolution":{"observed_at":"2026-05-18T15:27:52.276162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"e3ab644e-fe07-426c-a5fe-dbbd104fdf6f","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:bcee56577950337149c0ed8b0b25884fc73d30b3d2f7f58d2ca566d120fe85e1","observation_id":"2d787268-28e5-4a45-a487-cd3db282965f","resolution":{"observed_at":"2026-05-18T15:27:52.279696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7fb84b4a-45bf-421c-8476-52285d169ba6","year":null},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:657309d115192f9f2d8c9eb7128049b43d9920c5e9615cf113bfb2f3b30a01ed","observation_id":"46f231c0-bce3-4da2-ba8b-49b1fc79fa88","resolution":{"observed_at":"2026-05-18T15:27:52.282984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feed- back","venue":null,"work_id":"13c3ddc7-8fe0-4306-8635-999c37b42dcb","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:5a998882fa94dfcf3376b13e85956c251e7a744a46e36727121c59af06aabe6f","observation_id":"bb764305-6ec1-4740-a4b9-9cb375379ab7","resolution":{"observed_at":"2026-05-18T15:27:52.286714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tinyllama, Sep 2023","venue":null,"work_id":"c5f2f7f7-cb5f-4259-8c92-40d2f16a5166","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:af8783b9f7176ba1954fbf583898b192688051a13257e9dc40d7e75e891b2d97","observation_id":"ebabdbb0-1260-4f70-b470-19f88da8c8d4","resolution":{"observed_at":"2026-05-18T15:27:52.289570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14167","last_updated":"2023-05-24T02:51:37Z","snapshot_observed_at":"2026-08-03T12:50:17.890774Z","submitted_at":"2023-05-23T15:37:28Z","title":"DetGPT: Detect What You Need via Reasoning","version":2},"cited_work":{"arxiv_id":"2305.14167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14167","snapshot_observed_at":"2026-07-03T10:48:03.072505Z","title":"Detgpt: Detect what you need via reasoning","venue":null,"work_id":"b1733386-d736-4efc-8f3e-c51731328bb2","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2305.14167","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:98c31178bb85a94e39f35d0a93eb2e9108e4b8875875f5d3089bc3e503e77668","observation_id":"3c9d1cda-54f3-45cf-bcb3-cfaaed5176d0","resolution":{"observed_at":"2026-05-18T15:27:52.077756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"040b514e-e4d8-46d7-9439-3c9ecfba9f53","year":2021},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:e94a16e788f0f2034c58d88af1ef1a09ced60d7c8d96904fcbb248b0cd2ff1c9","observation_id":"f3ca63be-7a1f-4ae7-aea2-d45f1d695eb8","resolution":{"observed_at":"2026-05-18T15:27:52.184883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b13e881a479c59d19af24aa203d8c069c233c25741bed743d15972252a92cce1","observation_id":"4084dbf0-30f1-4329-b6d9-41cc6d4e4fc3","resolution":{"observed_at":"2026-05-18T15:27:52.082942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards vqa models that can read","venue":null,"work_id":"0e174c25-c81b-45bd-92f1-0fc757eb1ac8","year":2019},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:a56a78413ec50e267fd8c3c0269811f240b2085caad61b6bc2bc565a9df077ba","observation_id":"0f096a06-d55a-420e-8b3e-e4b810e340f1","resolution":{"observed_at":"2026-05-18T15:27:52.216378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-06T03:44:36.669916Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":"1908.07490","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-07-11T00:37:42.291267Z","title":"Lxmert: Learning cross- modality encoder representations from transformers","venue":"cs.CL","work_id":"a328317e-ee7d-44a5-b290-dbafa77f31f7","year":2019},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:c8df6dddf4badbe355d3c136194be010feceabbd8712c5dd945c59cf3fa39a79","observation_id":"096c54d1-f988-48fe-9848-86c5be5869b2","resolution":{"observed_at":"2026-05-18T15:27:52.088371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Galactica: A large language model for science","venue":null,"work_id":"620eb398-8931-426d-9379-354bbb6b6079","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b9ce23e4bc7ad1074207b6cd332b0e64cdc3070349492710f99aec6eb776f2cd","observation_id":"31e89ffa-681b-423a-8e35-2e79facef8aa","resolution":{"observed_at":"2026-05-18T15:27:52.236604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":"9c89a80c-db49-496c-a510-3df24e183f34","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:8b8ef3946130cc3bca9baa3000e907392bba0cce1ac25486dbedcd927b4ab3d2","observation_id":"98d3c041-a012-4907-92e1-96d8c3ec58fc","resolution":{"observed_at":"2026-05-18T15:27:52.255585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12714","last_updated":"2024-02-04T06:46:03Z","snapshot_observed_at":"2026-07-06T16:09:55.775643Z","submitted_at":"2023-08-24T11:21:05Z","title":"VIGC: Visual Instruction Generation and Correction","version":3},"cited_work":{"arxiv_id":"2308.12714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12714","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vigc: Visual instruction generation and correction","venue":null,"work_id":"b251e674-f0f6-401d-88d6-97e56c3108d4","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2308.12714","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:1afa744fca134c8a343a096b03a25216e11bfd28eddd1a19df089a70e524ef53","observation_id":"8257f077-779f-4112-a334-19dd2658fccb","resolution":{"observed_at":"2026-05-18T15:27:52.094935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2311.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-07-10T17:07:25.768424Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":"cs.CV","work_id":"b73c6ce2-f994-4605-9578-597e13cb9ae7","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:76148b2c6c0f91ebe8498f02efcf002fd980e5157cb13e9af99ffea537ddad53","observation_id":"3ced92d1-13d4-4817-80a1-a4ac61a6905e","resolution":{"observed_at":"2026-05-18T15:27:52.101123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2208.10442","doi":"10.48550/arxiv.2208.10442","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":"arXiv (Cornell University)","work_id":"ddcdf64e-3f93-4e11-9dbf-1e71391c7dd7","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:b718598e8613d8dbace0d17af36eac8cd7a3d594a55e9b1e80dc5868a5d096bb","observation_id":"0bbdbedb-041e-4764-a37c-88270197c999","resolution":{"observed_at":"2026-05-18T15:27:52.107141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:38:27.341793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:38:27.341793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:0015338b014a3fa28231721679cd5f6701ce249d319eb6106adfa38316ea55c7","observation_id":"3cb97303-4f3a-4cb8-9c4d-7f55523da5bb","resolution":{"observed_at":"2026-05-18T15:27:52.114785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothquant: Accurate and effi- cient post-training quantization for large language models","venue":null,"work_id":"61406ed8-3e7e-4948-a293-0d62d8f72e22","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:3b3ab1a3c907d17caab35057fb27db37eb1ef9d26b08947030bfd4424369822d","observation_id":"ada21607-cf5d-417c-88d9-6699a4d68a1a","resolution":{"observed_at":"2026-05-18T15:27:52.208987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":"2309.10305","doi":"10.48550/arxiv.2309.10305","metadata_source":"pith","pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baichuan 2: Open Large-scale Language Models","venue":"cs.CL","work_id":"9ba8f898-3900-4776-b82e-11e767a86ba9","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:77c1ed4ee4c250602a18923eb5c82b5d284ac6713f149b47e329ebda20748393","observation_id":"e08e007d-314b-4364-b708-bb86230343d9","resolution":{"observed_at":"2026-05-18T15:27:52.120033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:58.81351+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:58.81351+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:7ebfc15cef48926838369e3364777e2f79bc2b873c96d3230fb8b90ff5c82206","observation_id":"e779d337-483a-43dd-9583-b1117bc6f29d","resolution":{"observed_at":"2026-05-18T15:27:52.125475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-07-06T17:20:00.101661Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":"2401.13601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-07-04T15:09:55.103963Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":"4c35990c-f0e6-4be5-bdd6-e77e3eaddf23","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:107c274792f1da966c61d156dbed0e2f05f8fe9fd1f4818ff0a1e963429b9e3e","observation_id":"2b5169e2-0cd1-430f-9b8a-5eb46314ec32","resolution":{"observed_at":"2026-05-18T15:27:52.130641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OPT: Open pre-trained transformer language models","venue":null,"work_id":"ee6410b1-e60a-4dca-8ca2-72fc3b6b9c81","year":2022},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:0419fd0a3c2d40873e8d542fe1304fc2c23d3b21dbe68da9c8b2542ae992ebff","observation_id":"df0ebf9f-713e-4bf4-b58a-de77614a406b","resolution":{"observed_at":"2026-05-18T15:27:52.168363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-06T02:13:50.627750Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2307.04087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-07-02T15:07:03.935337Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":"cb1fc191-de60-4941-87ad-8829d88f83c2","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:ccd4bccacd8bd1b1eb544911202481d7ca8a336fd01fa7b7edc9d529bb8bd896","observation_id":"60743011-f516-4957-8578-263f3ccdb2dc","resolution":{"observed_at":"2026-05-18T15:27:52.136023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lidar-ptq:post-training quantization for point cloud 3d object detection","venue":null,"work_id":"b6c61e9d-6e0d-4883-8074-4eb6a5daff81","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:dfbcf59dab3f8ac90b8e0ade9ee90e1ead887ed7a96d91c15cf83ebcb54c57f0","observation_id":"e2344869-9b88-411a-a554-8a528497e70b","resolution":{"observed_at":"2026-05-18T15:27:52.228475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:f61b247bbf290dbe4317ab534ac5977981a3aa6f476e6340a7a82eefb9745ef4","observation_id":"d611b88c-bc50-4b44-82b6-e93f7ab976e1","resolution":{"observed_at":"2026-05-18T15:27:52.140874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02330","last_updated":"2024-02-22T07:12:44Z","snapshot_observed_at":"2026-08-01T18:43:37.910915Z","submitted_at":"2024-01-04T16:07:43Z","title":"LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model","version":4},"cited_work":{"arxiv_id":"2401.02330","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02330","snapshot_observed_at":"2026-07-04T06:39:37.481871Z","title":"Llava- phi : Efficient multi-modal assistant with small language model","venue":null,"work_id":"dd1c6ed9-b565-4f12-840a-b071471088f3","year":2024},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2401.02330","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:c2453606f52e0ddac5fae389ebbdb5b4eb47200792e9bb5d0fd31d1f93d5da57","observation_id":"238f4ae0-43af-44c0-ac1d-6f6f576eac31","resolution":{"observed_at":"2026-05-18T15:27:52.145811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":3,"verified_exact":38,"verified_fuzzy":33},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 39 inbound Pith citation observations for arXiv:2402.03766."}