Pith. sign in

Paper Citation Record · LEDGER

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

As of 6 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 39 inbound Pith citation observations for arXiv:2402.03766.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2402.03766 v1

Coverage vector

measured 76 of 76 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-18T15:27:51.839171Z

measured 115 of 115 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 39 of 39 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T05:57:51.203800Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T11:37:03.180051Z

Reference resolution

76 of 76 outbound references displayed

  • verified exact38
  • verified fuzzy33
  • unresolved3
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4ac961fb-dca6-47d3-99ad-aef19c168c0e · outbound

This paper cites An In-depth Look at Gemini's Language Abilities.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model An In-depth Look at Gemini's Language Abilities

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:51.898125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:1c6573fe1afb5fa8967269cb3304189ab08cbad0667b115c4c555943f9b65d80

Observation 48f4433e-68f3-436b-b359-702e70248174 · outbound

This paper cites Openflamingo, Mar.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Openflamingo, Mar

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.164502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:58daa16295311024a1de117a4959f44a1e0c28224cb88a90898013c366773d74

Observation 6bf6961b-baf2-4dc7-bb68-eb062984e149 · outbound

This paper cites Qwen Technical Report.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Qwen Technical Report

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.149961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:8f2d43a3fbd0d35314f2eb043aef157f9dec3b97438f709d3e01de4b53e9468c

Observation 575954b2-bb8d-4e90-ac67-4b1066b40578 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.155838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:2e274dfea774e32cc87dd1475737c195d6e5a9895ad7a134ec5cfeed2bc7e9ff

Observation 0cd1f460-d9fd-41d7-9627-acdad45b0736 · outbound

This paper cites Pythia: A suite for analyz- 8 ing large language models across training and scaling.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Pythia: A suite for analyz- 8 ing large language models across training and scaling

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.176346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:9779b3502c00fb075ea60b7709fc0f51053ef7110953a82effa87469e4ca5cf5

Observation 7d66992c-c8e1-4071-93c1-51f8fa90e963 · outbound

This paper cites Lan- guage models are few-shot learners.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Lan- guage models are few-shot learners

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.180340Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:88b04e1bca7021e7642f730efd7bd176be1c3860d3703034065b20986930a121

Observation c81e777f-0216-4db0-932d-039692b34c9f · outbound

This paper cites Honeybee: Locality-enhanced Projector for Multimodal LLM.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Honeybee: Locality-enhanced Projector for Multimodal LLM

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.160774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:a5f760943d5527943f280886afb85d1f5c3716fca6359e51874bd5a18ec7161b

Observation aca742c5-3139-4668-9931-e8d7e9b14bf5 · outbound

This paper cites MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.907150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:1bff008f4d26c96009431bc7183aad603a34a7826f51ea9454e09d949c197cd2

Observation df2417ea-5092-4817-bdea-feb8b540397c · outbound

This paper cites Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.915673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:3ed9817c2b38dfe02c8994664142232c2ec7caee620b41382bf8bc78b6b23af6

Observation d9c1dc2d-4e6b-4eff-9e9e-417bad7381f6 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.921563Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:2114129803a14b822ab7e76cfa27cf8c49023bf607abe2cefce593443b279244

Observation 3ef7bb48-4db9-4437-a7db-99e14d1cd6be · outbound

This paper cites Lawrence Zit- nick.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Lawrence Zit- nick

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.201043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:c46b5d58a56de224d74350ecf6a89e4309c6a0ed7c9d7f7d786d4d6a2d81d7bc

Observation a9dfdb84-7400-4b96-9c6f-82231d804e86 · outbound

This paper cites Unifying vision-and-language tasks via text generation.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Unifying vision-and-language tasks via text generation

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.204821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:a533138206bb38e62f8b63bf873526998073ca96640ab50f70e5c992d939745e

Observation 520d1d09-1e61-406e-9b58-a8fdd3ec07c8 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model PaLM: Scaling Language Modeling with Pathways

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.927007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:ea6c5bfa0ae28a7b2d757198824482842a9c49ee99b4b85ed853a42b7585b0ad

Observation 1ab7ef83-c59f-4a6c-ba2a-b6ab7e23f2c8 · outbound

This paper cites Make repvgg greater again: A quantization-aware approach.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Make repvgg greater again: A quantization-aware approach

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.212777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:83fb627c451574f6f1a94dda83901ebae62f691d8d12d06dbadfa7bd79106392

Observation b230a10c-ff3d-4239-9288-978f8af0d072 · outbound

This paper cites MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.932747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:27429e9b5645f4985758898c83ee872203bef859644b3678777f849a0712bf56

Observation a5fe84c8-e652-4310-aab8-7611bf2d211a · outbound

This paper cites Conditional positional encodings for vision transformers.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Conditional positional encodings for vision transformers

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.219900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:28350722b015a807dabb6e1c10088c9092ad60f0786e80791da39654c02bc2c0

Observation e4940fbc-0982-4ed0-ae52-83bcfbb8aa0e · outbound

This paper cites Redpajama: An open source recipe to reproduce llama training dataset.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Redpajama: An open source recipe to reproduce llama training dataset

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.224508Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b2778dba6bbeb56faf7741e807af0daece191c0bc8c63a6076acb191447a8fd4

Observation 319b4c68-b983-4269-be0e-fa8dd74a6b49 · outbound

This paper cites InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.938461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:37e8dc9a77f54528b13aaccd81bfabdfbc6d5220aa7563f1df719e35b5874229

Observation b8ddaba5-2bde-40d0-a9e7-8c809dc86717 · outbound

This paper cites Visual dialog.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Visual dialog

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.232481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:5ab30d647d704bd64466a2960f12ca842ed05d29b1b93433a7418a55db6958a4

Observation 63fa8dd1-b041-4d49-8d28-0c39051f0031 · outbound

This paper cites InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.944490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:89d5dd103862ec1ebfea2f5af284a9dbce04d49e23e0f8c661adc3edb23f54ee

Observation 44b10e6b-9730-447b-b5d2-2ac64cf4cce7 · outbound

This paper cites Glm: General language model pretraining with autoregressive blank infilling.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Glm: General language model pretraining with autoregressive blank infilling

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.240418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:03911e2612dd4315953b27cd89e3e78621bfa94b41ed7fd5e99d41fd6fdb6ca4

Observation 3445fc17-4be6-4ad5-96b3-8cce65eb9628 · outbound

This paper cites Learning factored representations in a deep mixture of ex- perts.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Learning factored representations in a deep mixture of ex- perts

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.244358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:f20d27cfb4f694801ea026b7a5f3acf254dfae47e977063c1a3b1d9fbab34866

Observation 234ed899-9e02-4f85-ab2f-bb234a2d9d61 · outbound

This paper cites Sparsegpt: Massive language models can be accurately pruned in one-shot.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Sparsegpt: Massive language models can be accurately pruned in one-shot

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.248167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:c6a18410a5674ac5e31da3e9d326b5d1391c4064640467b004a6ff6a8bbf93c2

Observation 6994e6a0-6d2b-41bd-9cd1-c5b9536a85fd · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.950905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:416291670f41a404141d318f206ddf7df1af5d9233384f5825a83af21b0619dc

Observation 1d439e00-5349-4238-8a67-9c212505d4e3 · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.964698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:548c9e7d7cfd389b1c1a3a2a2fd9e3c9005449306dc2a37903eabdfaf246eb3e

Observation 026ec8cd-05d3-41ab-9ba2-5bd5371627b9 · outbound

This paper cites A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:51.971525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:0354f73e86137641b1616164e4d0146d894fd4b885e8e473b7b0e9d126e87472

Observation 744c4b3b-8881-40bc-83d1-604db3c97a31 · outbound

This paper cites llama.cpp.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model llama.cpp

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.262562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:086412d0b5d39a9df1f8a0fe292db0c83e8df678cf8685b4e85dda1d5a787e91

Observation a273e820-2090-4d8f-bf92-569cdde06982 · outbound

This paper cites Gaussian Error Linear Units (GELUs).

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Gaussian Error Linear Units (GELUs)

Reference 28

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.980287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:08b4d4fe3eae29f3ec7271879eceb3f0e51b1d60b887ba7800624a96cbce661a

Observation 92eeb03f-c69c-438a-a535-7012e4a99e4d · outbound

This paper cites Gqa: A new dataset for real-world visual reasoning and compositional question answering.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Gqa: A new dataset for real-world visual reasoning and compositional question answering

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.269265Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:837ab9f3ec6c61c7d19132b5f7c202fe307a0466e5c986245931900e8517236a

Observation b40d2e1b-5a5d-4e5f-84ce-bf0d4469ac32 · outbound

This paper cites Adaptive mixtures of local experts.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Adaptive mixtures of local experts

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.272557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:5260e2305abb42f2cfe916c81c764f463e1afb053fada189583e6d4f625d1a51

Observation da3db281-051c-4ce1-b300-d929e23af9bb · outbound

This paper cites Segment Anything.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Segment Anything

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:51.987624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:64eef2dde2c5d10bb9932047dc1b710df5bd561dd781f5d32901a16769d59ec4

Observation 966822c7-3917-4dac-86a2-54ec9ae3d0f6 · outbound

This paper cites Grounding Language Models to Images for Multimodal Inputs and Outputs.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Grounding Language Models to Images for Multimodal Inputs and Outputs

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T15:27:51.994241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:caaa98f8c939fd77d82e399ec4d3a0ca45f43d213ef247e67846ccb4c8c8caba

Observation f2f92ab5-4202-4cf0-a0bd-328334a5928e · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model LISA: Reasoning Segmentation via Large Language Model

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.005910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:cd7ca2e77aeefb7f6d00a40111ef22e7e83703b4642bb9c7b69a6f7575202131

Observation db62ab0b-ac30-4e00-a10c-c0e73749223f · outbound

This paper cites OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.015246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:3cd744b27a00b271832645a56aff128cf5d3239747b2519d85fe7a97a8562c4c

Observation 63a8860f-f4a3-49db-ad62-1148186d497b · outbound

This paper cites BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.023205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:d80d5197b2f6a81cf7e4e5f4cab7a81eeb17bffde85d03c354bf4686af2fefff

Observation a7e1164e-7e3d-4a85-a07f-cbe081b9fe9f · outbound

This paper cites Align before fuse: Vision and language representation learn- ing with momentum distillation.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Align before fuse: Vision and language representation learn- ing with momentum distillation

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.293074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:910e8eeaa273408bf8f661ee01e17516cc2fd90566b4a4ad26efc13eddce20a6

Observation 0b57c595-8d08-4ea6-b2a8-6bc299ae5607 · outbound

This paper cites Norm tweaking: High-performance low-bit quantization of large language models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Norm tweaking: High-performance low-bit quantization of large language models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.296557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:343d4fc7f98b86de8c2a99a473b005978f7a845cc0eaf914fe7d1ab717aa25d0

Observation e2eb03ca-d5c7-4e71-9617-76217e8c8511 · outbound

This paper cites A Speed Odyssey for Deployable Quantization of LLMs.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model A Speed Odyssey for Deployable Quantization of LLMs

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.029371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:84652c434dcff4d8f8b34e3d4e603e2f8dfc9f2d8403f8f3147968c74ed3424f

Observation 6383d318-68d6-4012-833e-d8df8fa8039f · outbound

This paper cites Textbooks are all you need ii: phi-1.5 technical report.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Textbooks are all you need ii: phi-1.5 technical report

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.172274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b173e8b472efc0bd33e601ae31fa98a4a58e36c982840f0dd61b1e0c5e2ea01b

Observation 6e2685a1-7425-432c-bb01-612a73767871 · outbound

This paper cites Evaluating Object Hallucination in Large Vision-Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Evaluating Object Hallucination in Large Vision-Language Models

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.036310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:0e0827b7ace0748fb0dc65dfb56eae7a54e85cd41a859746aa64fc08d58637a8

Observation 489f0fd0-9082-421a-b621-7bebd5eef3b3 · outbound

This paper cites Moe-llava: Mixture of experts for large vision-language models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Moe-llava: Mixture of experts for large vision-language models

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.188906Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:22a1f639b5391f92679d3e1261593b13e7817db55bb5ddce00639bb27c1121bb

Observation b28d5e23-754b-4146-b66c-2edc1b02d9f5 · outbound

This paper cites Microsoft COCO: Common objects in context.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Microsoft COCO: Common objects in context

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.193336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:a215413a80fe0b13d10ef6b28f059aed324a8016e66b9bb886a0ba728c0ea6b4

Observation 4fa4aae8-e89c-4984-9d94-c984b02c4190 · outbound

This paper cites Visual spatial reasoning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Visual spatial reasoning

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.197388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:e17df1418532ab9dba71072a5d5ae2c9459d3d301ca8407522b71a1b3a56e53c

Observation 393415f0-7035-4ceb-ac53-54562d4a00d4 · outbound

This paper cites Improved Baselines with Visual Instruction Tuning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Improved Baselines with Visual Instruction Tuning

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.046756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:52f58e89508911b83ea0aaa2aa23c9ba637f9190fb00bf38f18beedf4338f5a3

Observation cc8325f2-a57e-4d56-a780-8c7af5cd2464 · outbound

This paper cites Visual Instruction Tuning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Visual Instruction Tuning

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.052441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b671e30896d6860f596730baaf0613e7245fc36dfe74fdfd496b6c8e1c72c9c1

Observation b70fd953-5cde-479d-92b6-714a256bc42e · outbound

This paper cites MMBench: Is Your Multi-modal Model an All-around Player?.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MMBench: Is Your Multi-modal Model an All-around Player?

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.057371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:a1e573784feea575db15de7e96062bb4dccafd053c23bea9dab5a55ff88ced58

Observation 845ea1f4-c9ad-4d34-9c49-10df387590df · outbound

This paper cites Decoupled Weight Decay Regularization.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Decoupled Weight Decay Regularization

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.065471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:dfb0fa1c849fe46819fd87d57ba6ecbec210390cb858233a1340d34e9a7bc37c

Observation b8662f6d-a0d7-469d-88f2-a5c2818da2c8 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Learn to explain: Multimodal reasoning via thought chains for science question answering

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.251859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:2d51ebcbb975aa79f95c6c945feb0c0d66857441b917f36719163310d7ec7eb7

Observation 83dc7c90-425f-4be1-ac92-cc3f3d854e24 · outbound

This paper cites IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.071527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:515e86592dc686ac64592cc5291c77d8f40d70a1137f723a9698f0096ebb5b08

Observation 934f6e7b-7d22-4a00-806a-38e62fedbe67 · outbound

This paper cites an unresolved cited work.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-05-18T15:27:52.259168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:59c9aa2b7b081e9f6f494cedbbb41439eea1cbc4c9a2460f633d3d807776b5f5

Observation dca8226b-6241-4580-8eb0-c6c5bf74c7ce · outbound

This paper cites an unresolved cited work.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-05-18T15:27:52.265804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:7233fc4578f2925aeed44d30c48c66aa4784020aafe86f226d21b507dd26593b

Observation a918778e-858d-49a1-b1d0-d507df791c4d · outbound

This paper cites Gpt-4 technical report.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Gpt-4 technical report

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.276162Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:83f746c8a131772b13b574852a2865c9bcb9b34d46fa0993791de6836f02d04b

Observation 2d787268-28e5-4a45-a487-cd3db282965f · outbound

This paper cites Gpt-4v(ision) system card.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Gpt-4v(ision) system card

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.279696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:bcee56577950337149c0ed8b0b25884fc73d30b3d2f7f58d2ca566d120fe85e1

Observation 46f231c0-bce3-4da2-ba8b-49b1fc79fa88 · outbound

This paper cites an unresolved cited work.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-05-18T15:27:52.282984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:657309d115192f9f2d8c9eb7128049b43d9920c5e9615cf113bfb2f3b30a01ed

Observation bb764305-6ec1-4740-a4b9-9cb375379ab7 · outbound

This paper cites Training language models to follow instructions with human feed- back.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Training language models to follow instructions with human feed- back

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.286714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:5a998882fa94dfcf3376b13e85956c251e7a744a46e36727121c59af06aabe6f

Observation ebabdbb0-1260-4f70-b470-19f88da8c8d4 · outbound

This paper cites Tinyllama, Sep 2023.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Tinyllama, Sep 2023

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.289570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:af8783b9f7176ba1954fbf583898b192688051a13257e9dc40d7e75e891b2d97

Observation 3c9d1cda-54f3-45cf-bcb3-cfaaed5176d0 · outbound

This paper cites DetGPT: Detect What You Need via Reasoning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model DetGPT: Detect What You Need via Reasoning

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.077756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:98c31178bb85a94e39f35d0a93eb2e9108e4b8875875f5d3089bc3e503e77668

Observation f3ca63be-7a1f-4ae7-aea2-d45f1d695eb8 · outbound

This paper cites Learning transferable visual models from natural language supervi- sion.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Learning transferable visual models from natural language supervi- sion

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.184883Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:e94a16e788f0f2034c58d88af1ef1a09ced60d7c8d96904fcbb248b0cd2ff1c9

Observation 4084dbf0-30f1-4329-b6d9-41cc6d4e4fc3 · outbound

This paper cites BLOOM: A 176B-Parameter Open-Access Multilingual Language Model.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model BLOOM: A 176B-Parameter Open-Access Multilingual Language Model

Reference 60

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.082942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b13e881a479c59d19af24aa203d8c069c233c25741bed743d15972252a92cce1

Observation 0f096a06-d55a-420e-8b3e-e4b810e340f1 · outbound

This paper cites Towards vqa models that can read.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Towards vqa models that can read

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.216378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:a56a78413ec50e267fd8c3c0269811f240b2085caad61b6bc2bc565a9df077ba

Observation 096c54d1-f988-48fe-9848-86c5be5869b2 · outbound

This paper cites LXMERT: Learning Cross-Modality Encoder Representations from Transformers.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model LXMERT: Learning Cross-Modality Encoder Representations from Transformers

Reference 62

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.088371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:c8df6dddf4badbe355d3c136194be010feceabbd8712c5dd945c59cf3fa39a79

Observation 31e89ffa-681b-423a-8e35-2e79facef8aa · outbound

This paper cites Galactica: A large language model for science.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Galactica: A large language model for science

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.236604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b9ce23e4bc7ad1074207b6cd332b0e64cdc3070349492710f99aec6eb776f2cd

Observation 98d3c041-a012-4907-92e1-96d8c3ec58fc · outbound

This paper cites Internlm: A multilingual language model with progressively enhanced capabilities.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Internlm: A multilingual language model with progressively enhanced capabilities

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.255585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:8b8ef3946130cc3bca9baa3000e907392bba0cce1ac25486dbedcd927b4ab3d2

Observation 8257f077-779f-4112-a334-19dd2658fccb · outbound

This paper cites VIGC: Visual Instruction Generation and Correction.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model VIGC: Visual Instruction Generation and Correction

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.094935Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:1afa744fca134c8a343a096b03a25216e11bfd28eddd1a19df089a70e524ef53

Observation 3ced92d1-13d4-4817-80a1-a4ac61a6905e · outbound

This paper cites To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.101123Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:76148b2c6c0f91ebe8498f02efcf002fd980e5157cb13e9af99ffea537ddad53

Observation 0bbdbedb-041e-4764-a37c-88270197c999 · outbound

This paper cites Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T15:27:52.107141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:b718598e8613d8dbace0d17af36eac8cd7a3d594a55e9b1e80dc5868a5d096bb

Observation 3cb97303-4f3a-4cb8-9c4d-7f55523da5bb · outbound

This paper cites Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.114785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:0015338b014a3fa28231721679cd5f6701ce249d319eb6106adfa38316ea55c7

Observation ada21607-cf5d-417c-88d9-6699a4d68a1a · outbound

This paper cites Smoothquant: Accurate and effi- cient post-training quantization for large language models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Smoothquant: Accurate and effi- cient post-training quantization for large language models

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.208987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:3b3ab1a3c907d17caab35057fb27db37eb1ef9d26b08947030bfd4424369822d

Observation e08e007d-314b-4364-b708-bb86230343d9 · outbound

This paper cites Baichuan 2: Open Large-scale Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Baichuan 2: Open Large-scale Language Models

Reference 70

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.120033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:77c1ed4ee4c250602a18923eb5c82b5d284ac6713f149b47e329ebda20748393

Observation e779d337-483a-43dd-9583-b1117bc6f29d · outbound

This paper cites mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.125475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:7ebfc15cef48926838369e3364777e2f79bc2b873c96d3230fb8b90ff5c82206

Observation 2b5169e2-0cd1-430f-9b8a-5eb46314ec32 · outbound

This paper cites MM-LLMs: Recent Advances in MultiModal Large Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MM-LLMs: Recent Advances in MultiModal Large Language Models

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.130641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:107c274792f1da966c61d156dbed0e2f05f8fe9fd1f4818ff0a1e963429b9e3e

Observation df0ebf9f-713e-4bf4-b58a-de77614a406b · outbound

This paper cites OPT: Open pre-trained transformer language models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model OPT: Open pre-trained transformer language models

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.168363Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:0419fd0a3c2d40873e8d542fe1304fc2c23d3b21dbe68da9c8b2542ae992ebff

Observation 60743011-f516-4957-8578-263f3ccdb2dc · outbound

This paper cites SVIT: Scaling up Visual Instruction Tuning.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model SVIT: Scaling up Visual Instruction Tuning

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.136023Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:ccd4bccacd8bd1b1eb544911202481d7ca8a336fd01fa7b7edc9d529bb8bd896

Observation e2344869-9b88-411a-a554-8a528497e70b · outbound

This paper cites Lidar-ptq:post-training quantization for point cloud 3d object detection.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model Lidar-ptq:post-training quantization for point cloud 3d object detection

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T15:27:52.228475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:dfbcf59dab3f8ac90b8e0ade9ee90e1ead887ed7a96d91c15cf83ebcb54c57f0

Observation d611b88c-bc50-4b44-82b6-e93f7ab976e1 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 76

Resolution
verified exact
local_arxiv, observed 2026-05-18T15:27:52.140874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:f61b247bbf290dbe4317ab534ac5977981a3aa6f476e6340a7a82eefb9745ef4

Observation 238f4ae0-43af-44c0-ac1d-6f6f576eac31 · outbound

This paper cites LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model.

MobileVLM V2: Faster and Stronger Baseline for Vision Language Model LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model

Reference 77

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.145811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T15:27:51.839171Z digest=sha256:c2453606f52e0ddac5fae389ebbdb5b4eb47200792e9bb5d0fd31d1f93d5da57

Pith citing papers

Observation 263d85c1-f1d6-4364-b24b-a71a956863f9 · inbound

A Survey on Multimodal Large Language Models cites this paper.

A Survey on Multimodal Large Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-16T02:56:41.658658Z digest=sha256:c532b82480fbc712216ab3b35f7efe9d7161efacf9ea8cfb5b88d153d12d4cfb

Observation 1503c723-328b-4cac-a9aa-56a377499b70 · inbound

SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation cites this paper.

SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-15T22:48:36.010306Z digest=sha256:fdea45c0fe29ec217481fae294827e1d6757fbd7f69423215d0ff3837fe54773

Observation 46e295f0-9a91-4c7b-bdbb-717cd03e1184 · inbound

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs cites this paper.

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-17T00:05:03.547664Z digest=sha256:628fccf62185d54c444e62abdda2e9ad23258a001fa8d8963ff292f9cd869576

Observation c0a91e8e-e316-4caa-96c1-5f67b4ca59b0 · inbound

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation cites this paper.

TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-17T16:12:25.980853Z digest=sha256:f3e6c13ede3e04930a5f6e96f220e58acbf5d965cdd245847074e202535ac89a

Observation 344e15de-5299-43a4-ae83-9383e3b1709f · inbound

Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation cites this paper.

Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-15T22:09:16.001309Z digest=sha256:1af43a3cff5648b67390372fb03600d0da8a2f00ef5b9076fff4db989502597f

Observation 9ada2901-c73a-4a18-8701-75ddf83dc74a · inbound

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling cites this paper.

Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-11T08:14:52.890145Z digest=sha256:c6fec1ec31af029fecec2590ba85e7926a4fe0f1f7c80e462481fd31c12ae8c7

Observation 8ce9c562-fcff-446c-8640-5f2324255869 · inbound

Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation cites this paper.

Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-17T07:24:04.460276Z digest=sha256:7f658a0c8df0b02dc7ba068fd5f852a6534c98476cf06603de9a3053eb6684ef

Observation 10e90e2a-2391-46d1-ba25-090cfe54c8e6 · inbound

Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance cites this paper.

Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T05:57:51.203800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:57:51.203800Z digest=sha256:bb69eb10b1614ee1d4bbad14826441b7fa50bad6b96753efea80045f7fe506c0

Observation d4b12cfc-f810-4ba5-b98f-1a3ff685a3d2 · inbound

MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning cites this paper.

MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T05:36:17.214634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T05:36:17.214634Z digest=sha256:4221878fb0cc432566f627d5021cdc09eecb40233d2e9f3ffc5eda66d19b3d85

Observation 52e0de29-c462-44ec-9e5c-e515c51147a4 · inbound

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors cites this paper.

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T13:05:54.046573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T13:05:54.046573Z digest=sha256:e5a3f164e05838a44e009c02432aeaf806ceb808019ada31a33d38588f591518

Observation 28e53504-3766-4af0-9e9b-137aa3ed3238 · inbound

Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution cites this paper.

Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T18:58:12.612496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:58:12.612496Z digest=sha256:f61df13777b411a587ac787238e8179b8bbc2ac13c6adeb2deabf1e1bc1381da

Observation 8e437234-3ca9-455e-a694-cee88a569e27 · inbound

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching cites this paper.

Discrete Guidance Matching: Exact Guidance for Discrete Flow Matching MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T14:13:48.523955Z digest=sha256:753fdbd5de18587904afe119a1525632c2e03d9adfe54e07bb0e4e54536d1e04

Observation fefafde8-9ebd-465c-bba6-06632c49f513 · inbound

Agentic Services Computing cites this paper.

Agentic Services Computing MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T14:41:47.089958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:41:47.089958Z digest=sha256:05b3d8b069b58df535187a0e6e06c371e1121fc8b1ee6cc3eaaeab57dd10b03a

Observation d9a9b26d-283c-4c63-a30d-df97864bca55 · inbound

Mind the Gap: Action Rebinding Attacks against Android GUI Agents cites this paper.

Mind the Gap: Action Rebinding Attacks against Android GUI Agents MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T09:54:55.990620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T09:54:55.990620Z digest=sha256:e2d3d38b2fd154560e9ef9ab4b613b11a0f0a84aac227f5f34a67c16efc343cc

Observation fa6fc2fc-95c7-4f4f-a501-fdb244ebeeb3 · inbound

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression cites this paper.

On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-21T15:10:16.499228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-21T15:09:25.818449Z digest=sha256:f03d43a87ecc4129273b3e44c4b3b9b0901b75d05ffc622bde966b680d5caa6f

Observation 48311f00-544d-4618-9e59-65ecc5517e89 · inbound

Vision-aligned Latent Reasoning for Multi-modal Large Language Model cites this paper.

Vision-aligned Latent Reasoning for Multi-modal Large Language Model MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-16T07:48:23.272002Z digest=sha256:ab242a86056e63a00a3d4110505c1058b5ce7f612ed765839e37d4cfaa390a8a

Observation aef52343-ad2f-448b-8775-3a031ebe0551 · inbound

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy cites this paper.

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-15T17:43:32.593075Z digest=sha256:a11360bb10adeb2f3db20ea0b1f9f523047180edcbf020850eeb7adc54d2c460

Observation 24be7692-d81e-462a-83b6-fc10da143e59 · inbound

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs cites this paper.

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T19:45:33.950587Z digest=sha256:911b51132727378f85ce2c807a286f56eb8a2df680158d07fce4c81c57b9dd21

Observation d1f4314d-bbc1-4a66-bc8d-f81ca829cfbe · inbound

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation cites this paper.

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T19:01:18.334371Z digest=sha256:f17cba0dd61f6ed748ac13214ce3b2a66522440531cff0df858a98334185849e

Observation f73e3e90-fb04-424f-826d-9ae0b3fd6f3e · inbound

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning cites this paper.

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T17:55:12.551127Z digest=sha256:597881aac99a4a92b06d8a7c1ea3b0b798c03e74179664bde6520db0c0d84038

Observation e560d582-a4c4-4dc7-a0ba-46d3dd9acccc · inbound

UIPress: Bringing Optical Token Compression to UI-to-Code Generation cites this paper.

UIPress: Bringing Optical Token Compression to UI-to-Code Generation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T17:21:32.024105Z digest=sha256:272548984eff4f860c816cb06d6c95f4620d5ec481bb8b04b80941baa5039fdb

Observation 66deedc9-2dc7-486d-9b70-61735715618a · inbound

UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing cites this paper.

UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T13:53:13.255412Z digest=sha256:641b992cec3e2e6a378c4c7f9517339732f3594bbd80becd6b78fc07acd15be7

Observation 74dba68e-92bd-47b6-bab3-46d01fb03e80 · inbound

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models cites this paper.

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T11:23:46.371799Z digest=sha256:9050f3d2a2755c6701ccfb854692ece1e47dcffae86e1d0991fa93ed24dacacc

Observation 7ed7f7c2-ee9d-4265-bb9d-a3ecfbc1d01b · inbound

LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models cites this paper.

LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:27:52.297815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-12T05:10:56.991368Z digest=sha256:422c964c3ac9267cc3cc48fa52b76dc300925c6d1eb3a6cb19d6927c509500fe

Observation ed8d7760-2a87-436a-be4b-7cf844f4ee7c · inbound

A More Word-like Image Tokenization for MLLMs cites this paper.

A More Word-like Image Tokenization for MLLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-20T12:48:17.437221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T12:46:04.946489Z digest=sha256:75f671c2641d09536dbbc5643f45211490380a479605779aacf56e1e78857dbe

Observation 638883d0-c9e0-4ffc-bd30-9c572fb44799 · inbound

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models cites this paper.

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-06-29T22:54:00.644566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-29T22:53:52.992152Z digest=sha256:ecc6bc06d759a9f56f372bbdaa9335e8db4465dbdb6ae5bb7f87f0dfe5a11c35

Observation 5bcd4345-234b-4e9e-adfd-ee4c9180f3b3 · inbound

A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models cites this paper.

A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-06-28T20:22:37.629087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T19:53:36.990878Z digest=sha256:3fef73d14ae61354c6f6cce2359498eb7a54e2590c1138c32d39e0498121293e

Observation 81f8c5a9-11d6-4e4b-892d-6b6bc179103d · inbound

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs cites this paper.

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T10:15:44.628186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-07-01T05:41:04.184461Z digest=sha256:2561e641e5aca645211a7964f287071f2d97afca18f04bb9291ac806e894ea7a

Observation e2ea1e56-24c1-4c16-b19b-b10eaeded060 · inbound

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs cites this paper.

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 11

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T15:37:05.784201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-07-02T15:35:51.205304Z digest=sha256:5e15cff8834e6fd68640905b52fbad4ac50dd38e59c5b211c1cbf5d0236d7036

Observation 778d258d-89df-462f-9886-ecf1f382baae · inbound

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs cites this paper.

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-07-03T15:28:33.781917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-07-03T15:21:11.367562Z digest=sha256:795c2d318f6caaf511fa1464ab68c8b97354b539541949ba12bf5142cf9b5c87

Observation 8a4add3f-3d63-4946-9eed-ffb010edd213 · inbound

Dive Into the Implicit Biases of Low-rank Vision-language Alignment cites this paper.

Dive Into the Implicit Biases of Low-rank Vision-language Alignment MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T11:37:03.181759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-07-10T11:34:56.843122Z digest=sha256:a91a3882888368622173d7cbbb99ebf4f3b398ba836e352c1268f5732eb41fd2

Observation 020bc01c-66c8-4479-bebc-9c0864555736 · inbound

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference cites this paper.

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-13T02:27:00.146927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T02:27:00.146927Z digest=sha256:5b65bc04832a19d4afe8693038c381687810167705ccf577a94d8616fddef106

Observation 334e0b21-23cc-4d92-a6f9-0c5ebd2ea163 · inbound

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs cites this paper.

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T10:06:48.180556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T10:06:48.180556Z digest=sha256:3cb0fbd7039407fed71df9fe1d24f3a45ddaf8194b750dec73486ed22f392924

Observation 9784806a-cd1b-4c70-b5a9-c2e9048b3ee2 · inbound

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models cites this paper.

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T11:49:57.818624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T11:49:57.818624Z digest=sha256:e7a829091d9bdd2d2ed97825a2dc1682ac63fd4c116a8a60d7de45061881122c

Observation ccfa5a24-c162-4fba-9837-a13979c35d7a · inbound

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models cites this paper.

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-31T00:01:33.718457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T00:01:33.718457Z digest=sha256:b1d6d98b97f994fb5d66c4412e54464aad328b6dc45ee140b43312568c68ade4

Observation 4eedcb01-ff63-42b9-bef7-2073b8388be6 · inbound

RemiAssist: A Therapist-Supporting System for Photo-Based Reminiscence Therapy in Dementia Care cites this paper.

RemiAssist: A Therapist-Supporting System for Photo-Based Reminiscence Therapy in Dementia Care MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-31T12:15:59.654246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T12:15:59.654246Z digest=sha256:914cfde5c4737e1df09e5b5d64a552ae25690593a8cd5a5235619976da982347

Observation 1fee9ea4-365d-4765-a35f-c423d3ef6543 · inbound

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation cites this paper.

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-01T02:14:09.815337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T02:14:09.815337Z digest=sha256:ae6a15371d074c6d6ff2ea045a280131fcb1f9261c77d6241f5a424a946e66b1

Observation 15f98822-efca-476e-a94c-f2048e67ec07 · inbound

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication cites this paper.

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T00:51:57.723161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T00:51:57.723161Z digest=sha256:dc6980ab058591c560f0ac73c174d092253ea64e30e9b56f0d34f5d1c64ea477

Observation 147f2d56-c4fd-4482-b478-3970180b19b6 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models MobileVLM V2: Faster and Stronger Baseline for Vision Language Model

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.904035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.904035Z digest=sha256:d00a2de30379af5b58dda00978ce55fd9a9c29579d398095221697e972ad652c