Pith. sign in

Paper Citation Record · LEDGER

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

As of 20 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 12 inbound Pith citation observations for arXiv:2507.13348.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.13348 v1

Coverage vector

measured 90 of 90 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:01.937707Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T12:53:14.415257Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T15:09:55.252188Z

Reference resolution

90 of 90 outbound references displayed

  • verified exact2
  • verified fuzzy8
  • unresolved80
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation da95d1df-9518-4a8e-a71e-b870b6d4c67c · outbound

This paper cites GPT-4 Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.746930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.746930Z digest=sha256:349d2e5bb2886e8a18d6f5c6c7a1df005a18eafbb55d2e53b00ba8c1b248659f

Observation 2d95a751-ad97-4055-b8e0-c162006be85c · outbound

This paper cites Claude 3.5 sonnet, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Claude 3.5 sonnet, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.751678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.751678Z digest=sha256:16326998767ccd30c8d431261fd37325d3ccc9c42c580ad41d1753f08a8d734f

Observation f1884637-c2db-4215-bda3-91804fcee012 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.759782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.759782Z digest=sha256:9cd8d65a30efbfa6994e11e860a96518e8b15b5824f3c55c541e2950b11e8a37

Observation 1b7adfda-4429-4ee8-8dc4-e9ecb974f46f · outbound

This paper cites Qwen2.5-VL Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5-VL Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.767649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.767649Z digest=sha256:588b7e33dc5ca7851d401c40a8528484d0d8547a22f1b25382b20915384f9272

Observation 55e63009-bc8f-4cc5-ab82-e1a081868b4f · outbound

This paper cites Graph of thoughts: Solving elaborate problems with large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Graph of thoughts: Solving elaborate problems with large language models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.771438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.771438Z digest=sha256:1b7c105cdcbf0ccfe80b382d0d4ca38465ffad622d9cb1669a67a20a44480f1b

Observation ec44fc80-013c-4d1b-a646-dfbc958c68d7 · outbound

This paper cites An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.775183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.775183Z digest=sha256:917d50fe343802b12b6f96f5dac12ea00fe966627697429528b90e3b3986812a

Observation 5d4cf5ad-8aba-4c2a-baa4-bfcb2d777283 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.778875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.778875Z digest=sha256:0314fb4d6140135087424c368483dc534075638cec05260a61e0052de6415a57

Observation ba782bfe-c4eb-4186-889d-ebdf45cb8148 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.782852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.782852Z digest=sha256:b9fa0c3a489000189c884b858326363896912c42d346aec5316df480413ff004

Observation d71fb9da-0dbe-4b14-b3dc-0510552f3603 · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.786502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.786502Z digest=sha256:2d74015cdd101b616d5260a0d9b0d949265405816f56518f7cb90ccfd311ad20

Observation 5f9216d3-a8fb-434a-95c3-7893aea77b86 · outbound

This paper cites Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.790426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.790426Z digest=sha256:2609f4895d5498ae1497cb268621a45237cb4c5de0ec357d215d1773bfb9249d

Observation e3c64ecb-a8fe-451d-a100-25e3c759d55f · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.793697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.793697Z digest=sha256:61f6d4a4250d3dd2c19b86aecfd30114dae7d28ba04b2950efc83941bd42be41

Observation 1f66b485-f4fb-4722-afef-bb7155abd312 · outbound

This paper cites Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.797064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.797064Z digest=sha256:2e000fe49b90e96b18b69223623f4101d793ca43b03c21f0f201810eaf81f7f8

Observation d863578d-65b2-45c0-97cd-4460a77e271c · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.800543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.800543Z digest=sha256:40d507ea52bd065ec4121779ccb6a9cb723f89ba5ce743dfc2bb9a03682b9a27

Observation 743d4fb7-f580-48e8-be02-1fb52840f3c5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.807485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.807485Z digest=sha256:3b80313a848d8db6ef9b065cc329eb6da63bc092930b49a0aed2cc07db820f9f

Observation 2fc953bd-036c-4dcd-9c22-3bead0df8910 · outbound

This paper cites ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.811210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.811210Z digest=sha256:bfd83419d9b0c73dc7d8bdf01dac3be2f912a52ddc8c8fd2f8113c22a0d7dec9

Observation dfe46faf-d796-4198-ac54-15d9c6346955 · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.818801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.818801Z digest=sha256:3f12d8e8d41379320bca67fd1cbf6cb43353a81db0a918ac2eaef6eb5f1cf74b

Observation ef28b65c-d973-4e8d-b63f-0bd2f1c293f9 · outbound

This paper cites OpenAI o1 System Card.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenAI o1 System Card

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.825316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.825316Z digest=sha256:5af7b926ac1cb2e9744e8700a75e35aaee2f3ae1070091fc3f5bee4a23797379

Observation 0c2b952d-3b65-4f2e-ad7c-ad93db122eec · outbound

This paper cites Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:02.915215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:56.835798Z digest=sha256:09fba8871d9ea4c857167aef0e4c368025c2599cf40c3809448148923126503c

Observation 8b61d9c3-fad0-46e3-973d-6624242e8946 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.851016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.851016Z digest=sha256:2f34cfad8679bb99c397cac10e4dcd720f52a33c5460cebf6fd590f8deb88be1

Observation 49f78ed6-e73d-420c-bf21-17a1b8c6002c · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenVLA: An Open-Source Vision-Language-Action Model

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.867525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.867525Z digest=sha256:08270c6603118a2b96eb262bc8c1110ee1593ceb6c32043ae61b66d125c6cfd5

Observation 7b35b5cd-9fde-4b65-8634-28f024b0f4c2 · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gonzalez, Hao Zhang, and Ion Stoica

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.888627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.888627Z digest=sha256:77420c79d39e436ee2b18039d19ca8fd9f8200c170f291ca535f90c0bcad8a0f

Observation 781612d5-9bc4-4af2-812d-dee76c2e90ef · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA: Reasoning Segmentation via Large Language Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.916800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.916800Z digest=sha256:1848f99a25d926b46be21eb3254c0a97d4a8f9ad7c0b5aa04489b3c726ccf382

Observation ea45fec3-8ef2-4a24-ba64-0758dad17eaf · outbound

This paper cites Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.951119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.951119Z digest=sha256:cf61d193cbfc8961fed657f5a39390206fa17a282b57f02625318ec5a00c5338

Observation 9a6ffabb-92c8-44a2-8c91-e1ba8a5e6622 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaVA-OneVision: Easy Visual Task Transfer

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.974839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.974839Z digest=sha256:abc133e7ec5bafadfe7a4538d50257a62b321e81eb6bdb6e9e9d36d81f29e766

Observation d20b9ee4-5029-447d-bb24-61ac7af57067 · outbound

This paper cites Logits-Based Finetuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Logits-Based Finetuning

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:02.719238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:56.991972Z digest=sha256:20ca0ccc5e9b8b82daf91483d377eea8c563db98c93e6381fc0899d24214f977

Observation 74632ecc-34ae-41dd-a6bc-b48e83a7a78e · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.019527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.019527Z digest=sha256:2e6b265c6166e60342a4355600acd98af94bd03bc3c7ba8fec19d3b997974b67

Observation bb65240d-bf0e-449f-b50c-2607018e3afc · outbound

This paper cites Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.049334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.049334Z digest=sha256:a45938db56ad522148dd5f3820e8825d8dd73876390a8dbb43cd11744de37bb6

Observation 8fe7027b-76b2-4af2-aa25-012a059d5481 · outbound

This paper cites Evaluating Object Hallucination in Large Vision-Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Evaluating Object Hallucination in Large Vision-Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.065129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.065129Z digest=sha256:146d6696bb1e1ed60e976f3ef4c085f19a1c2afb160e6d9d93b98fa20d29d13a

Observation a722a3b3-9118-4761-8350-f957bdd06929 · outbound

This paper cites Improved Baselines with Visual Instruction Tuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improved Baselines with Visual Instruction Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.074808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.074808Z digest=sha256:e054fb34cdf8b0d87c7a84f853d2391fa9d11516c9c442060ce8265f9a0f1de4

Observation a89c9bfe-08bd-436d-8ecf-b1be72ebeb6f · outbound

This paper cites Llava-next: Improved reasoning, ocr, and world knowledge, January 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-next: Improved reasoning, ocr, and world knowledge, January 2024

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.086274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.086274Z digest=sha256:fcec7aac0486b66714478b3ebee1f4713033a50320cc9a2097535ac98687d9c3

Observation 38382b80-ab54-4621-b467-a189d88b6472 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual instruction tuning.Advances in neural information processing systems, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.093223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.093223Z digest=sha256:6516f56a9813a49623b748a8e7478655140c8483e284fe28ec2997ff30ae1e3d

Observation c3e0b10e-500c-40ed-9d4b-64a657555ab4 · outbound

This paper cites RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.134511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.134511Z digest=sha256:4cf6e818ecd2a7295436ad94f587ca3f188138c0f58565a3e0d00f70f67b0cb3

Observation 63493399-6b72-4a1e-9e33-15c4ee441e79 · outbound

This paper cites OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.223241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.223241Z digest=sha256:39b66e76d9b57f1f9d7f79083bca9bee4595e82ab803c2444cba18207d889223

Observation 6c022fdd-2e6f-4693-bd7a-ea92cd5f7d33 · outbound

This paper cites Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.253690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.253690Z digest=sha256:10bb28cc2272dfb26b4510fdbfda6f5808ac434eeea13b4727d4d71e7562ecf1

Observation bc3223df-08c8-42a8-98e3-0e0b2ce1e0ea · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.308765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.308765Z digest=sha256:f8958f21058ae56056dca04c475c3881518a16bb14e874004539d41e17e542b7

Observation ada00429-bdb6-4b68-a957-2b0fe26b9906 · outbound

This paper cites Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:05.063403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:57.384004Z digest=sha256:aec5ac1ad728e0d395f049b3dd1392bf7914a561b829140fec0f9cfbe7ace523

Observation cf724eff-60da-4cd5-9d17-31b711af7b41 · outbound

This paper cites TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.441181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.441181Z digest=sha256:19c96e663c1075c72ffb20129ff3c879a8523386cd54153196872c2fc122c406

Observation 6b5bac22-0585-49b9-8249-3a315b9070c3 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Reft: Reasoning with reinforced fine-tuning, 2024

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.909715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:57.524682Z digest=sha256:6aeba00fe12bcceedccd24363e18b58566fb5eb964faf9a9f3e416ecdfd6922d

Observation 190fc5b8-08ca-4758-8fb9-05c4c89a1ead · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.577590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.577590Z digest=sha256:fd75ddd28d573247a86359b7b6e45c9eed007a1662cf051faa048273280bfab7

Observation b8ed46d8-0a0c-4c68-88cf-a64d0a16d8cf · outbound

This paper cites Docvqa: A dataset for vqa on document images.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Docvqa: A dataset for vqa on document images

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.644320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.644320Z digest=sha256:79ff8957eaa34c33bd6b26f3e86c152a07fe7e2cb1b21d7ea2dfb8ad191d04ca

Observation 4f3c7a72-0495-4bdf-afb0-e3fe0c9012e2 · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.725132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.725132Z digest=sha256:9a4d79649ca04c91ead74fb785aaa25d126ff6b1c70f1e9fd4795afe03c89500

Observation b86261a5-d535-4b67-8687-e413764752df · outbound

This paper cites Compositional chain-of- thought prompting for large multimodal models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Compositional chain-of- thought prompting for large multimodal models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.822522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.822522Z digest=sha256:0f09d456049e838d480d35eae2e998bdd650cc91f0771bfdfc8077170f1a1068

Observation dbb7009c-7257-47ba-be1d-361a20955a47 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:04.718264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:57.868180Z digest=sha256:cfbf8016d951089009d264bfa65d667928ac407a4b59153218d675449871cbf2

Observation dac4ad05-d0cb-452e-bdb1-f1a565175c4b · outbound

This paper cites Hello gpt-4o, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Hello gpt-4o, 2024

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.924849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.924849Z digest=sha256:401f9d954deba238585147d13933a77caae691c7eea464df55628316881ff1fe

Observation 04e6aa37-0a21-4794-8eb5-27865046cde5 · outbound

This paper cites Instruction Tuning with GPT-4.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Instruction Tuning with GPT-4

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.990838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.990838Z digest=sha256:d1249c56134652a268fc98f037ae759fc3ab2abf3c2f905d309688e49b69cf00

Observation 50002ef9-0b0e-4598-af83-00b8b7afc9d4 · outbound

This paper cites Mobile Edge Intelligence for Large Language Models: A Contemporary Survey.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mobile Edge Intelligence for Large Language Models: A Contemporary Survey

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.028138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.028138Z digest=sha256:e2a27eac9ff57460fc496deb2f735d0d241342f678764af8660f7e2fc2715c31

Observation d074ebb3-c178-4196-b9c9-61f8004e1eb0 · outbound

This paper cites Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.078291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.078291Z digest=sha256:1fdc54126cf10b0a1a7c9e9a4539eee4f6f908d5d9d1ff2923dcf1cce52ac081

Observation 9a12de7c-4924-45b9-b901-ff5cb5d3ef5d · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.138206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.138206Z digest=sha256:ca799487b4826943e38edaa76d05e69a3c867b00fa349dd0957cc70041966be8

Observation 18abe2f2-7f3f-48fc-95ca-2e44e8f2f866 · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.198624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.198624Z digest=sha256:db220533ec6884c464661ada8d6d3e19089d200d28311c53cf8b6a05cfe9c5b4

Observation 9a773f1b-c1ba-466a-a934-a74df1015fdf · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.258329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.258329Z digest=sha256:d815239f4ce9483303494e0bf3b02e243b025174803368b98ab109550d697400

Observation 5e53cef5-87e9-4f3a-b8a2-c1cf457f4df8 · outbound

This paper cites Upop: Unified and progressive pruning for compressing vision-language transformers.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Upop: Unified and progressive pruning for compressing vision-language transformers

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.561921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:58.303405Z digest=sha256:48153be033179bcd1770ab7bdaec7874ff68cfb79ee37dc1a15d1263e1fee2a7

Observation 26cfacdb-d057-4e52-8e20-eef8b834fcab · outbound

This paper cites Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.387685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.387685Z digest=sha256:62aa7a380140a35c1d302c63fe259ebc96dbf93e5aa1e5e4a49111e7207f6aba

Observation 7e2efef3-76db-421b-8e71-933985bf32fa · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.427122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.427122Z digest=sha256:ba2635a9b50a215c230a2e63549b420372a486f1a7113cc1f82bca4da06a3c2e

Observation d632d097-2b37-42ef-8975-816d603e72e1 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.489578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.489578Z digest=sha256:7267bc261a26aefad7e5096ca24acc5117e2f26c0a87611478ad182b4c4b9e6d

Observation 698c338b-2676-4e7d-8a5f-c50531bf238b · outbound

This paper cites LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.579049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.579049Z digest=sha256:9e45c4a5e2087db11417cebf520075483fa71ff78477c773c319fe760aa1977a

Observation 46013f82-98a1-4d69-bd3e-55189183af7f · outbound

This paper cites Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.643728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.643728Z digest=sha256:5a5b0ba22406dd139d7d0d217707dc5fbb86e67600da6f2a5299fbcd654e5baf

Observation d7fd3475-6b15-457f-8f06-21c8551e55b0 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.707722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.707722Z digest=sha256:fa986ce762097402ef17c18070e977782c8285715c887b416ba30e81d3bdc090

Observation ed7f98f9-3856-4acb-990e-a88a47331b96 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning CogVLM: Visual Expert for Pretrained Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.784485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.784485Z digest=sha256:d8919aeec7dcf1a7da42d2dce2b9e9072b9a43961e4de9177af7d398aacdca71

Observation d8ec72ae-ae33-432a-a719-abac1b198ee4 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models, 2023.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models, 2023

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.848223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.848223Z digest=sha256:b07c2f79b59c94b2f61ea1f2f93001425bd540883168e455a317ff5f2ce307f7

Observation db00efe8-f24b-4e2d-8365-d6b9b9651e0a · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.909406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.909406Z digest=sha256:4d078451bf079ec71b09990f8ecda5b21049f970c6329f7f0634db1a04b1e2e3

Observation 00402166-99a3-4c38-b206-feb971afe9d9 · outbound

This paper cites Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.959189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.959189Z digest=sha256:c8fd275c6e3d806cc0ad1faec6a9394a2eae2f087dc550347a59ca382cfd52fe

Observation 4c5f3fec-36e2-407a-b268-45f443a9ed73 · outbound

This paper cites MMSearch-R1: Incentivizing LMMs to Search.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MMSearch-R1: Incentivizing LMMs to Search

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.034226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.034226Z digest=sha256:34f6dcde0b3aaf6341d2af16d2f665a4f25674cc3a86885e9ac727697ce9216f

Observation 2a6c133e-1395-4ee8-8969-a7ce9812f5d7 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:04.403753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:59.127978Z digest=sha256:6acc9283a295d3713d9f2f06b27e43d206425ce08df8a0191ddac12c5ad43942

Observation 1aed168d-ca7f-4465-8be2-0de1239bd892 · outbound

This paper cites Grok-1.5 vision preview.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Grok-1.5 vision preview

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.225345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:59.253541Z digest=sha256:b392ad4732421a986c9eda66e4a99267d56bf4692439b177bdae6c89cf393bff

Observation 124dff46-9e7c-425b-9b9f-779072c4e2ef · outbound

This paper cites Lillicrap, Kenji Kawaguchi, and Michael Shieh.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lillicrap, Kenji Kawaguchi, and Michael Shieh

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.353607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.353607Z digest=sha256:11b5a185210b18ebb877d6d5c329f00ac5cf14805e3d465d7b1412cdd581d98d

Observation 7818043c-e0e1-4932-ac46-9f1dfc5fffcf · outbound

This paper cites PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.440141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.440141Z digest=sha256:1db6c10701c8d0c81cc4a04adbb7cb7544d86284d4932a56ba91447faaba03b5

Observation 6cc8635c-249d-4614-a294-0db998297d3f · outbound

This paper cites Llava-o1: Let vision language models reason step-by-step.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-o1: Let vision language models reason step-by-step

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.033878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:59.511167Z digest=sha256:48c16e012749705214001e30c2c47535b14e1310c161d442bf33ada550a847e9

Observation 1317a9f8-a4e1-4b3b-a61b-b6642aea8c2f · outbound

This paper cites Qwen2.5 Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5 Technical Report

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.593100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.593100Z digest=sha256:bf63df8e4294914b2df36ee1ed6313927632f917902ee68e093c33cc37c9867b

Observation c739e576-e451-49be-9b6f-865b7ee079c8 · outbound

This paper cites Visionzip: Longer is better but not necessary in vision language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visionzip: Longer is better but not necessary in vision language models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.681440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.681440Z digest=sha256:03e809e85b0f0a7afb0ada79eadf5161eb7505625196252cadbceb0e11c9d6b2

Observation 2d1dd959-0b45-452e-b3bb-8f28fb0625bc · outbound

This paper cites LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.762003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.762003Z digest=sha256:2c62d28f7e3c0b9d806ccc9b795348f8e14bde2af5d24ca5b70a55f0302a5cb5

Observation 6526a65c-7687-4b8c-a824-684863e2301c · outbound

This paper cites LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.844125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.844125Z digest=sha256:0999d9985dcb5b9e352512eb03208aaf7fecbdaa98c7376e3413ada3d06e8743

Observation bfc05a37-56a0-44f3-8078-ffee2b80e882 · outbound

This paper cites Unified language-driven zero-shot domain adaptation.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unified language-driven zero-shot domain adaptation

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.877874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:33:59.929682Z digest=sha256:234313b8193c9b037bb880017134414348b14b0b1dd4aaed3a20431c26dc3d46

Observation 762ee269-420c-4337-8c24-a5637ac4898b · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.063593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.063593Z digest=sha256:61ab824fb6290256dfc2b557632ab405bf8851db6c3d5e7fb08ea9c207443843

Observation 4a463d6b-3352-4a14-aa1c-214b488ba78f · outbound

This paper cites Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.236317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.236317Z digest=sha256:2e081c07fda2069115926aecb427485698555a8d420c163dc8a3d2e80b6de468

Observation bcda4650-79f0-4b1b-b557-dd424ea46021 · outbound

This paper cites Tree of thoughts: Deliberate problem solving with large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Tree of thoughts: Deliberate problem solving with large language models

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.302368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.302368Z digest=sha256:30439514be21202e28eec091c1127eb902341042c54d23dd725cc2cb697366b3

Observation 90840c33-14ce-4c6b-81e5-f0780b1351e0 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.387393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.387393Z digest=sha256:9b81636ed01fff89d1c94ad0998b72de221b22cb5a0e8521274838a9f2b89569

Observation 9dee110b-579e-4210-a735-6351a73f62fe · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.472565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.472565Z digest=sha256:b84ff30343e00082e7dd9449d0a43b041bb478f849d3160c82b8741a4f49ae20

Observation a8b7a85d-446e-487c-a456-24ff8fd81c3c · outbound

This paper cites Mm-vet: Evaluating large multimodal models for integrated capabilities.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.729409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:34:00.538538Z digest=sha256:56bc27956ecbf7a9b6958a7dc8216a530ea907e433056c3996082292c34f3727

Observation 50efae99-8717-47a9-b628-0d10516eebfc · outbound

This paper cites Mm-vet: Evaluating large multimodal models for integrated capabilities.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.632100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.632100Z digest=sha256:d12c51b72e26646d9918833f6b2c55f933d56cf7728e28eed2cd7c3cf0308283

Observation 548b07ba-dfef-49f8-998f-a9f5e8cb8418 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.725182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.725182Z digest=sha256:8bd97fdf6c16cd854766f61847bc24d8622f7e6aac736a6627275c055f1b1a6d

Observation 94ef0cc7-fe5a-4dab-97df-7275881dcd82 · outbound

This paper cites LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.823567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.823567Z digest=sha256:f2134a96d10b18877e8068978755546b1de939f2c68ecee8aea07d5cf77931be

Observation 90b0d707-6c91-4c6c-9dd0-97998cf439d8 · outbound

This paper cites InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.909844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.909844Z digest=sha256:ed87d4e7cb5cf7801cab5b13c12a8a450e63b4cf17106624c8a98fb1eb0eba8a

Observation 459cbbc0-a507-46b2-a5cd-8681be28c480 · outbound

This paper cites Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.995997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.995997Z digest=sha256:df19ddbdabe1bf4d8214412df17acc64668ec8e838c8f6c4b1d39f30899dd844

Observation c5a75915-87ef-4dcb-b7eb-b693d5b72e9f · outbound

This paper cites Improve Vision Language Model Chain-of-thought Reasoning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improve Vision Language Model Chain-of-thought Reasoning

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.234969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.234969Z digest=sha256:054ebc0102821ef4c6df52bca4236bd5f1fa5af052ec09b111bbd2fc69ae1920

Observation c5d878cc-0c51-4125-9ef3-115bf8dd040d · outbound

This paper cites SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.354846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.354846Z digest=sha256:afc38f195982cab57d6caf09d2714f0cc41925a82e65e91e31b9ab874995089a

Observation e81e025c-e2ad-4830-a38a-db29bf9dfb49 · outbound

This paper cites Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.464550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.464550Z digest=sha256:d30fdc0bd7645fcaab08d8d01713bf67bd38f48a00ec7dcd48acd329b69c08b7

Observation 08f82fe7-f8c9-41b8-b55c-aede079122c6 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.579723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.579723Z digest=sha256:722232996f210625027e9622df1c195ca7f523083f9d6ce28de45f048831ca02

Observation f0fefdaf-7ede-4c55-89bc-0249bde07191 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 94

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:03.561959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:34:01.683979Z digest=sha256:a572b8af729c05ee0ccb0a09ab0850b7b5c62451771f06cb15e1419e439511d2

Observation 84399186-c08a-4387-8d5c-cfe50d713c5f · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 95

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:03.345800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:34:01.831065Z digest=sha256:309412278e60612a3ada1a9cc17d9dfb16675139d7821c8d147ab2e2fa646729

Observation 4c2d35a4-da57-4bf7-b17f-602c30b33f00 · outbound

This paper cites type": "function.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning type": "function

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.146767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T16:34:01.937707Z digest=sha256:79ab17589e22d2c8559a0020a4c7a75dd74285a87a4d786bf31e922b738575e1

Pith citing papers

Observation 8fecda78-1b5d-476b-9704-a0d4e552fa10 · inbound

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search cites this paper.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.594921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:6dee4f2f48d49bdd410b29f8a829941acac7fbed0085953c629407e6fec61c0e

Observation b9a0a6a5-466d-4361-bef5-7c82b50e13c7 · inbound

CPPO: Contrastive Perception Policy Optimization for VLM Agents cites this paper.

CPPO: Contrastive Perception Policy Optimization for VLM Agents VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T13:07:44.032336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T13:07:44.032336Z digest=sha256:fcafbaff9e5a57283a38356127cc95567c1e5f278964fe0dc96f858d81cf42a0

Observation cb48a970-db4c-4076-b231-3d3c34bde422 · inbound

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models cites this paper.

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-13T20:53:16.245320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-13T20:48:52.130130Z digest=sha256:ad0702cbd0a8018bcbb3bf68716baf608964f7a948fc5e78bf28546516bc5207

Observation 9ea7e297-4901-4d3d-8959-3dbf53117b4b · inbound

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward cites this paper.

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 80

Resolution
verified exact
arxiv_id, observed 2026-05-10T22:20:47.758290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-10T19:59:19.379119Z digest=sha256:f287054385355cbe5fa2af7c0e1d7043d35bcc22c6e573b33d8ec01dfc96c9e6

Observation f55e675c-9e83-4278-b74b-1bb613346095 · inbound

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization cites this paper.

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:45:50.083817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-10T18:20:02.559108Z digest=sha256:ab9426d32e3c231ea305b1d6e757af652aabfa0b64717ff3bc2426b291f1d2d9

Observation 29867f44-26e8-4580-a43f-2dd7d40e30a5 · inbound

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning cites this paper.

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:46:09.467557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-08T14:02:29.480442Z digest=sha256:e7b64ed75708342754187d377ce8d418ef3cfe328934ed504dcbcd24c648d8b7

Observation de9a2b32-ea13-4eed-906b-98b19e0948f3 · inbound

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models cites this paper.

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 216

Resolution
verified exact
arxiv_id, observed 2026-07-04T15:09:55.253992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-26T01:50:54.242508Z digest=sha256:40d9122ddaba21e9d0dc605a83c26227625a0ff00be182c4c957b3261562d3c5

Observation 7e02849c-b735-40ee-a42e-aa47d2031c0f · inbound

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning cites this paper.

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T17:05:51.428117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-29T04:09:32.397341Z digest=sha256:82c330efaa384fd0717919db0fbb10cfed2226df043fa5c0d53a77154aa032f9

Observation 835848df-0893-4a49-b43c-5fb2e4080dc5 · inbound

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning cites this paper.

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:15:45.227978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-07-01T05:36:43.609602Z digest=sha256:4fbd7e17d136b09b3cfd45793020e2c281257f7f38560141b20ded8613fb6436

Observation acfb3eed-9d37-47d4-9f02-b0800db2683c · inbound

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models cites this paper.

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:48:45.590719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:48:45.590719Z digest=sha256:52fe5e7241005277d2b0c7b1dc2419d9e48133c9614a6db6c368ee1327fd4bf0

Observation 246074eb-9658-4376-bc90-6260f8ec3191 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.850093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.850093Z digest=sha256:b0547f23f7436a1390295b8e5c59adfd6540ff789c3977a799558b7b2dec0ad2

Observation 5e606f51-b262-42b5-8073-9e895eb919f4 · inbound

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning cites this paper.

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T12:53:14.415257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T12:53:14.415257Z digest=sha256:02ad86e7031c6679f7f326b5f079afc5a357251b367393010c4bc6c42fda9555