Pith. sign in

Paper Citation Record · LEDGER

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

As of 13 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 12 inbound Pith citation observations for arXiv:2507.13348.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.13348 v1

Coverage vector

measured 90 of 90 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:01.937707Z

measured 102 of 102 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T12:53:14.415257Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T15:09:55.252188Z

Reference resolution

90 of 90 outbound references displayed

  • verified exact2
  • verified fuzzy8
  • unresolved80
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation da95d1df-9518-4a8e-a71e-b870b6d4c67c · outbound

This paper cites GPT-4 Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.746930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.746930Z digest=sha256:ed21058930eadbbcc90c0ba4abee74bd331ece9d33d9eb10e279e3581f17aa9d

Observation 2d95a751-ad97-4055-b8e0-c162006be85c · outbound

This paper cites Claude 3.5 sonnet, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Claude 3.5 sonnet, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.751678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.751678Z digest=sha256:87ae5cb8b506789d74ef430ec34a57ab50f15653906e61e8be8be45bdfe647c4

Observation f1884637-c2db-4215-bda3-91804fcee012 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.759782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.759782Z digest=sha256:fbbb842645e85d4b0b0eb2d9655783caa59269957e5d6ec8cc738ec77f1cc948

Observation 1b7adfda-4429-4ee8-8dc4-e9ecb974f46f · outbound

This paper cites Qwen2.5-VL Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5-VL Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.767649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.767649Z digest=sha256:cfd823d68dd309b9b1780a151d87de259eb33e71be2705b6ebd69f3edd447907

Observation 55e63009-bc8f-4cc5-ab82-e1a081868b4f · outbound

This paper cites Graph of thoughts: Solving elaborate problems with large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Graph of thoughts: Solving elaborate problems with large language models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.771438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.771438Z digest=sha256:fbe1f3470db5f500a91adb34590f5c1d7390a18394d3f35658579de39176105d

Observation ec44fc80-013c-4d1b-a646-dfbc958c68d7 · outbound

This paper cites An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.775183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.775183Z digest=sha256:698c9c4c33a438b25e0a30662ee8fc0513ba41c98776ebf207b7347db7f6bed6

Observation 5d4cf5ad-8aba-4c2a-baa4-bfcb2d777283 · outbound

This paper cites ShareGPT4V: Improving Large Multi-Modal Models with Better Captions.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ShareGPT4V: Improving Large Multi-Modal Models with Better Captions

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.778875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.778875Z digest=sha256:2f666d50979f2797eef02e69e268d2dbfc673c3c600db00d4668cc2a7691861e

Observation ba782bfe-c4eb-4186-889d-ebdf45cb8148 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.782852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.782852Z digest=sha256:fe426e438444f960b1cceb35d106ab0019a0c357bdaaf425cd8d93f4b22667fa

Observation d71fb9da-0dbe-4b14-b3dc-0510552f3603 · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.786502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.786502Z digest=sha256:53762f5e97e35b7e58f30c4e9db21e863c0c8b77138f8633be8475953a69ee28

Observation 5f9216d3-a8fb-434a-95c3-7893aea77b86 · outbound

This paper cites Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.790426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.790426Z digest=sha256:78b4bdcb68701c07c13fe62d9ad75613310747a448cc4bcf58ae17fc17d95706

Observation e3c64ecb-a8fe-451d-a100-25e3c759d55f · outbound

This paper cites Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.793697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.793697Z digest=sha256:630dd7ea6d12ad25b4257e598db4ed98a090c1ad4330dc23ed7300d19b2b96b5

Observation 1f66b485-f4fb-4722-afef-bb7155abd312 · outbound

This paper cites Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.797064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.797064Z digest=sha256:d2ddf952fc989000a088b3b111d101f4ecaea20e0c4e0e9768361afdfa66e563

Observation d863578d-65b2-45c0-97cd-4460a77e271c · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.800543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.800543Z digest=sha256:2536c8455241fe1c92f6eb06a5516e5c61a0432c842d9511a87886fc9a695517

Observation 743d4fb7-f580-48e8-be02-1fb52840f3c5 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.807485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.807485Z digest=sha256:edc36a8b48357428e66aa36c4f7fdfd7a662f2f5e0bc2e817bd56b883d8403bc

Observation 2fc953bd-036c-4dcd-9c22-3bead0df8910 · outbound

This paper cites ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.811210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.811210Z digest=sha256:4336de05b75d91c851f2926e3672e0c432bab05728fafdec5ae424e194a3c8dd

Observation dfe46faf-d796-4198-ac54-15d9c6346955 · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.818801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.818801Z digest=sha256:20f7e258e724c428229356c3075d3625c507db3a0d2eb1f6750ae6b8cddd7975

Observation ef28b65c-d973-4e8d-b63f-0bd2f1c293f9 · outbound

This paper cites OpenAI o1 System Card.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenAI o1 System Card

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.825316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.825316Z digest=sha256:855d4cace4455f130c965896fb226894d27a82623e4d023c372c8ab1dff111ae

Observation 0c2b952d-3b65-4f2e-ad7c-ad93db122eec · outbound

This paper cites Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:02.915215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:56.835798Z digest=sha256:f30751a5a25234c7fd7c05b93e01c29bda43957ee600e2dc901c2784b9f6abcd

Observation 8b61d9c3-fad0-46e3-973d-6624242e8946 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.851016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.851016Z digest=sha256:18d6e12561c3d9ec4e831e49805c47555ba812b8133b483188ebdc1aefb1aeda

Observation 49f78ed6-e73d-420c-bf21-17a1b8c6002c · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenVLA: An Open-Source Vision-Language-Action Model

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.867525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.867525Z digest=sha256:e39e37f5263245fc4afedd5acefb5957a840b7fb26a0a4e209414c2f0d8e49fe

Observation 7b35b5cd-9fde-4b65-8634-28f024b0f4c2 · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gonzalez, Hao Zhang, and Ion Stoica

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.888627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.888627Z digest=sha256:70348702767610d42b2188c6483ba9a064b6d7f244543e9d83c29b75e5d212af

Observation 781612d5-9bc4-4af2-812d-dee76c2e90ef · outbound

This paper cites LISA: Reasoning Segmentation via Large Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA: Reasoning Segmentation via Large Language Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.916800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.916800Z digest=sha256:108b97580be03b273699527a5db76973cf52e8ab913e8c46ffa5469930788c2a

Observation ea45fec3-8ef2-4a24-ba64-0758dad17eaf · outbound

This paper cites Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.951119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.951119Z digest=sha256:50498d5383b820dd39e6110f15707154da21af6b433d4caf95b670c231178ef2

Observation 9a6ffabb-92c8-44a2-8c91-e1ba8a5e6622 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaVA-OneVision: Easy Visual Task Transfer

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:56.974839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:56.974839Z digest=sha256:08c73a855289c45ddf8471eb005c4a39a13d45d2fab27232c5900f57bbb92a0e

Observation d20b9ee4-5029-447d-bb24-61ac7af57067 · outbound

This paper cites Logits-Based Finetuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Logits-Based Finetuning

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-06T16:34:02.719238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:56.991972Z digest=sha256:4e5876015d75c6e774a4df26cffa7b37032ba200dbe6750681354cebd156f327

Observation 74632ecc-34ae-41dd-a6bc-b48e83a7a78e · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.019527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.019527Z digest=sha256:c9991237cb55430213983efa09d9a568dbdac4cbd638671a69b4ca4425674ab8

Observation bb65240d-bf0e-449f-b50c-2607018e3afc · outbound

This paper cites Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.049334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.049334Z digest=sha256:6ce9953900ab2faf9d6bd4565f9d07e8742e620896624e7f51335481256d0789

Observation 8fe7027b-76b2-4af2-aa25-012a059d5481 · outbound

This paper cites Evaluating Object Hallucination in Large Vision-Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Evaluating Object Hallucination in Large Vision-Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.065129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.065129Z digest=sha256:021c21082d4d9964785ee4f053848db4f953994019fa9cf7d8321ab3f443d838

Observation a722a3b3-9118-4761-8350-f957bdd06929 · outbound

This paper cites Improved Baselines with Visual Instruction Tuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improved Baselines with Visual Instruction Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.074808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.074808Z digest=sha256:9f2705aea662a5e303ce257a85a4b3011a3f3682e47543776a7817462de67be4

Observation a89c9bfe-08bd-436d-8ecf-b1be72ebeb6f · outbound

This paper cites Llava-next: Improved reasoning, ocr, and world knowledge, January 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-next: Improved reasoning, ocr, and world knowledge, January 2024

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.086274Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.086274Z digest=sha256:09bca237c6dc63919b4b31dfc9246c0c0277391b4b7f5459c003ea92239e171c

Observation 38382b80-ab54-4621-b467-a189d88b6472 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual instruction tuning.Advances in neural information processing systems, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.093223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.093223Z digest=sha256:4202644e9177f35f9bb5bcb64515c62421cd6712c819db56de9924551f6cf428

Observation c3e0b10e-500c-40ed-9d4b-64a657555ab4 · outbound

This paper cites RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.134511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.134511Z digest=sha256:0576ed923f96a624d1c428a8a29cac163fd91bb809ccc15de9515bf375664cd2

Observation 63493399-6b72-4a1e-9e33-15c4ee441e79 · outbound

This paper cites OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.223241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.223241Z digest=sha256:25cf9f96dd558c7e6014c1c33936702d8e137b5c8d0465ae67a79e90d3943fa7

Observation 6c022fdd-2e6f-4693-bd7a-ea92cd5f7d33 · outbound

This paper cites Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.253690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.253690Z digest=sha256:aa4b8a91a539316ab2156ea342257ab7948ddb21ee02334b5b6a8c62827594cd

Observation bc3223df-08c8-42a8-98e3-0e0b2ce1e0ea · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.308765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.308765Z digest=sha256:563291225c8a9cea5945225962e4511b53d1779f6d79f857ae7cb623eacc2e6e

Observation ada00429-bdb6-4b68-a957-2b0fe26b9906 · outbound

This paper cites Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:05.063403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:57.384004Z digest=sha256:86ef2fa64635948ec0fc8ccf7c9d0381c670758cee138b03fd64056ed7db6eeb

Observation cf724eff-60da-4cd5-9d17-31b711af7b41 · outbound

This paper cites TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.441181Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.441181Z digest=sha256:d531405ffe705d9af0094160b8650b30577e3d6eb5abdedf36f8f93bbebf2b0c

Observation 6b5bac22-0585-49b9-8249-3a315b9070c3 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Reft: Reasoning with reinforced fine-tuning, 2024

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.909715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:57.524682Z digest=sha256:75d5eeb128e4f0a712a036b4fe8b8e4e9e5aece02561614d3a9f3b710b3c27df

Observation 190fc5b8-08ca-4758-8fb9-05c4c89a1ead · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.577590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.577590Z digest=sha256:732847858fd5dca31a578d57937588b71dd74df8d3c6ab7c0a7a3ba0fd7b86d5

Observation b8ed46d8-0a0c-4c68-88cf-a64d0a16d8cf · outbound

This paper cites Docvqa: A dataset for vqa on document images.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Docvqa: A dataset for vqa on document images

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.644320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.644320Z digest=sha256:744e6db59129c6be0c6e9d435c91957b53294618ea779c14f7d5a3844086d78c

Observation 4f3c7a72-0495-4bdf-afb0-e3fe0c9012e2 · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.725132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.725132Z digest=sha256:d45b7fe8fe910233874b3073596770f284c929a8563c748476ac9779023b9395

Observation b86261a5-d535-4b67-8687-e413764752df · outbound

This paper cites Compositional chain-of- thought prompting for large multimodal models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Compositional chain-of- thought prompting for large multimodal models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.822522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.822522Z digest=sha256:a50b01495d4abc25be8426cbf9e3d4e3f50d4cab8f3fe3fc29a595ed91d57cd3

Observation dbb7009c-7257-47ba-be1d-361a20955a47 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:04.718264Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:57.868180Z digest=sha256:2b59f189be7b30bb33e29ab1cdc709de318330c348f16a5752ed668709be2995

Observation dac4ad05-d0cb-452e-bdb1-f1a565175c4b · outbound

This paper cites Hello gpt-4o, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Hello gpt-4o, 2024

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.924849Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.924849Z digest=sha256:09d41045702bd681486d9f315407fe615822ab45d7f0a376c13b16bbe8bf55b8

Observation 04e6aa37-0a21-4794-8eb5-27865046cde5 · outbound

This paper cites Instruction Tuning with GPT-4.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Instruction Tuning with GPT-4

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:57.990838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:57.990838Z digest=sha256:578ff72ca74346c389f2068e5973432ccee7afcdc7e0ee6885c894840a7576f5

Observation 50002ef9-0b0e-4598-af83-00b8b7afc9d4 · outbound

This paper cites Mobile Edge Intelligence for Large Language Models: A Contemporary Survey.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mobile Edge Intelligence for Large Language Models: A Contemporary Survey

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.028138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.028138Z digest=sha256:8b7d16e3b376d29776a7aa655e4184d1d30dbe64f5fb2e044aeee86c73e4516e

Observation d074ebb3-c178-4196-b9c9-61f8004e1eb0 · outbound

This paper cites Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.078291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.078291Z digest=sha256:28b73c1c117cbea5e04c20572cb1fdb7d45a923fad54e865d380fc4553ee952a

Observation 9a12de7c-4924-45b9-b901-ff5cb5d3ef5d · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.138206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.138206Z digest=sha256:2274d98264c0f2db9b83ec0c6072b268c712abceb1bfbcc7581364ec01ac8bbd

Observation 18abe2f2-7f3f-48fc-95ca-2e44e8f2f866 · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.198624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.198624Z digest=sha256:5ec6688ab790210899764c3e2edcf31b0867098a2aba42b28d381646c1e3716f

Observation 9a773f1b-c1ba-466a-a934-a74df1015fdf · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.258329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.258329Z digest=sha256:6e140b785595625a611e77dc290e17e9f0bb1a87470009cf3b9c21d24a824702

Observation 5e53cef5-87e9-4f3a-b8a2-c1cf457f4df8 · outbound

This paper cites Upop: Unified and progressive pruning for compressing vision-language transformers.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Upop: Unified and progressive pruning for compressing vision-language transformers

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.561921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:58.303405Z digest=sha256:c5b2267304b54df280354f67de69c0a4d128af942524dea6626021a58b5fe849

Observation 26cfacdb-d057-4e52-8e20-eef8b834fcab · outbound

This paper cites Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.387685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.387685Z digest=sha256:527cab729c8b53daacda774975b7e552d5934ae112e7bf5182fa9b4c793aca0a

Observation 7e2efef3-76db-421b-8e71-933985bf32fa · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.427122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.427122Z digest=sha256:9f4efa6f1d39cc54f87387f4943667b1265fd3448adba64650b1eeafccfaa85f

Observation d632d097-2b37-42ef-8975-816d603e72e1 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.489578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.489578Z digest=sha256:6ff028948614d7df0fa0534d51b49bd02a0ecc06b9a84460431b69bb64b592d7

Observation 698c338b-2676-4e7d-8a5f-c50531bf238b · outbound

This paper cites LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.579049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.579049Z digest=sha256:92865591ace8e35a7e35dfa9dcb4f911d47c97d7177964ccca82efc9db726a74

Observation 46013f82-98a1-4d69-bd3e-55189183af7f · outbound

This paper cites Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.643728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.643728Z digest=sha256:9e411863b52933ff37210d7020c6d303f9ce7c3fc73c1c2da29b5bab646fb82b

Observation d7fd3475-6b15-457f-8f06-21c8551e55b0 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.707722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.707722Z digest=sha256:2595b4f1bfe6a9381c493fdcd3db3f57b1d54bdbe531d0fee96a202b852c4757

Observation ed7f98f9-3856-4acb-990e-a88a47331b96 · outbound

This paper cites CogVLM: Visual Expert for Pretrained Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning CogVLM: Visual Expert for Pretrained Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.784485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.784485Z digest=sha256:cd51cabb36bdc47480db381ed106d4431620c9460a3317f4f18204b228fc7344

Observation d8ec72ae-ae33-432a-a719-abac1b198ee4 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models, 2023.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models, 2023

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.848223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.848223Z digest=sha256:b274e81a6c21812a82ac4055325934003d2a6de7ccb7b5e41dd5f258b93f58e0

Observation db00efe8-f24b-4e2d-8365-d6b9b9651e0a · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.909406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.909406Z digest=sha256:52eda20835a7be35abc64ab102301c742b3eb2a4daf2093c26984936d3d6f97d

Observation 00402166-99a3-4c38-b206-feb971afe9d9 · outbound

This paper cites Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:58.959189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:58.959189Z digest=sha256:6b010fa5127253cfdfeeeb949488aa9f6fa417b9675d494b14da076afd40802e

Observation 4c5f3fec-36e2-407a-b268-45f443a9ed73 · outbound

This paper cites MMSearch-R1: Incentivizing LMMs to Search.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MMSearch-R1: Incentivizing LMMs to Search

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.034226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.034226Z digest=sha256:effd124843f48698a5d1e662d5d634afcb91613cee019d25a2ba0ddadcd5e077

Observation 2a6c133e-1395-4ee8-8969-a7ce9812f5d7 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:04.403753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:59.127978Z digest=sha256:517c1425ef48f2978a20359e9d0d51ae97b5a045c0f0875eb8c21d25fe6cd424

Observation 1aed168d-ca7f-4465-8be2-0de1239bd892 · outbound

This paper cites Grok-1.5 vision preview.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Grok-1.5 vision preview

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.225345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:59.253541Z digest=sha256:1aa271326ae6b192ecad40644ca6dc4c1fb6dbd6b116740e633758e79fd66366

Observation 124dff46-9e7c-425b-9b9f-779072c4e2ef · outbound

This paper cites Lillicrap, Kenji Kawaguchi, and Michael Shieh.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lillicrap, Kenji Kawaguchi, and Michael Shieh

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.353607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.353607Z digest=sha256:d5cd84eb28a47792f988b4dad862025da9e4f9e9328681ffb0c82a680ad2eac8

Observation 7818043c-e0e1-4932-ac46-9f1dfc5fffcf · outbound

This paper cites PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.440141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.440141Z digest=sha256:df5d74d7443ff6409adfbfe026ce114b950db8a832c2dfe13b908a6a7ee6793a

Observation 6cc8635c-249d-4614-a294-0db998297d3f · outbound

This paper cites Llava-o1: Let vision language models reason step-by-step.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-o1: Let vision language models reason step-by-step

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:04.033878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:59.511167Z digest=sha256:0e0fe821ae8a6ee7f7df821fe55e3f7bb8d3018f9d466ca9b588a8ebdf464a8d

Observation 1317a9f8-a4e1-4b3b-a61b-b6642aea8c2f · outbound

This paper cites Qwen2.5 Technical Report.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5 Technical Report

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.593100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.593100Z digest=sha256:c7ff4b67840a3294366f8d8e196ea043935f268e977ed06aaa8933ab4728128c

Observation c739e576-e451-49be-9b6f-865b7ee079c8 · outbound

This paper cites Visionzip: Longer is better but not necessary in vision language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visionzip: Longer is better but not necessary in vision language models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.681440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.681440Z digest=sha256:be057425bfeb36023e90d1487fd2ae7a8bdc262d0b4d9099e7675c6dec4d294b

Observation 2d1dd959-0b45-452e-b3bb-8f28fb0625bc · outbound

This paper cites LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.762003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.762003Z digest=sha256:ac48d928a09b1717e2595ecf39f7695304fde11bebe0a2f0b5cf7a427721f120

Observation 6526a65c-7687-4b8c-a824-684863e2301c · outbound

This paper cites LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T16:33:59.844125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:33:59.844125Z digest=sha256:629b4ddcf7707144a44278a45794c1880b74eddc8f7563fc48a743ba60c84ae9

Observation bfc05a37-56a0-44f3-8078-ffee2b80e882 · outbound

This paper cites Unified language-driven zero-shot domain adaptation.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unified language-driven zero-shot domain adaptation

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.877874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:33:59.929682Z digest=sha256:f25ed4487be19c2e5239bf6d97291e07592607a2581819abae27dfaca6416bb9

Observation 762ee269-420c-4337-8c24-a5637ac4898b · outbound

This paper cites R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.063593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.063593Z digest=sha256:a76c4cb104283158f4e72e2af6d1847ffe7839f50a01a35dd611e4494104b90f

Observation 4a463d6b-3352-4a14-aa1c-214b488ba78f · outbound

This paper cites Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.236317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.236317Z digest=sha256:d5c1c01c9608e29f581443baa1f32b8e8eb06cbe2222b602d43255ae40ff3966

Observation bcda4650-79f0-4b1b-b557-dd424ea46021 · outbound

This paper cites Tree of thoughts: Deliberate problem solving with large language models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Tree of thoughts: Deliberate problem solving with large language models

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.302368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.302368Z digest=sha256:19095b6a4dfb77fdbe83613dd4344eca43abd4402aa4d012262db58f38761e79

Observation 90840c33-14ce-4c6b-81e5-f0780b1351e0 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.387393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.387393Z digest=sha256:96a32c9c1342ed0649c1e00784fd75d50824b9f421e9344925e3a775dabfaf99

Observation 9dee110b-579e-4210-a735-6351a73f62fe · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.472565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.472565Z digest=sha256:4a5e2a96771f207140acba69402e0a8edf89ca9373a988016ad334f23acc3955

Observation a8b7a85d-446e-487c-a456-24ff8fd81c3c · outbound

This paper cites Mm-vet: Evaluating large multimodal models for integrated capabilities.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.729409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:34:00.538538Z digest=sha256:0650b03d77005fe477ae18f1fa4d43c0e8822b3e2e1d3694bdcbd667af237d69

Observation 50efae99-8717-47a9-b628-0d10516eebfc · outbound

This paper cites Mm-vet: Evaluating large multimodal models for integrated capabilities.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.632100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.632100Z digest=sha256:74e239a1c070450436c774fdcebc9f09ae0230e673153c0f4f6f531069c5e3d5

Observation 548b07ba-dfef-49f8-998f-a9f5e8cb8418 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.725182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.725182Z digest=sha256:47c1bc3e28d5fa87287dbc3f42f1de2dc952b7c6ee6c0a601bfb096571745ae8

Observation 94ef0cc7-fe5a-4dab-97df-7275881dcd82 · outbound

This paper cites LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.823567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.823567Z digest=sha256:aa3205e75e92a0806992b7362dab4427eb7ae86f8bd4fef96c34086ccdd1a7c8

Observation 90b0d707-6c91-4c6c-9dd0-97998cf439d8 · outbound

This paper cites InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.909844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.909844Z digest=sha256:76c9637600de4ee3b5f9cd2484e51df2d3ac1886603d4a6f6bdddafcc299a674

Observation 459cbbc0-a507-46b2-a5cd-8681be28c480 · outbound

This paper cites Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:00.995997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:00.995997Z digest=sha256:8041c0f319e49b18558e2cd42ec1bcf8869f2b4ec0b8f9de0d2eb8e3b76d39a7

Observation c5a75915-87ef-4dcb-b7eb-b693d5b72e9f · outbound

This paper cites Improve Vision Language Model Chain-of-thought Reasoning.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improve Vision Language Model Chain-of-thought Reasoning

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.234969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.234969Z digest=sha256:2313567ae6c2b4c6de875c0a0a8071026d8fd7ca11e5591a3ba14e7936fc38ff

Observation c5d878cc-0c51-4125-9ef3-115bf8dd040d · outbound

This paper cites SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.354846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.354846Z digest=sha256:c49c20777765dfcc14d5393f6fc2468f7f88c33d3dda8189c20dcc480084270b

Observation e81e025c-e2ad-4830-a38a-db29bf9dfb49 · outbound

This paper cites Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.464550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.464550Z digest=sha256:b10889f45ab0a47073f1f8be86893273c5c70cb5b643ae235004519845c83f2c

Observation 08f82fe7-f8c9-41b8-b55c-aede079122c6 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:01.579723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:01.579723Z digest=sha256:abb9c31f43be796b70c9b79d073f3d8160946fdf508ca9d578ad9580d0b76db2

Observation f0fefdaf-7ede-4c55-89bc-0249bde07191 · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 94

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:03.561959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:34:01.683979Z digest=sha256:858fa490dba790ea192a68c14e461049143cd6c32f7c9c0376ef2b264fe78fe3

Observation 84399186-c08a-4387-8d5c-cfe50d713c5f · outbound

This paper cites an unresolved cited work.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work

Reference 95

Resolution
unresolved
raw_fallback, observed 2026-08-06T16:34:03.345800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:34:01.831065Z digest=sha256:e2f546b5d4fdb03e4eff2aab6ae52bede66ae26ce1f84dacb38c5d5e4efe768f

Observation 4c2d35a4-da57-4bf7-b17f-602c30b33f00 · outbound

This paper cites type": "function.

VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning type": "function

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T16:34:03.146767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T16:34:01.937707Z digest=sha256:e1d08d016c6d3701f90e64723d13317ad22caad0e9d24f5f67038706e4d3469a

Pith citing papers

Observation 8fecda78-1b5d-476b-9704-a0d4e552fa10 · inbound

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search cites this paper.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.594921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:80f11173334e5202d5a76e3b016ccccc67c0fa9c7ad1068716b4ac4cd3b5d2cb

Observation b9a0a6a5-466d-4361-bef5-7c82b50e13c7 · inbound

CPPO: Contrastive Perception Policy Optimization for VLM Agents cites this paper.

CPPO: Contrastive Perception Policy Optimization for VLM Agents VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T13:07:44.032336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T13:07:44.032336Z digest=sha256:d74ed0d509ab83e2c6f54111b96bc3bb26fb8a13eccfc81585feb05958c6866a

Observation cb48a970-db4c-4076-b231-3d3c34bde422 · inbound

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models cites this paper.

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-13T20:53:16.245320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-13T20:48:52.130130Z digest=sha256:2a0a96d770cfe4c77e6d617eaea9798cc2f5c753259c81e170fd4eab58cff39e

Observation 9ea7e297-4901-4d3d-8959-3dbf53117b4b · inbound

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward cites this paper.

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 80

Resolution
verified exact
arxiv_id, observed 2026-05-10T22:20:47.758290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T19:59:19.379119Z digest=sha256:3079a46e576084931f2c0c64b0a58ddfcd69ea7fea0acab657a3680fbb04a9ae

Observation f55e675c-9e83-4278-b74b-1bb613346095 · inbound

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization cites this paper.

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:45:50.083817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T18:20:02.559108Z digest=sha256:fe67cd89f4b17735d087e4441273c82ed7c7b78345ca51bec05ebf1f4b331bb1

Observation 29867f44-26e8-4580-a43f-2dd7d40e30a5 · inbound

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning cites this paper.

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T18:46:09.467557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-08T14:02:29.480442Z digest=sha256:702766594ec1866f80e81b586910e2583c97c4243091de05b82b657225c64e8e

Observation de9a2b32-ea13-4eed-906b-98b19e0948f3 · inbound

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models cites this paper.

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 216

Resolution
verified exact
arxiv_id, observed 2026-07-04T15:09:55.253992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-26T01:50:54.242508Z digest=sha256:090627ca505fd35796956fc8fef5ec71b9125c632b537510f9a3e01b02d79779

Observation 7e02849c-b735-40ee-a42e-aa47d2031c0f · inbound

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning cites this paper.

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T17:05:51.428117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T04:09:32.397341Z digest=sha256:2c412b450cc8c11e1c616a00c92c089df56462f0237937e89d520845cb3bd09a

Observation 835848df-0893-4a49-b43c-5fb2e4080dc5 · inbound

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning cites this paper.

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T10:15:45.227978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-07-01T05:36:43.609602Z digest=sha256:a3e3592e78e59a38eefbee6da78fd4a0bcc8024d70c9348b3f66a4cae69e0e2a

Observation acfb3eed-9d37-47d4-9f02-b0800db2683c · inbound

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models cites this paper.

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:48:45.590719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T14:48:45.590719Z digest=sha256:0f52e9fcbd36bc09994ae8bb5ae9e1153d3e36507b896edca3f71343f95f3d1e

Observation 246074eb-9658-4376-bc90-6260f8ec3191 · inbound

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models cites this paper.

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T16:41:28.850093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:41:28.850093Z digest=sha256:110f4bba1fe4e01d0c4b4c6b37310dd9c187215467b245f068391b9f8502e80d

Observation 5e606f51-b262-42b5-8073-9e895eb919f4 · inbound

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning cites this paper.

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-11T12:53:14.415257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T12:53:14.415257Z digest=sha256:30afcb7dbce3be776f98ada6b23cac4ae01a305a4f65cee81904a080475d004c