Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:01.937707Z
Paper Citation Record · LEDGER
As of 13 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 12 inbound Pith citation observations for arXiv:2507.13348.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T16:34:01.937707Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-11T12:53:14.415257Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T15:09:55.252188Z
90 of 90 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation da95d1df-9518-4a8e-a71e-b870b6d4c67c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning GPT-4 Technical Report
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d95a751-ad97-4055-b8e0-c162006be85c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Claude 3.5 sonnet, 2024
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f1884637-c2db-4215-bda3-91804fcee012 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1b7adfda-4429-4ee8-8dc4-e9ecb974f46f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5-VL Technical Report
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 55e63009-bc8f-4cc5-ab82-e1a081868b4f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Graph of thoughts: Solving elaborate problems with large language models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ec44fc80-013c-4d1b-a646-dfbc958c68d7 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5d4cf5ad-8aba-4c2a-baa4-bfcb2d777283 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ShareGPT4V: Improving Large Multi-Modal Models with Better Captions
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ba782bfe-c4eb-4186-889d-ebdf45cb8148 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d71fb9da-0dbe-4b14-b3dc-0510552f3603 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5f9216d3-a8fb-434a-95c3-7893aea77b86 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy, 2024
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3c64ecb-a8fe-451d-a100-25e3c759d55f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1f66b485-f4fb-4722-afef-bb7155abd312 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d863578d-65b2-45c0-97cd-4460a77e271c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 743d4fb7-f580-48e8-be02-1fb52840f3c5 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2fc953bd-036c-4dcd-9c22-3bead0df8910 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dfe46faf-d796-4198-ac54-15d9c6346955 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ef28b65c-d973-4e8d-b63f-0bd2f1c293f9 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenAI o1 System Card
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0c2b952d-3b65-4f2e-ad7c-ad93db122eec · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Expedited Training of Visual Conditioned Language Generation via Redundancy Reduction
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 8b61d9c3-fad0-46e3-973d-6624242e8946 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49f78ed6-e73d-420c-bf21-17a1b8c6002c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OpenVLA: An Open-Source Vision-Language-Action Model
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7b35b5cd-9fde-4b65-8634-28f024b0f4c2 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gonzalez, Hao Zhang, and Ion Stoica
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 781612d5-9bc4-4af2-812d-dee76c2e90ef · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA: Reasoning Segmentation via Large Language Model
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ea45fec3-8ef2-4a24-ba64-0758dad17eaf · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Step-dpo: Step-wise preference optimization for long-chain reasoning of llms, 2024
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a6ffabb-92c8-44a2-8c91-e1ba8a5e6622 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaVA-OneVision: Easy Visual Task Transfer
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d20b9ee4-5029-447d-bb24-61ac7af57067 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Logits-Based Finetuning
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 74632ecc-34ae-41dd-a6bc-b48e83a7a78e · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb65240d-bf0e-449f-b50c-2607018e3afc · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8fe7027b-76b2-4af2-aa25-012a059d5481 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Evaluating Object Hallucination in Large Vision-Language Models
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a722a3b3-9118-4761-8350-f957bdd06929 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improved Baselines with Visual Instruction Tuning
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a89c9bfe-08bd-436d-8ecf-b1be72ebeb6f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-next: Improved reasoning, ocr, and world knowledge, January 2024
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 38382b80-ab54-4621-b467-a189d88b6472 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual instruction tuning.Advances in neural information processing systems, 2024
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c3e0b10e-500c-40ed-9d4b-64a657555ab4 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 63493399-6b72-4a1e-9e33-15c4ee441e79 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6c022fdd-2e6f-4693-bd7a-ea92cd5f7d33 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bc3223df-08c8-42a8-98e3-0e0b2ce1e0ea · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ada00429-bdb6-4b68-a957-2b0fe26b9906 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts
Reference 40
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation cf724eff-60da-4cd5-9d17-31b711af7b41 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b5bac22-0585-49b9-8249-3a315b9070c3 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Reft: Reasoning with reinforced fine-tuning, 2024
Reference 42
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 190fc5b8-08ca-4758-8fb9-05c4c89a1ead · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b8ed46d8-0a0c-4c68-88cf-a64d0a16d8cf · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Docvqa: A dataset for vqa on document images
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4f3c7a72-0495-4bdf-afb0-e3fe0c9012e2 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b86261a5-d535-4b67-8687-e413764752df · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Compositional chain-of- thought prompting for large multimodal models
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dbb7009c-7257-47ba-be1d-361a20955a47 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation dac4ad05-d0cb-452e-bdb1-f1a565175c4b · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Hello gpt-4o, 2024
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 04e6aa37-0a21-4794-8eb5-27865046cde5 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Instruction Tuning with GPT-4
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 50002ef9-0b0e-4598-af83-00b8b7afc9d4 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mobile Edge Intelligence for Large Language Models: A Contemporary Survey
Reference 50
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d074ebb3-c178-4196-b9c9-61f8004e1eb0 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Does Your Vision-Language Model Get Lost in the Long Video Sampling Dilemma?
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a12de7c-4924-45b9-b901-ff5cb5d3ef5d · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18abe2f2-7f3f-48fc-95ca-2e44e8f2f866 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a773f1b-c1ba-466a-a934-a74df1015fdf · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning HybridFlow: A Flexible and Efficient RLHF Framework
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5e53cef5-87e9-4f3a-b8a2-c1cf457f4df8 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Upop: Unified and progressive pruning for compressing vision-language transformers
Reference 55
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 26cfacdb-d057-4e52-8e20-eef8b834fcab · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e2efef3-76db-421b-8e71-933985bf32fa · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d632d097-2b37-42ef-8975-816d603e72e1 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 698c338b-2676-4e7d-8a5f-c50531bf238b · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs
Reference 59
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 46013f82-98a1-4d69-bd3e-55189183af7f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7fd3475-6b15-457f-8f06-21c8551e55b0 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LLaMA: Open and Efficient Foundation Language Models
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ed7f98f9-3856-4acb-990e-a88a47331b96 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning CogVLM: Visual Expert for Pretrained Language Models
Reference 62
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d8ec72ae-ae33-432a-a719-abac1b198ee4 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models, 2023
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation db00efe8-f24b-4e2d-8365-d6b9b9651e0a · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models
Reference 64
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 00402166-99a3-4c38-b206-feb971afe9d9 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4c5f3fec-36e2-407a-b268-45f443a9ed73 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MMSearch-R1: Incentivizing LMMs to Search
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2a6c133e-1395-4ee8-8969-a7ce9812f5d7 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 67
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 1aed168d-ca7f-4465-8be2-0de1239bd892 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Grok-1.5 vision preview
Reference 68
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 124dff46-9e7c-425b-9b9f-779072c4e2ef · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lillicrap, Kenji Kawaguchi, and Michael Shieh
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7818043c-e0e1-4932-ac46-9f1dfc5fffcf · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
Reference 70
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6cc8635c-249d-4614-a294-0db998297d3f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Llava-o1: Let vision language models reason step-by-step
Reference 71
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 1317a9f8-a4e1-4b3b-a61b-b6642aea8c2f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Qwen2.5 Technical Report
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c739e576-e451-49be-9b6f-865b7ee079c8 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Visionzip: Longer is better but not necessary in vision language models
Reference 73
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d1dd959-0b45-452e-b3bb-8f28fb0625bc · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding
Reference 74
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6526a65c-7687-4b8c-a824-684863e2301c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bfc05a37-56a0-44f3-8078-ffee2b80e882 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unified language-driven zero-shot domain adaptation
Reference 76
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 762ee269-420c-4337-8c24-a5637ac4898b · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
Reference 77
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a463d6b-3352-4a14-aa1c-214b488ba78f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
Reference 79
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bcda4650-79f0-4b1b-b557-dd424ea46021 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Tree of thoughts: Deliberate problem solving with large language models
Reference 80
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 90840c33-14ce-4c6b-81e5-f0780b1351e0 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniCPM-V: A GPT-4V Level MLLM on Your Phone
Reference 81
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9dee110b-579e-4210-a735-6351a73f62fe · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a8b7a85d-446e-487c-a456-24ff8fd81c3c · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities
Reference 83
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 50efae99-8717-47a9-b628-0d10516eebfc · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mm-vet: Evaluating large multimodal models for integrated capabilities
Reference 84
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 548b07ba-dfef-49f8-998f-a9f5e8cb8418 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi
Reference 85
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 94ef0cc7-fe5a-4dab-97df-7275881dcd82 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
Reference 86
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 90b0d707-6c91-4c6c-9dd0-97998cf439d8 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
Reference 87
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 459cbbc0-a507-46b2-a5cd-8681be28c480 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186
Reference 88
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c5a75915-87ef-4dcb-b7eb-b693d5b72e9f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Improve Vision Language Model Chain-of-thought Reasoning
Reference 90
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c5d878cc-0c51-4125-9ef3-115bf8dd040d · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
Reference 91
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e81e025c-e2ad-4830-a38a-db29bf9dfb49 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
Reference 92
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 08f82fe7-f8c9-41b8-b55c-aede079122c6 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models
Reference 93
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f0fefdaf-7ede-4c55-89bc-0249bde07191 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 94
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 84399186-c08a-4387-8d5c-cfe50d713c5f · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning Unresolved cited work
Reference 95
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 4c2d35a4-da57-4bf7-b17f-602c30b33f00 · outbound
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning type": "function
Reference 96
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 8fecda78-1b5d-476b-9704-a0d4e552fa10 · inbound
Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 43
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation b9a0a6a5-466d-4361-bef5-7c82b50e13c7 · inbound
CPPO: Contrastive Perception Policy Optimization for VLM Agents VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 32
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cb48a970-db4c-4076-b231-3d3c34bde422 · inbound
Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 9ea7e297-4901-4d3d-8959-3dbf53117b4b · inbound
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 80
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation f55e675c-9e83-4278-b74b-1bb613346095 · inbound
Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 65
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 29867f44-26e8-4580-a43f-2dd7d40e30a5 · inbound
Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation de9a2b32-ea13-4eed-906b-98b19e0948f3 · inbound
From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 216
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 7e02849c-b735-40ee-a42e-aa47d2031c0f · inbound
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 59
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation 835848df-0893-4a49-b43c-5fb2e4080dc5 · inbound
Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.
Observation acfb3eed-9d37-47d4-9f02-b0800db2683c · inbound
HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 246074eb-9658-4376-bc90-6260f8ec3191 · inbound
SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5e606f51-b262-42b5-8073-9e895eb919f4 · inbound
Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
Reference 85
Source-reported events for the cited work
Unavailable: canonical work link unavailable.