Pith. sign in

Paper Citation Record · LEDGER

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 54 inbound Pith citation observations for arXiv:2509.07969.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.07969 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-18T01:17:55.500268Z

measured 105 of 105 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 54 of 54 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T20:43:52.502221Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

51 of 51 outbound references displayed

  • verified exact30
  • verified fuzzy18
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch3

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 29292827-3db2-486f-aa57-27256a6f0abd · outbound

This paper cites End-to-end rl training for emerging agentic capabilities.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search End-to-end rl training for emerging agentic capabilities

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.753741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:4a3bc2bcac3ad65d0d03677451fd15664c676e970b3cce500fea710e1d6ccc2c

Observation 1177d351-b648-464e-8b66-dca5c42bcf72 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Flamingo: a visual language model for few-shot learning

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.700245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:09fe974fdbcdd95c28047cee84753bbff3de36e1e540001bf07e66cb841655a3

Observation 60926fe9-2b51-43da-99e7-d36ac3d0fe89 · outbound

This paper cites Claude 3.5 Sonnet.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Claude 3.5 Sonnet

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.703924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:c127cec018b1486e699b3775a0c72ca04cc628c5a6cf1d7aedd56907266a6961

Observation bd5801c3-3ef1-474f-8150-956278bee8b6 · outbound

This paper cites Qwen2.5-VL Technical Report.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Qwen2.5-VL Technical Report

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.635166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:d780103894ab65855a101a60c34c0c702247b1c07ff700b84fd187f01c8f7256

Observation f08f5064-e365-4021-ad23-68bb049e3198 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.711358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:1fd3ac2c2936753d202aa73ccaafd4c5f9228600f82deb408ba4cfed02f56f01

Observation 83194700-3e36-47b9-acfe-ce0ef2d310ab · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.640005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:7ead5de80ebec43c70b7153d78929bcae963ef1e437d723673b229618da224f7

Observation cf5555a3-91d0-472c-b320-e5c9e72f4d97 · outbound

This paper cites WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.644770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:354a24c7d3788d4d6e261db44b8fd8315c72aadc8e61c96b1a19f3b6e29b22bd

Observation 3e7641fd-4b35-4fd9-9032-e4e2dc37d958 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.649344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:2334ada161e15271dbf42d0c0aa5c163e2223dc603690aca565dc334470a54e9

Observation 954219df-594d-4f8e-8c2b-76552bcc5654 · outbound

This paper cites Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.726090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:2fb81bf97bf3eecde24cf711e596ffaaa8d8af3065bd67812213d35d478ded53

Observation 9937cf10-b2ee-499c-97ed-6b226d3e1a4c · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 10

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T01:17:55.653750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:dd30fd677922eb5d512f0d6f4d7e246f047dfea89e671ab995adb8a3ecb20c43

Observation 99990f56-d569-45b9-a0b4-c0c7fb008588 · outbound

This paper cites Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.658502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:9caeaa32deb53ec0283048013b753f3f96502e9cb45e192678412b1594206bb7

Observation b1326d94-34ca-4045-b2c9-b94ba72f6096 · outbound

This paper cites High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.662734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:3fe0f5081243cc9e9bec1f77415239648f675734f378743d0ae6d49be748120f

Observation 90015bd6-9f86-4ffe-a7cb-3ea3f2900f22 · outbound

This paper cites GPT-4o System Card.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search GPT-4o System Card

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.667127Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:3022b98b6773b69d0a8423ff88eab310203a88c68b3ffd501896705284d22b59

Observation 3d77dbb2-6eb4-4ab0-9026-8f07a936a697 · outbound

This paper cites Buy 4 reinforce samples, get a baseline for free! In DeepRLStructPred@ICLR.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Buy 4 reinforce samples, get a baseline for free! In DeepRLStructPred@ICLR

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.746310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:668710e93e2411227776dae96b36ff50b25afbffd9a30bdd12845c7c9c08a805

Observation 7d4d5989-5aba-42e6-80d8-c530da6a9aa2 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search LLaVA-OneVision: Easy Visual Task Transfer

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.672088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:aa561a60d715ddd94666226435c229bb716e6a468c4a0a34ac6d6df736441613

Observation 4decabbf-88ca-4b45-9f26-4fc0e6e38fec · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.677423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:1ff996b1e18e075556b3d4fc982a5d058e379c03eb8f3b7d4340ff710e9500b4

Observation ce7eca06-4527-4969-bc2d-cd8ca7de113a · outbound

This paper cites DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.682640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:01a9f2ddaac0b307e0bff2e00c1a8f5f3c74043e0cfbf26c856e4a1b2fd37a05

Observation b7990892-a328-47a6-b3cf-d1b4d368752d · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.761979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:08c05050e9cf35529dea833a6f7d70b8da15934cc28ec2728d5d13ae544a60c7

Observation ffbbbbdb-77e0-4595-89f7-d4ccdb1ba77c · outbound

This paper cites WebSailor: Navigating Super-human Reasoning for Web Agent.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search WebSailor: Navigating Super-human Reasoning for Web Agent

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.686430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:8ba5c3d8998ba6dd3096ddba0b3c80a6e243b2b0fc2bde01bd7ba45c7f5cda97

Observation 3ad2d55c-87ec-4197-8706-30684875b56a · outbound

This paper cites Remax: A simple, effective, and efficient method for aligning large language models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Remax: A simple, effective, and efficient method for aligning large language models

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.707673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:1f982a98370bec105a27b184a18c77cf06764ec62f816f2751e179e875c4d7e5

Observation 1608f125-0930-4e78-b52a-7949511fec27 · outbound

This paper cites Vila: On pre-training for visual language models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Vila: On pre-training for visual language models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.714751Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:d2792e7b01e9f720b68f61185285980f71fb04fb3c6a6daa686f56daea98ce20

Observation 4902e45a-49c9-4595-88fa-6e5f0f7b836e · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Visual instruction tuning.Advances in neural information processing systems, 36

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.718786Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:1cd1c95dbb66eb21393c7c84269dd350a3acc548d49682929e77bcc36e7f8dc5

Observation c8166fcb-4fac-4ded-8a93-f850cf6f48bf · outbound

This paper cites Understanding r1-zero-like training: A critical perspective.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Understanding r1-zero-like training: A critical perspective

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.722305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:7b33798c418e328edb8b9ac8e492c075e0f250340b67acfa0ff9c0be5db4047a

Observation 15cec958-7ec3-4615-9b26-6c5f62af0959 · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.691214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:8f16f49c9303a8ecb49931d8164ab33703b0b872b52b429b72103145ef93aef2

Observation 7140552f-ec9d-448e-97bf-b4347eeb36f3 · outbound

This paper cites Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T01:17:55.696222Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:e56b8087bb600d3733984a07f94db645d2939fddf813969d7f79a215229f0f68

Observation ccef3016-2af6-4d21-82e4-97fc9798ed8a · outbound

This paper cites MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.540566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:22c8ddc9501869b7117dcb791d61a5e9df066bb633ee6c07d91e3fbfcf852459

Observation 69fc7c65-c791-483a-b964-f23b86a13093 · outbound

This paper cites Llama 3.2: Revolutionizing edge AI and vision with open, customizable models.https://ai.meta.com/ blog/llama-3-2-connect-2024-vision-edge-mobile-devices/.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Llama 3.2: Revolutionizing edge AI and vision with open, customizable models.https://ai.meta.com/ blog/llama-3-2-connect-2024-vision-edge-mobile-devices/

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.741864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:194148f64efe83fc7b14b699c6dc92e65a5c6b70fb36be33b3c69c69750be8dc

Observation f4f7c911-4a12-45a7-b204-573176618afa · outbound

This paper cites Introducing o3 and o4-mini.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Introducing o3 and o4-mini

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.750102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:eda779ea01b4e857c3197dd6acc8c8c1a115fc29bc69da1dd3bce14aba518022

Observation d7f46d92-47e2-41d1-bee6-7e72e91acd75 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Proximal Policy Optimization Algorithms

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.545588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:ff3c2a22735f6561f08b4989865acd09f6ec48f9417d5157519ee567f618d65c

Observation ff6429e6-b6a8-4afc-924b-560804782696 · outbound

This paper cites Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.CoRR.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.CoRR

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.757623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:b78a5523d9cb68fbec1219831c7df5e6789b609bdfcd69fb724f407e08bd1bb5

Observation ac560eb6-3b1d-472b-bf83-2457d50a12f5 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.550696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:fafdd0d90797c7e906735fe486b4e2f2bee514f018bb5d1c9a2c8081d0f610b1

Observation 6ed13dfe-f0ce-474e-9082-326250f23159 · outbound

This paper cites Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.555961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:9a53650ec09b0223a5d56384acc83131ccaf226a595d7cf1ee5afc3c19099a0c

Observation 151c97e6-cc10-440d-8fa4-b7e7bf2c842b · outbound

This paper cites WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search WebShaper: Agentically Data Synthesizing via Information-Seeking Formalization

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.562327Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:ee94be0ced49d9a51e7faf5de1180c5b7f873411f3865eac9c6b741792a854b7

Observation d734f225-f6ed-4564-bf8f-dc6668e9d407 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Gemini: A Family of Highly Capable Multimodal Models

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.567798Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:62b63f3dd108f4a66c005f0e4e56dd1ca1ed1b00855be97ddf7df7cab46b7fec

Observation f313d6f3-5f16-498b-8f70-3f2e75b6bbed · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Kimi K2: Open Agentic Intelligence

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.572827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:5a6bd2392dd3b684dfd188af6917490515f3ea75fb1c906c448a49077ae31381

Observation ff25f9ea-9d50-4bec-a63e-616b03eb82c8 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.578434Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:65641e751d62c1cdf837c673eab1ee3a342779217ce7946d0b600787c811c975

Observation cfdd6017-786b-478c-ab35-6ab030ffa581 · outbound

This paper cites Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.729789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:9c65e634745729378485633d8c9b6aff5af23bc391e4de0887d6fd200422c13c

Observation d675e7e9-60aa-4a7e-9266-62669caf40b5 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.733993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:89c5dd89a9e1a9952964a2b1d276ad826d3d06926e71c567162fac3089bbac14

Observation 85a9bdd8-8d8b-4cfe-a3e8-a3b136ec7bd7 · outbound

This paper cites Williams.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Williams

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.737907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:b85bfab36f29fcfa845dc96f871920d2301ec00f6873fabd75d93a459cb3c279

Observation e3eace9c-2aa3-48a9-a23e-147b65808920 · outbound

This paper cites MMSearch-R1: Incentivizing LMMs to Search.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search MMSearch-R1: Incentivizing LMMs to Search

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.583663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:3b9f8273d7ab0f35db96923e8d373a8ab8bccdf6551576f6f62c3bafa28c6300

Observation dd33bbd8-25a1-41b8-bbcc-b9aba8747834 · outbound

This paper cites V?: Guided visual search as a core mechanism in multimodal llms.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search V?: Guided visual search as a core mechanism in multimodal llms

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T01:17:55.766691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:f036ea2efa88a2424acb06bf274bc25716f96a110af03d60c47af290113136ce

Observation 3b1a0ca3-49ad-4662-8895-f46c2393af3f · outbound

This paper cites SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.589474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:2fd1cc70a05aaaeefdff40a17926ea3973d049db7ec977b8c8e485507b8fee18

Observation 8fecda78-1b5d-476b-9704-a0d4e552fa10 · outbound

This paper cites VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.594921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:80f11173334e5202d5a76e3b016ccccc67c0fa9c7ad1068716b4ac4cd3b5d2cb

Observation 788e808d-c908-4a44-9052-532e431e225d · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.600238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:945d129c1288d14fd84bec1e8631e05bb0025af201a287a8317b2ee8f7170283

Observation 97056f1a-adc4-4ccf-9f22-bc99fb9b702c · outbound

This paper cites R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Reference 45

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.605284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:a919035a7551ebc2f1e0e641670260ff4494a0180af0a97b98f41a6b711ca8fe

Observation 671d308a-4d0b-4d9e-a5c5-56e4f07814f6 · outbound

This paper cites Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.610439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:258223133399d58447b005e3961f74a4a3c0bb2556a096e3ee3767e72fc8758a

Observation 9c4eeec9-5ada-426f-820e-784751e2997d · outbound

This paper cites MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.615547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:0b59cce313b48ae2cda72ec227d2ab7907d7965420a5c310618ee3f25608142a

Observation c88db8b6-5da1-46fd-824e-238d0bee044b · outbound

This paper cites Group Sequence Policy Optimization.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search Group Sequence Policy Optimization

Reference 48

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.620719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:adac6288e7921ad8d2e7aab46cd72cd15c016892522538f579868b03f7c421d3

Observation 6c960514-3cc9-4ad1-a993-820bdeb795d9 · outbound

This paper cites DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

Reference 49

Resolution
verified exact
local_arxiv, observed 2026-05-18T01:17:55.625097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:b03a58763addda3a0cc4c6bf7a79b7fa2ad7ce295ffee8517546c14a26521cc4

Observation 4c998114-7864-4675-9dde-808de3ca7f18 · outbound

This paper cites R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-19T07:13:47.672124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:455b38d2b951f1906ac88507e171601039f6881e6facd703a8a9ea1592ae16e5

Observation dce92b3f-4e41-44b5-80c0-70e59af4e30f · outbound

This paper cites ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning.

Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

Reference 51

Resolution
metadata mismatch
arxiv_id, observed 2026-06-09T03:07:59.867366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T01:17:55.500268Z digest=sha256:ee768d36c350157717954149ad252c7868f7032291217175d4c937cc567cca51

Pith citing papers

Observation cab40d12-5595-423b-81ed-3234d75fa170 · inbound

DeepEyesV2: Toward Agentic Multimodal Model cites this paper.

DeepEyesV2: Toward Agentic Multimodal Model Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-16T05:32:29.266583Z digest=sha256:dad0e98d774026d1a4de73753b19ab461151b92eeb398e48c17fafc0ca201f06

Observation 6150b946-ece1-4b44-b2e7-ff21333584e0 · inbound

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception cites this paper.

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-17T05:18:57.925925Z digest=sha256:e6aca68ef10a31e9e18cb275a254a6da128f43d9fcfcfb946216ee610178534c

Observation 26f3a2ca-3b4b-48ea-ab40-dd01eec2f3fe · inbound

Boosting Reasoning in Large Multimodal Models via Activation Replay cites this paper.

Boosting Reasoning in Large Multimodal Models via Activation Replay Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-17T05:05:48.682057Z digest=sha256:ec4045c4ec0ed650120140801b9e2a44c9d4f282d797a8afdac5e59ef7d3412b

Observation 8d37bdbf-de01-4bb0-bb10-9a9bb0c08228 · inbound

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning cites this paper.

Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-05-21T16:44:15.918442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-21T16:43:11.995960Z digest=sha256:495b1559e6a9cf563e6aa14282c4e8a2c58be1ae19803a3c17bd01408862ecfe

Observation 6eb22f99-9523-4dad-86c9-57445cce0107 · inbound

AdaTooler-V: Adaptive Tool-Use for Images and Videos cites this paper.

AdaTooler-V: Adaptive Tool-Use for Images and Videos Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-16T21:23:33.598026Z digest=sha256:add5e931d5e723b1bb3b348da94d6b098ae4a08696a239349dde9856dd380a40

Observation aa6dc836-b55c-4daf-9af4-0e47f656da91 · inbound

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning cites this paper.

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-16T12:17:42.135851Z digest=sha256:d8a32ffd5072f0a12b9be14de766078b170acf9e8c19281101a9b26248a61214

Observation 47907d39-fa10-4af2-9964-78c1cd2bb719 · inbound

Imagination Helps Visual Reasoning, But Not Yet in Latent Space cites this paper.

Imagination Helps Visual Reasoning, But Not Yet in Latent Space Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T20:40:31.055040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:40:31.055040Z digest=sha256:615ea36ec7af5223ccb65d7dbb142c977d8c3b227e71ff365440993586efdef2

Observation b0e2d2ac-a1aa-4845-ab46-49f8b9db3524 · inbound

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning cites this paper.

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-13T19:34:58.789459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T19:34:58.789459Z digest=sha256:a72ed2e08f36daab591b235e7e08e1bde18be324e11eaa099eef15c3cd6c58c2

Observation 63d30524-ffeb-4982-878d-2cf6bf74c372 · inbound

Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking cites this paper.

Fully Spiking Neural Networks with Target Awareness for Energy-Efficient UAV Tracking Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-13T16:55:20.099628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T16:55:20.099628Z digest=sha256:efad636dd067c31cb9286be33985c1eeb227d33aa0320e67c316296fbf5cf5d5

Observation 57dca67a-1834-4565-b692-bb771e4fce28 · inbound

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs cites this paper.

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-14T21:35:12.859669Z digest=sha256:510c93dd82b2d780ea5a15543fabf980aa1a0c72caf10dc1a3fcb7065aeabe25

Observation 1c866338-955d-43b4-b880-12fce2592431 · inbound

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding cites this paper.

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-13T20:07:23.153064Z digest=sha256:ca7fe51dea57d5e520ed32f8727be29de205a206ae02318bf7cae70be259fdff

Observation adcabed8-92da-4e6d-8ca6-ba96141488a6 · inbound

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR cites this paper.

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-13T18:21:11.239405Z digest=sha256:935b0235948a55d4525b189cf666cab9c89d2e6df5e596d2bddf583485964aa0

Observation 5faa6fd7-50f9-480d-be80-305e691693eb · inbound

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization cites this paper.

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T18:20:02.559108Z digest=sha256:a4b41160c2c475fc7779ab5f6d94b3b17165779b71d21626e27aa183bc1ab27d

Observation d5f00aad-0671-47bd-8a79-5cfd3cddbda1 · inbound

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models cites this paper.

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T18:46:26.869644Z digest=sha256:a9bb0541eaf84509c86df5cdd55831814367b324b70ebdf71cf271f7d022c737

Observation f455e523-7153-4d19-ae09-bac1b7cd99b5 · inbound

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models cites this paper.

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T18:35:21.514502Z digest=sha256:d545b57b651f524c0c2f632befc07be313354a5e2df81f3f84e3abf6efb5e890

Observation 3c613900-5153-4e80-90ba-f2c1ecea7895 · inbound

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System cites this paper.

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T14:01:50.429917Z digest=sha256:2ca35fffdc4a9a6fea00a2a362411db074f0b6a4a9a0b44a6e962f9e2096c869

Observation 78dbfcfd-e274-4c10-a59c-ce8cacb6d9cf · inbound

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System cites this paper.

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-12T01:51:46.849464Z digest=sha256:c210b058a555d9eb71fd34c17b7a65d5d0d6c05426e53eb5f78510241752b2e5

Observation 262db4a5-b9ec-4106-8d52-74356b550aa0 · inbound

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement cites this paper.

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T06:43:54.201604Z digest=sha256:017d2dd4acdf8d3864f0dbe7df1f3ef1e9d778c22474e2d18dd4134fd36caff4

Observation e4196374-9924-4ebd-a0f0-83197c99ea33 · inbound

Visual Reasoning through Tool-supervised Reinforcement Learning cites this paper.

Visual Reasoning through Tool-supervised Reinforcement Learning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-10T03:05:21.688216Z digest=sha256:706dc3d6514b2cc224976270e97d97596c184cd179853bc9ecf4178eb1adad2b

Observation 64409e3a-b89e-4d25-a848-373901033fff · inbound

Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning cites this paper.

Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-08T17:07:53.418355Z digest=sha256:847f1b429fb1be515b05ec6fe49d4626ecdfae7777e6372ac024a5ecc39a8699

Observation f92710ac-4237-480b-964d-c2690ffaec4c · inbound

Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning cites this paper.

Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-08T17:07:53.418355Z digest=sha256:c73a256fad9744c4a64fb1a3438a19a35891e757d0d6ff60f438b7664136be33

Observation 24f444e1-e558-4d3e-8d29-2737846ab1c8 · inbound

Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search cites this paper.

Beyond Thinking: Imagining in 360$^\circ$ for Humanoid Visual Search Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 39

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T01:17:55.768539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-12T02:58:46.728868Z digest=sha256:f77af657e4f127457bd2a9b68fcd1ba96c39b0f1838b1e011343c77b97a7cace

Observation 6b0de8fe-715c-48b1-8bfa-47e120bfa0c7 · inbound

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth cites this paper.

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-20T10:53:13.107658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-20T10:52:32.238241Z digest=sha256:64b8b1ef16b4115e1ba1c6b4a8e77a6f416db80499e4df92bd273fa0d06c67f6

Observation b6910714-819b-4198-a664-1471279415de · inbound

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth cites this paper.

Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-12T16:34:34.452430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T16:34:34.452430Z digest=sha256:b5434b99f05c37105a0bfd5067606f781b8495df3e15ede00fd27581ec0a1bce

Observation 138f5f30-375d-474b-9eb3-dfe4dd5f176a · inbound

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation cites this paper.

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-05-20T10:58:13.461495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-20T10:58:01.621488Z digest=sha256:ef8412a0e3088f974b3f3498c15565bfa772a13dfa1efb3914d9ba77e4774a84

Observation 71e0dbc5-ee95-4e2f-a797-8dedbe52a45d · inbound

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation cites this paper.

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-01T14:55:48.545172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-30T18:28:21.605646Z digest=sha256:5019183d4fea6cb37d31c895427ff5f37612d9bff02d92e49480f1cd74bbf320

Observation 9040cf63-ecff-4e95-bc63-1fd30c12b774 · inbound

CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision cites this paper.

CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-20T06:18:05.559553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-20T06:14:43.288597Z digest=sha256:56a4f1a183905ef3d8f5a6d4fe8fee72ad5d745fe55977bee5ac8e5d6a7dd66c

Observation 49478add-840f-41be-ab64-5d9b167f70de · inbound

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning cites this paper.

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 62

Resolution
metadata mismatch
local_arxiv, observed 2026-05-20T06:18:05.295992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-20T06:16:47.650748Z digest=sha256:27d2b7117153c18df7c1e845f71e7a7380b27b42fd85c1400565cc1b752df61a

Observation 54735f58-722c-4a70-8f80-4761525b113a · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-25T04:55:23.175346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-25T04:54:23.077914Z digest=sha256:ba3a2d162d83e2eb48527e5d1b4bff5df047848dce3b121da7d66893443a239b

Observation 19ad722c-355e-42a7-b8c9-575c285e5d91 · inbound

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering cites this paper.

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-04T00:49:17.504330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-04T00:41:02.284215Z digest=sha256:879134f831dba1c97ee1c22d0f82449b3f27fe499950a19d72156fb44d26cf8b

Observation 08a765db-0717-4de5-9e0c-a69983a8d92a · inbound

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward cites this paper.

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-06-29T17:53:46.814976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T17:52:48.888733Z digest=sha256:c949a3dd48ce022a00454088a9bc94c2723fbf68f060f9192dc2d09675cd12c0

Observation e737e45d-19d2-47cf-8788-88ab3bf21472 · inbound

Self-Prophetic Decoding to Unlock Visual Search in LVLMs cites this paper.

Self-Prophetic Decoding to Unlock Visual Search in LVLMs Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-06-29T13:03:26.903419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T12:53:40.783281Z digest=sha256:d7d73457697c4df814df547b23b2294e8581889bd3ebc09c8cfc3b254747225a

Observation a4d415a6-9e70-47f4-956a-0bde22a388d5 · inbound

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning cites this paper.

Agent Explorative Policy Optimization for Multimodal Agentic Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-06-29T12:23:23.732689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-29T12:22:39.655615Z digest=sha256:cc97395757dc02f20d2a71844d82ee48b10d2e6d46d997614d91213815f1977d

Observation 58038a7d-f680-4bd6-a80b-ec76f2d7fe5b · inbound

DeepLatent: Think with Images via Parallel Latent Visual Reasoning cites this paper.

DeepLatent: Think with Images via Parallel Latent Visual Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 67

Resolution
metadata mismatch
local_arxiv, observed 2026-06-28T19:52:36.134672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-28T18:44:39.545911Z digest=sha256:e4124542dbbd09121e0a9a975f98b6fe9f90cda8c1ddc7047dc231349046de2c

Observation 558e4edc-37f8-4125-ad21-07b507ea1b10 · inbound

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators cites this paper.

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-02T12:06:56.227382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-28T02:25:30.998989Z digest=sha256:35915f90538fbcfcba7c613d8e085ffc0dad9c1177c2fbffcc7d67996125207a

Observation c0efb877-2914-4a97-9c71-ab04f65d4a87 · inbound

Kwai Keye-VL-2.0 Technical Report cites this paper.

Kwai Keye-VL-2.0 Technical Report Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 84

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T04:27:36.958572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-27T13:53:10.352603Z digest=sha256:6b464fc4da6be441df73f6ae791c062d1ad3f4dcaf17c1aed0a3c23b6f7ab687

Observation 5eec087c-2c3d-4788-ab20-714d8821c7f0 · inbound

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA cites this paper.

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 277

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T09:47:59.594907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-27T10:21:12.782864Z digest=sha256:504b623b2947e56edbbc789dd8bb7cce906ed3922543ee09fada0ce65384c50c

Observation e24d01ef-3183-4940-b9e0-8eaab648a988 · inbound

Latent Visual States for Efficient Multimodal Reasoning cites this paper.

Latent Visual States for Efficient Multimodal Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-04T16:29:57.252282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-26T00:38:11.619574Z digest=sha256:ee0ec0349d69241386bc416f39f3b5af4d3f181afa86d3bbf40f73bcf0bad5fe

Observation 90d230d9-43bd-453e-84b1-995d8a0f0803 · inbound

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning cites this paper.

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 76

Resolution
verified exact
local_arxiv, observed 2026-07-04T19:20:06.678009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-25T21:23:10.051805Z digest=sha256:54bc4c78e8133c565c952e0e00144ddd3a667b077c150a2be0b3d6faf771b962

Observation 18a4dbdc-2b5d-4471-9af2-5ba1017eb83a · inbound

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues cites this paper.

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 16

Resolution
metadata mismatch
local_arxiv, observed 2026-07-04T13:19:50.965404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-26T05:18:01.931929Z digest=sha256:cd85cbbcec4b6984473babbf78b2197d92b46e1f7a933fc29015da31cd72ca6e

Observation 64270dee-634b-48dc-a2f0-e07a1f443dfd · inbound

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context cites this paper.

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T06:04:21.294497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-30T06:01:49.904752Z digest=sha256:286ba98e22b291b357540b2d368fb5d7e63ea1ed9a8b289b77dde785a4968cc4

Observation 8a38018d-55a5-40ac-bf36-c258cce102d8 · inbound

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking cites this paper.

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-07-02T19:57:19.129175Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-07-02T19:52:39.269265Z digest=sha256:5857a14231d93e2d8379711d543358befdc0a02a5bbcbf54cb0bd9784ef2668d

Observation 7cac6eaa-e046-4cdc-9f18-84c0bc825cc5 · inbound

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning cites this paper.

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 19

Resolution
metadata mismatch
local_arxiv, observed 2026-07-02T13:26:58.500538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-07-02T13:24:17.538850Z digest=sha256:86618c487c7d226f08417f92212cf6f352be332e6552077418df6e6dac9e5a91

Observation 25e7c5ee-10dc-447f-9134-734d2d225b62 · inbound

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents cites this paper.

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T01:50:53.534399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T01:50:53.534399Z digest=sha256:1b0e44cd478458997a283d872ac258b23fa951d10096eb062bf76dbae366697b

Observation c1173fa4-042d-40bd-a555-22dc9e9946cd · inbound

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models cites this paper.

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-31T14:46:28.517369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T14:46:28.517369Z digest=sha256:dfcdd94117eb42fd87de6d4d0fb6a97c0d25fb6f1a169738042b7c576ea89d9c

Observation 25c1bf69-7aec-4a29-be85-5c4230954669 · inbound

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification cites this paper.

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-07-31T14:08:11.193418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T14:08:11.193418Z digest=sha256:73279a648e16752abff1bc98e5e50c75972db6f5a279aab89266bd84b78f04d0

Observation bbcf8ea9-ad85-4c66-91cf-62c90d036a40 · inbound

Beacon: Knowing When and How to Perform Agentic Visual Reasoning cites this paper.

Beacon: Knowing When and How to Perform Agentic Visual Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-31T02:45:28.605521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T02:45:28.605521Z digest=sha256:51db44a62f03eea8529dfcfa299c4d6560978324ad8db7c2e9f946db1ca8c805

Observation a80f6a26-000f-463e-8577-c0dcf86fb309 · inbound

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents cites this paper.

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T20:12:42.036366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T20:12:42.036366Z digest=sha256:478bd35afad7308938a379ba8bccce31cecced5a22dfbb2416b789ee3899c587

Observation 406b1b09-af6c-4c3f-a08f-ce247c32f70b · inbound

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use cites this paper.

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T11:21:36.905665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:21:36.905665Z digest=sha256:256566be9b0e43292418aa8be1e912c2d09790132b8e65091cac2d754e64e19b

Observation 7fc0f05c-885c-4999-a66e-5eedd5ebcd99 · inbound

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs cites this paper.

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T19:03:08.633259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T19:03:08.633259Z digest=sha256:6967af7311f33cf082fdaf15df39afe8b781d8225409628583e5dacf8fed9316

Observation 707b08cd-bbe9-45da-bbd1-892a8a363659 · inbound

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images cites this paper.

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T10:59:57.543577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:59:57.543577Z digest=sha256:87e2a7af3117debae02374d04a381d4c9a3078361356c07eaeec69442217392b

Observation b105647b-87f3-4fb7-82bf-6f0446626b1f · inbound

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning cites this paper.

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T12:53:14.077712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T12:53:14.077712Z digest=sha256:e96a1f1b2d0bce3d44478abc8d8aac37553b5da540c078162f29d6ad0609df1c

Observation 1773d0c5-1a6a-4ca3-92e4-f27f34bfb18c · inbound

InSight-doc: Agentic Visual Perception for Long-Document Understanding cites this paper.

InSight-doc: Agentic Visual Perception for Long-Document Understanding Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-12T20:43:52.502221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:43:52.502221Z digest=sha256:7d90acb6aace8d42d426f089b730897f0e665dee975d2e69d7829dd4eb72d71a

Observation d0d101c4-ec71-4ecd-a035-6930c6094631 · inbound

MIRA: Medical Image Reflection for Agentic Diagnosis cites this paper.

MIRA: Medical Image Reflection for Agentic Diagnosis Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T16:38:14.130628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:38:14.130628Z digest=sha256:f2ea2f11cf2d9c523803b0293758eb9e0ad6e1d33aaaab0c4e0ff41bda5998bc