Pith. sign in

Paper Citation Record · LEDGER

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 15 inbound Pith citation observations for arXiv:2508.13186.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.13186 v1

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T20:18:59.692988Z

measured 70 of 70 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 15 of 15 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T15:38:30.195236Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-10T12:15:01.137692Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact1
  • verified fuzzy24
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c2260c22-16f8-464c-8c5e-dd2b48c0cdb8 · outbound

This paper cites Qwen2.5-VL Technical Report.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Qwen2.5-VL Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:52.178365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:52.178365Z digest=sha256:662efd3413f29f7915bf97294bccf7f3aad0cdbac56602eea736eb103178b183

Observation 1e50ed77-ef65-4b12-a17c-d1061f95e96f · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:52.262125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:52.262125Z digest=sha256:b131d0dd1d4a1931040da40e7bd5d2231dbc2a497c456e7dd9744f1b2a0a8793

Observation 9e8ba05a-64a0-4145-ad7b-3111070f3929 · outbound

This paper cites Deepresearch bench: A comprehensive benchmark for deep research agents.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Deepresearch bench: A comprehensive benchmark for deep research agents

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:06.999286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.385826Z digest=sha256:939a5679967fee4f1b11d7505a877902b092d719bb7176d07f46ae4da9ca754e

Observation 5ba2930b-e602-49d7-9146-a92bcd5e1224 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:06.829215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.509153Z digest=sha256:517407dab763183e1cbb653e9ad1f52dde7b1fbd0884ef1b712d76604fc30691

Observation 980e99a2-4868-4577-a606-dec42c95370c · outbound

This paper cites Gaia benchmark: Results public dataset, 2025.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Gaia benchmark: Results public dataset, 2025

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:06.549216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.642402Z digest=sha256:00c8da04c79e81ba1b36997fa456c32b5b10b53dc4d8393dfc990f809491157f

Observation 2e70f5e7-7a54-40c2-919c-0a7e20d36870 · outbound

This paper cites Gemini Deep Research.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Gemini Deep Research

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:06.408320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.749398Z digest=sha256:614653fa644b5537ff9d8a3142f97402cca96df86b6a60925de4090195d252b6

Observation 9fd53ec8-55cf-45e1-bed8-e8bbef5a76c7 · outbound

This paper cites Gemini 2.5.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Gemini 2.5

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:06.285802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.870299Z digest=sha256:e69c632ed93f61b396cadd329a4882eeeea7d762c09f2f4b7a21e656697dff56

Observation 1e3bf27e-0fd2-4775-ba3d-c37494eceeb3 · outbound

This paper cites an unresolved cited work.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:19:06.059515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:52.987907Z digest=sha256:90a69d9fd6cfecf154bcf16f308c582222954e4f481c47e0c1db0a4609ad6851

Observation 9db7f7ba-07db-43c4-9398-71191a188618 · outbound

This paper cites WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:53.119930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:53.119930Z digest=sha256:7c96d38e86ef8e8b3a095bfa82ed1f8e69245d9c0d994fee82bf80be7ab07f4a

Observation 3a36b098-1b49-43af-8da3-d64eeb305081 · outbound

This paper cites Owl: Optimized workforce learning for general multi-agent assistance in real-world task automation.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Owl: Optimized workforce learning for general multi-agent assistance in real-world task automation

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:05.806827Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:53.219214Z digest=sha256:08d66065d2e012c51ed8d1c3df71aa6f08e929d96fe2d93fb1ac4f92fdaec6a7

Observation b22afdd6-2d01-456c-a6e0-9273d4e4068c · outbound

This paper cites GPT-4o System Card.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents GPT-4o System Card

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:53.300540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:53.300540Z digest=sha256:c3f821befeb5b8861c85a6636602e3a63466a69cd476f28cb6aefcdac76628e0

Observation 48d06288-8d2f-4cc0-b863-2d85b7944321 · outbound

This paper cites MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:53.545779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:53.545779Z digest=sha256:2512d3902d528338e82880c3b76127c7428a1ac8d9eb8166d6cb808710d4d58a

Observation 91067c32-3e30-42e4-ab33-d265c44b0950 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:53.678366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:53.678366Z digest=sha256:6971d7bfd40f2aca612ebef3307d5f211d59955c9f24e8f6214ee03666b28ab2

Observation 4b43a62b-5a18-4696-8cac-f3432010874d · outbound

This paper cites Referitgame: Referring to objects in photographs of natural scenes.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Referitgame: Referring to objects in photographs of natural scenes

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:05.566008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:53.814353Z digest=sha256:85752b1dd7de656ccc9b12554cf04fe18a53687485dbe79c08d357fc46772d0d

Observation b657d496-2232-434e-a6dd-8ad450646490 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents LLaVA-OneVision: Easy Visual Task Transfer

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:53.961684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:53.961684Z digest=sha256:7b1a5b4683f6e542cab89bec08ab3c6cda5c410d404d20bb6e447aa318862597

Observation 26a51221-4347-4ac5-88fe-8b51366e9d8b · outbound

This paper cites SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:54.074131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:54.074131Z digest=sha256:02f153ec55c1b95fb8d5ff4a0a9f90e9dcb5535b090adf254125c13c184934b3

Observation 47559cc3-1215-4f34-ac03-5d1916af0066 · outbound

This paper cites WebSailor: Navigating Super-human Reasoning for Web Agent.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents WebSailor: Navigating Super-human Reasoning for Web Agent

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:54.365562Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:54.365562Z digest=sha256:5c06c0ac21841e9b9f4704272adae709510127319059738b96133e3ce7da17a1

Observation 3e0fe0ed-8d56-4ed1-b771-f3d637093846 · outbound

This paper cites GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:54.512884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:54.512884Z digest=sha256:c5fb54af117832f3823a7f78b1e5369def570d37c1170a1731c14a402d72582d

Observation ff170901-0152-437e-83e6-f05db41890b8 · outbound

This paper cites Search-o1: Agentic Search-Enhanced Large Reasoning Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Search-o1: Agentic Search-Enhanced Large Reasoning Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:54.670109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:54.670109Z digest=sha256:d823f84902f90c1dcdaf4438410b57cf1a33f19ca18c8e829049c2b01b5f1d9e

Observation 701e583d-73bb-48cf-91f2-fe35ab599e05 · outbound

This paper cites DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-08-05T20:19:00.281226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:54.813869Z digest=sha256:47732ec7db513c62d2dbedf9891e92266437fbe09343dc097251c635ace1b0c5

Observation e8ff93a8-1712-44d8-96b0-e1e6770e55dc · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:05.321742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:54.927315Z digest=sha256:275a5fb183f79fe09f86977ea8b5cd487b01ddfe9e672ae6a511071095c5f0ef

Observation 6ee1cf06-04b4-4a20-9ce8-0a0c47c1633a · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:55.001509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:55.001509Z digest=sha256:a15aa418c0a977be6174ef961e24f48f33aabe628f70f6cc21214ea196c43de5

Observation 43ca75dc-0843-4d8f-86ae-2e923ea510fd · outbound

This paper cites ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:55.099600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:55.099600Z digest=sha256:452f5b3c57d802015509aa26f6f271e4d8c0ea43a65d1b84de0f84c6c95db38b

Observation 7a88fb56-988b-4e6e-ac07-cdb7820737d8 · outbound

This paper cites Docvqa: A dataset for vqa on document images.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Docvqa: A dataset for vqa on document images

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:05.036681Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:55.244691Z digest=sha256:68b38088c523ba33aaf218b686e5e17605f14e24f7cc5018ba96d7eee0dceae9

Observation 716518fc-6e9b-404a-9976-484cfa8746a2 · outbound

This paper cites Infographicvqa.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Infographicvqa

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:55.347792Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:55.347792Z digest=sha256:2e85d3a4161becbba45c6fd60328870adfb8ca5cef4f78a15402d0f563c49321

Observation d7c3e2c4-ce84-4bbc-aed6-737c9031f4a6 · outbound

This paper cites Llama 4 Herd.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Llama 4 Herd

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:04.820616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:55.456093Z digest=sha256:d487e578274e0c09c19dff9b4633b35cc294c0ba4301042a7865b3d55da2542e

Observation 62a04ec3-a64a-444e-8858-90d99fb2b72a · outbound

This paper cites Gaia: a benchmark for general ai assistants.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Gaia: a benchmark for general ai assistants

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:55.620908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:55.620908Z digest=sha256:a5080329717912d02621a11d24205bc6cd31783889ed43ecfd9562c1058162cd

Observation 130af66e-cac6-4b2d-bf13-fdc1f1deea5e · outbound

This paper cites Microsoft Copilot.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Microsoft Copilot

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:04.567835Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:55.821777Z digest=sha256:ac6ee9d186517c39cf1055f7e6312884e8bd12036de2542f203c2a953851fe95

Observation 3e5d107c-3999-4f69-9ceb-8d3e802bbe91 · outbound

This paper cites WebGPT: Browser-assisted question-answering with human feedback.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents WebGPT: Browser-assisted question-answering with human feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:55.993286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:55.993286Z digest=sha256:a4d63acddaa90a2a912e5c2b2c45ed69066485c9c00144275cc103988def2f87

Observation fbbd6bc4-813c-4bc0-bedc-b90fc1c77007 · outbound

This paper cites Gpt-4o mini: advancing cost-efficient intelligence.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Gpt-4o mini: advancing cost-efficient intelligence

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:04.278759Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:56.139228Z digest=sha256:4bbe5ecb6a2ab8aabd87ac633fee3300e017cc4f3f7a60f6a743c9d2f02cd41a

Observation 573a8663-75a4-4add-a630-b97470d60b22 · outbound

This paper cites an unresolved cited work.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:19:04.032453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:56.288187Z digest=sha256:377d0f4e075ea74d9a8d3bbafe9716a7c63c419c7026929757c1f82f709a25b1

Observation 8b7c6f4a-def0-450a-9bd7-176c2040c44a · outbound

This paper cites Introducing deep research.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Introducing deep research

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:03.667177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:56.434664Z digest=sha256:5b8faf779f806294c1b2538187939d821326f17809bd062c0cbdd5253873c287

Observation 85dbd799-a76d-441d-8898-668a038f568e · outbound

This paper cites Introducing openai o3 and o4-mini.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Introducing openai o3 and o4-mini

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:03.353056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:56.608692Z digest=sha256:04e90a24d01b7de09c9b844f09792f648097298d4ebbfd5891786f87461b4f3a

Observation cb0ef2da-5c1e-4578-be05-077e9497a513 · outbound

This paper cites Introducing gpt-4.1 in the api.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Introducing gpt-4.1 in the api

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:03.029226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:56.833485Z digest=sha256:ede6a9ab54077f996d90e9952ad2993f0191585e5fec1b4add6f8d58a2c0d74b

Observation d573d668-9369-4da7-b628-5b26ad2730ce · outbound

This paper cites Training powerful llm agents with end-to-end reinforcement learning, 2025.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Training powerful llm agents with end-to-end reinforcement learning, 2025

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:56.950277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:56.950277Z digest=sha256:6561bf2be3b9e75ab2c96f17ad72bfde531b25eaf9ea0baf78d3a88e5b686df2

Observation e9453e73-4b7d-4867-9ddf-764b0cfd5338 · outbound

This paper cites Introducing perplexity deep research.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Introducing perplexity deep research

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:02.794314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:57.070228Z digest=sha256:3046a422531321adefb608386bf28ea546ce5d70df8a70de1df2cf4bdd97b993

Observation 09f53ad0-7f78-4d69-a1a6-2e930e0a1bbf · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning, March 2025.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Qwq-32b: Embracing the power of reinforcement learning, March 2025

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:02.505255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:57.196991Z digest=sha256:a7414c3cd0f53a85c1bcb8fc15d226d744361da2f0e89329d08b54836e0e3cdc

Observation ac9c6cd1-2543-42f0-9bf1-5102c3330527 · outbound

This paper cites Hal: Gaia leaderboard, 2025.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Hal: Gaia leaderboard, 2025

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:02.330575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:57.341760Z digest=sha256:600f56a7b591d4aa8959bf82aaa030dd05f9e34711b0abcdfb3f43ae2f7a075f

Observation 95a63a2e-fdea-4aa9-acf2-33a40543bd8e · outbound

This paper cites Humanity's last exam leaderboard, 2025.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Humanity's last exam leaderboard, 2025

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:02.110436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:57.480233Z digest=sha256:40b99f597600595329c9b35661f5a305618940d4c77d30e143fa5de9ce7d666d

Observation 59ab65c4-816a-4034-8bd3-f84843dc02e6 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:57.605443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:57.605443Z digest=sha256:3e47794fa87b0cdf3182369f70acd49bcd5c3ed8de91f8147258477aa94bce7c

Observation 842b6078-8765-4205-bc5c-d899be24ff4f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:57.792273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:57.792273Z digest=sha256:64ee58ee6ad2b98d4b9982c70e3bcf9f2fa66654bd3741eefcdc3e5d8065a735

Observation 95ab613e-59a0-4a92-a81f-b2e2b37fc1fa · outbound

This paper cites Measuring multimodal mathematical reasoning with math-vision dataset.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Measuring multimodal mathematical reasoning with math-vision dataset

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:57.917652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:57.917652Z digest=sha256:bd86d796911d02f3bd8ecc723935a6b28f1b0aab26a6fa49c7e4af55786e443f

Observation 7b9cabd8-ade0-4f3d-860f-c9e3128ad341 · outbound

This paper cites ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:58.053520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:58.053520Z digest=sha256:399e17b3c7275c771b72a48d1a73995eb09bfd73d1d8d981eb78058ca545ede4

Observation 2cc5c784-86cf-42bb-8fe8-8a4622da8dc3 · outbound

This paper cites Measuring short-form factuality in large language models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Measuring short-form factuality in large language models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:58.169572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:58.169572Z digest=sha256:08c32db2cd918377fd5115ed1dc7f1095180dcfcfb508062b27773545b84404d

Observation 9d8fe418-16a1-4b2b-930b-8e26a4138302 · outbound

This paper cites BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:58.349502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:58.349502Z digest=sha256:7fedc28434355c6aa987fd309620df7b365b5620009ac9404654aa88423b2380

Observation cd6c2255-771d-4b23-b37a-9ac36d45ea3a · outbound

This paper cites Webdancer: Towards autonomous information seeking agency.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Webdancer: Towards autonomous information seeking agency

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:01.803250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:58.484673Z digest=sha256:37af2291fd77189cca9874ee7ee8961b8de6b8b67c44ba6b27bb523da205c549

Observation 66900148-4dd5-4a78-bd8c-4b461a3f19fc · outbound

This paper cites MMSearch-R1: Incentivizing LMMs to Search.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents MMSearch-R1: Incentivizing LMMs to Search

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:58.629661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:58.629661Z digest=sha256:9d795bae61f144b1d0129e1c32879c483956f06f023e491eb50cf4c32e52082b

Observation 60b9b2eb-587b-4a11-aabb-82b6f0534e40 · outbound

This paper cites Grok 3 beta — the age of reasoning agents.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Grok 3 beta — the age of reasoning agents

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:01.513249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:58.773879Z digest=sha256:21c5e1853a30585393c396ddaf994a119b874d5c015e9fb22e57c18f639de956

Observation ba5ab07c-e2b2-4183-9397-70fd248446c0 · outbound

This paper cites Qwen3 Technical Report.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Qwen3 Technical Report

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:58.951425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:58.951425Z digest=sha256:a7a60809b2d70b740ead8ba46cf04909f492535688d22882865c0cf0c1535222

Observation 2c1f60de-14ea-46be-94b2-1d6158e391a2 · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:01.262964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:59.075373Z digest=sha256:947f987e730c1d8abfbdf291e10e0ceaf662fb47820dd5606102487eade394e3

Observation 4ac9d3b7-609f-402d-9542-65b47ff08e6c · outbound

This paper cites ReAct: Synergizing Reasoning and Acting in Language Models.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents ReAct: Synergizing Reasoning and Acting in Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:59.256090Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:59.256090Z digest=sha256:aca5a56411a3c5709d368b6dc40feee54de7aa85d00f0b5a71929c4773bbd3a1

Observation f9c9358e-cfb8-4e7c-b1ee-a3fa940e5622 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:01.004390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:59.386038Z digest=sha256:4973e162d105a4a7600fdb36217094850cb9d94f0e25a35b33fe5af2399058f4

Observation d35a115d-3916-4428-bb43-9562a5110c40 · outbound

This paper cites DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:59.503443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:59.503443Z digest=sha256:2013ff2378ea2203398ed5d69fea87040930a1479302ce1e1c8fe4e5b9ec5483

Observation fdc03570-e332-412b-9fd4-e978e98ef471 · outbound

This paper cites BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-05T20:18:59.573267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:18:59.573267Z digest=sha256:2e43e7f24f3242b473727ecad6eedce4be39f5d48018b3947b2f1b8d3bd7187e

Observation fa68709a-deef-4e9d-92ca-8d0303af9973 · outbound

This paper cites deepflowio/deepflow.

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents deepflowio/deepflow

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:19:00.735479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T20:18:59.692988Z digest=sha256:415d041f42d65e65b758a2711ed5839b0e05259d98eaf4a9a56d017d5784b911

Pith citing papers

Observation 32b42022-5d2f-4b8e-9ab1-c7de86b259c1 · inbound

DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories cites this paper.

DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T01:02:34.091340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T01:02:34.091340Z digest=sha256:17afaf3caa13570d62d7c27fa0a65a61caa74f55f7d00362b98b9225d9bbb15c

Observation 7dfbe0e6-6255-4e38-91fa-5e5068751497 · inbound

Seed1.8 Model Card: Towards Generalized Real-World Agency cites this paper.

Seed1.8 Model Card: Towards Generalized Real-World Agency MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T07:45:14.386566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-15T07:44:02.827006Z digest=sha256:027ba68ba6ad21a4da97d3b264198a2e14f39dd7ab7244eeed2168996bef6cc5

Observation 955b1706-b724-4971-8419-1b77a9eecc59 · inbound

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces cites this paper.

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-13T17:33:02.334719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-13T17:31:08.575993Z digest=sha256:c2e84bcd5a1468d9e76e8a3f65d641232051a61400bbb0c952fe5d5f94c5a201

Observation 10cde9e7-b8a9-465c-988c-8ce1043ce649 · inbound

Towards Long-horizon Agentic Multimodal Search cites this paper.

Towards Long-horizon Agentic Multimodal Search MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:01:04.548823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T15:40:32.137708Z digest=sha256:458cb0254c93355375244d6303f44cc1bb6cdca261ba1fb50d197fc2172a1d4a

Observation c577a077-2d56-4d06-b41b-be1626d4fef4 · inbound

MARCA: A Checklist-Based Benchmark for Multilingual Web Search cites this paper.

MARCA: A Checklist-Based Benchmark for Multilingual Web Search MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:55:24.292789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T12:54:27.110593Z digest=sha256:2e6d8b6ea0c7835fcc7198d12b0817d5646d6c9a9b4b9203ec7880af99a9adfa

Observation 1b1ad998-ae3b-4b90-a74c-345572e497d9 · inbound

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents cites this paper.

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:26:26.286747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T04:15:40.042348Z digest=sha256:be8dca9817df6ef48532fb0a7304f0daf9c7953b3b897e34b26284405d93f6ea

Observation e7561edf-ca1c-41ae-828f-3455364bcdd8 · inbound

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents cites this paper.

Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-01T13:55:46.331622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-30T22:30:28.649803Z digest=sha256:eb28a3be155eb63ec0c4c54726c182670e3aa711121e06e3a80b71bf4ab491a8

Observation 18eaf2f7-a8a9-4fb7-8da1-8cf1fd751645 · inbound

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents cites this paper.

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-13T03:52:12.448979Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-13T03:51:54.401200Z digest=sha256:f028c539132efd4d91b9c6690b1955bd23fbc28406bcbb9b715115ef09bc99ef

Observation ea77197f-3f7e-49f3-b743-2f77a2caa3a7 · inbound

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain cites this paper.

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:13:11.959110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-20T10:08:56.397296Z digest=sha256:54f8c5c4fdd1da0eae6cb5d80bfac838b59439e856986f1e2195a3af4751017f

Observation 239f26a6-f098-474f-9899-abcb96895546 · inbound

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain cites this paper.

SVFSearch: A Multimodal Knowledge-Intensive Benchmark for Short-Video Frame Search in the Gaming Vertical Domain MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 68

Resolution
verified exact
arxiv_id, observed 2026-05-21T08:49:53.430701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-21T08:49:32.503461Z digest=sha256:939dff22d36825e1ccb98c13286fd1f3711102c54491026aff3edee7736183d5

Observation 9a2dc7dd-27e7-4ec9-97a4-ebf9e7aa6f19 · inbound

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking cites this paper.

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-02T16:47:10.205636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-27T22:20:53.187362Z digest=sha256:878dfe1b2789e193558b544a57c8d006a1a27210eca07c8762610202035620ff

Observation d01175b6-838b-4025-aef4-bad8c086cc24 · inbound

LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake cites this paper.

LakeQA: An Exploratory QA Benchmark over a Million-Scale Data Lake MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-03T04:47:37.848395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-27T13:41:35.986601Z digest=sha256:a87d9ef9e7a01533fca91a8c4ad29f93d5e4e29617d5dc21a208dce6d4e86b5c

Observation dbc08aa0-a0ca-4afc-8b18-4b3beb0f6fd1 · inbound

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity cites this paper.

Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 61

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T19:07:17.131815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-07-02T18:57:46.841456Z digest=sha256:752e61f9d5c85cc333d2eba3eeb4e4ce0ac94449f7613016702fa4bb3da969dd

Observation 0605d5af-1a04-4902-8244-c00b060f8450 · inbound

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp cites this paper.

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 82

Resolution
unresolved
no resolver link, observed 2026-07-14T10:51:16.019022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T10:51:16.019022Z digest=sha256:655aeb646cadbd0b5389b315d423de6dcfaef478984f66679606b89e61630cdd

Observation fcdcc24d-bda5-43e1-a8af-9e8a3a4c3b6f · inbound

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents cites this paper.

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T15:38:30.195236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T15:38:30.195236Z digest=sha256:7a251a0047502a3969abce902ca8ef05f5c621c10764b42acb21f798db4ac5d9