Pith. sign in

Paper Citation Record · LEDGER

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

As of 12 August 2026, this Paper Citation Record lists 100 of 211 outbound references and 3 inbound Pith citation observations for arXiv:2602.18600.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.18600 v5

Coverage vector

measured 100 of 211 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T22:00:13.891720Z

measured 103 of 103 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-12T20:43:51.464398Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-04T08:39:42.500110Z

Reference resolution

100 of 211 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved100
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f96caba8-a266-4b59-9da8-368ae9f967ba · outbound

This paper cites an unresolved cited work.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.190848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.190848Z digest=sha256:3d599091bd843f20fcc67314d936fc2b4994e66341b03efd64313ec16000c2dd

Observation 4857e590-b2a9-42d3-a46b-a64dd93f25ba · outbound

This paper cites Phi-4 Technical Report.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Phi-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.222885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.222885Z digest=sha256:4118d2c206194f1756c4758258ce00665f6c3ff383f69b5d0426c4d7d3c556f7

Observation a4a8babf-d6a4-49ff-9cf2-5dd25e9bed45 · outbound

This paper cites GPT-4 Technical Report.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs GPT-4 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.280751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.280751Z digest=sha256:e8d9b2b53b841cbcb96b69fc86b7b6dfcc04297906c2911fd28e10ff8903029b

Observation 28ed8397-ec8c-4f76-8c4f-24bd69adb2fd · outbound

This paper cites SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.360002Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.360002Z digest=sha256:5b98a38a539f2c3b5a7f827e5a98be97265a6ee4f3478279a42b2d717c4bdadc

Observation f11210c6-8ca6-4179-86fa-6d258a846708 · outbound

This paper cites Qwen3-vl technical report, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Qwen3-vl technical report, 2025

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.413822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.413822Z digest=sha256:45dc6a6dd2f7987af6862fcc35a135b7f8d87701abc6f8eace3817304de3a231

Observation b4df9b2e-197a-4254-9a0d-e1d52f4cef5d · outbound

This paper cites Qwen2.5-VL Technical Report.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Qwen2.5-VL Technical Report

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.484203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.484203Z digest=sha256:26c7ab289966f33840673cf3cbe03bcc8d008b58859b0de400cd437921061672

Observation 423f9fbc-6828-4a80-bb50-486fbf2d98ec · outbound

This paper cites doubao-seed-1.6-thinking.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs doubao-seed-1.6-thinking

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.542531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.542531Z digest=sha256:e3a2510db1b62c1f47cb317a1141a86e44cd825f51a8cf9102791b4a3654de9d

Observation ce3a3000-8cfd-4d0e-bf08-89687e7a8f2e · outbound

This paper cites Seed1.6: Tech introduction.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Seed1.6: Tech introduction

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.590992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.590992Z digest=sha256:cf7b213a86feb7badea3a43185af7aa953c2c2df46668c635c9b6a50e9c49fd0

Observation c9bf13b2-24b4-4249-90a5-a1dc3721fe67 · outbound

This paper cites Holistic evaluation of multimodal llms on spatial intelligence.arXiv preprint arXiv:2508.13142, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Holistic evaluation of multimodal llms on spatial intelligence.arXiv preprint arXiv:2508.13142, 2025

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.646592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.646592Z digest=sha256:668ac9c4b4a1a10edf17c760975ceeef772cab655d66b245678d36b317a8782b

Observation 38078396-3c83-4ee6-930c-88f918724693 · outbound

This paper cites Representation granularity enables time-efficient autonomous exploration in large, complex worlds.Science Robotics, 8(80):eadf0970, 2023.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Representation granularity enables time-efficient autonomous exploration in large, complex worlds.Science Robotics, 8(80):eadf0970, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.699968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.699968Z digest=sha256:5ed47e837f5732deecc396332c54bbe2a0d1f79bf683bc7db6c43af6234c6e6e

Observation e3ae5e61-e8ec-4d0b-b475-25ec7a88f9ac · outbound

This paper cites Maplm: A real-world large-scale vision-language benchmark for map and traffic scene understanding.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Maplm: A real-world large-scale vision-language benchmark for map and traffic scene understanding

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.767809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.767809Z digest=sha256:5f53623fce7dcd0744f584fa2f210af84fd9e078ec7c70a635ede7fef0645fde

Observation c22d3a84-0d13-407c-9227-f01688ae2970 · outbound

This paper cites Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.802440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.802440Z digest=sha256:8764cef166ee17c32255d9574eae29e9235d823ec427e3b1ee8158532cc61efd

Observation 96415ad7-9185-43d4-8372-13ccfbfc628e · outbound

This paper cites Path planning algorithm for logistics autonomous vehicles at cainiao stations based on multi-sensor data fusion.PLoS One, 20(5):e0321257, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Path planning algorithm for logistics autonomous vehicles at cainiao stations based on multi-sensor data fusion.PLoS One, 20(5):e0321257, 2025

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.855197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.855197Z digest=sha256:075ad5df63a0c413c2cff611d9e2867784ad71e7d17dff83314ce2fff7a2d1b0

Observation f20ce482-ab49-4ded-b20c-8d034682f0af · outbound

This paper cites Glyph: Scaling context windows via visual-text compres- sion.arXiv preprint arXiv:2510.17800, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Glyph: Scaling context windows via visual-text compres- sion.arXiv preprint arXiv:2510.17800, 2025

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.896744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.896744Z digest=sha256:3f7af1203e669fed5d938d8ee898ddc8785268df6b6bf5de9378d03d698ab336

Observation d7ba1a1e-1ed8-469c-a0d5-390d01f8685b · outbound

This paper cites Sensenova-mars: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Sensenova-mars: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:04.958561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:04.958561Z digest=sha256:d7a30924f41cd0f7086e69d5a197eb957dd5dc269e3972f3838d25f349a025e7

Observation 757bba5c-de09-4349-a019-d2855fe37466 · outbound

This paper cites ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.001098Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.001098Z digest=sha256:36225a7a332ff8682472c78da82a3f8d83eac4195eb99d976f63afa421c2a35e

Observation 6c096d5f-deff-4a21-ab24-c91ca08a5db3 · outbound

This paper cites A survey on multimodal large language models for autonomous driving.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs A survey on multimodal large language models for autonomous driving

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.058831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.058831Z digest=sha256:50662d0cfc8c4e6682d9883fadd24bd55b766c974a1a678077a75403504d1381

Observation 9df3ad2f-1f12-4762-b45b-5fd336ace813 · outbound

This paper cites MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.110597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.110597Z digest=sha256:de4d0ef777f6b0831999559fed10aa93b61d9749f0d6356231f524838e482cad

Observation 92fda95d-1e71-4a29-883c-6185697f0567 · outbound

This paper cites Travellm: Could you plan my new public transit route in face of a network disruption?arXiv preprint arXiv:2407.14926, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Travellm: Could you plan my new public transit route in face of a network disruption?arXiv preprint arXiv:2407.14926, 2024

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.166547Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.166547Z digest=sha256:ffbfbd54484746918b6e50b321cdb201d1f3ce3e821cbdd5fab94e1151210c68

Observation e5d0724c-80c3-43fe-8695-1699261e20a6 · outbound

This paper cites Citybench: Evaluating the capabilities of large language models for urban tasks.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Citybench: Evaluating the capabilities of large language models for urban tasks

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.230169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.230169Z digest=sha256:9c127817ee9bbd5fcac367492037596bccaf2b70f14892bbb9f1a4c518df989d

Observation 097bb677-7ecb-4507-a58a-cf7ab48db391 · outbound

This paper cites Citybench: Evaluating the capabilities of large language model as world model.arXiv e-prints, pages arXiv–2406, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Citybench: Evaluating the capabilities of large language model as world model.arXiv e-prints, pages arXiv–2406, 2024

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.278866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.278866Z digest=sha256:4718ca514ec86f253e63ae3188893b17efc6d24ab86401e83acb9b456aa40028

Observation 8883f9b3-e316-4c2e-bdc2-d3160cf92f2a · outbound

This paper cites Efficient reasoning models: A survey.arXiv preprint arXiv:2504.10903, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Efficient reasoning models: A survey.arXiv preprint arXiv:2504.10903, 2025

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.332906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.332906Z digest=sha256:4ecc8a22d67dc3f3830eae64d993b2774503a84655242ef07cde40fd651827bd

Observation 0dc2a785-4f83-4275-9322-2cb9da1459a4 · outbound

This paper cites Rewardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage rein- forcement learning.arXiv preprint arXiv:2510.02240, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Rewardmap: Tackling sparse rewards in fine-grained visual reasoning via multi-stage rein- forcement learning.arXiv preprint arXiv:2510.02240, 2025

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.398591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.398591Z digest=sha256:dfd19221e9fdc5fa052a63fa5f21ac6859826ec9501c67661f7699f6bcaeb092

Observation c1862407-6f52-49ac-b6a0-a9d7780e2e1c · outbound

This paper cites Can mllms guide me home? a benchmark study on fine-grained visual reasoning from transit maps.arXiv preprint arXiv:2505.18675, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Can mllms guide me home? a benchmark study on fine-grained visual reasoning from transit maps.arXiv preprint arXiv:2505.18675, 2025

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.460533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.460533Z digest=sha256:a460fd0f99d8bc3d57ede2019e8f7428df34f190bbef05444de0994b560874af

Observation 54513a32-4dd7-471a-aeee-983f686979c9 · outbound

This paper cites Drive like a human: Rethinking autonomous driving with large language models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Drive like a human: Rethinking autonomous driving with large language models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.532876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.532876Z digest=sha256:d69b2e748cca8b04aadfb5d672917e0fe6bf0c922b189b6432e5806b42113864

Observation 63d38ca9-b478-4211-b8a6-f42c59864505 · outbound

This paper cites Gemini 3 flash: Frontier intelligence built for speed.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Gemini 3 flash: Frontier intelligence built for speed

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.573634Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.573634Z digest=sha256:774e280995d5f588567acc6cd1cea9999ce349282fe5a9d405220bd4fe53c331

Observation 48a0cfd9-2ac6-4022-827c-ec8aa6ff5455 · outbound

This paper cites Reasoning-aligned perception decoupling for scalable multi-modal reasoning.arXiv preprint arXiv:2506.04559, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Reasoning-aligned perception decoupling for scalable multi-modal reasoning.arXiv preprint arXiv:2506.04559, 2025

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.740933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.740933Z digest=sha256:a1a2e45192d416c891406f83a8bb4189302ef30ed2f6faaa4c766c38033aff76

Observation 7f237cfd-9bb1-40c4-8dac-e41cdfa04ca3 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.820515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.820515Z digest=sha256:99be25917fb83e95a0184df5e9e25aa40874946df418798cddfcff40d38ce1a8

Observation 7d348143-b569-40f7-a0c3-e353909eff4a · outbound

This paper cites Enhanced natural language annotation and query for semantic mapping in visual slam using large language models.Journal of Sustainability, Policy, and Practice, 1(3):131–143, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Enhanced natural language annotation and query for semantic mapping in visual slam using large language models.Journal of Sustainability, Policy, and Practice, 1(3):131–143, 2025

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.905891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.905891Z digest=sha256:8b6924acd8179c6ce872d9d65f4eaf09a9700c605381eaba3ae9a3240f05ffa2

Observation 7e63eb40-1a4e-4c5d-901b-a879d875aed6 · outbound

This paper cites R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:05.988418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:05.988418Z digest=sha256:6fcc4f63957eba7ff7f61d82be56cd63824371e4e3ef2dc41dd3cfe8780a9e03

Observation d8a01f90-674b-4c50-83c2-179dead6ff1c · outbound

This paper cites Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Embodied Web Agents: Bridging Physical-Digital Realms for Integrated Agent Intelligence

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.045958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.045958Z digest=sha256:e3f9b12df8893463f934ca7e3281f7bdb1db8e90534f6f6e0069d924317deb83

Observation 45498371-63d1-448d-8e8e-2cc419fe0ae6 · outbound

This paper cites Vision-language-action models for autonomous driving: Past, present, and future.arXiv preprint arXiv:2512.16760, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Vision-language-action models for autonomous driving: Past, present, and future.arXiv preprint arXiv:2512.16760, 2025

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.127839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.127839Z digest=sha256:bd243a95f3039f02616cef5cf046bc3c9db8f2e43bfba64ef02e138b34bd6ea8

Observation 0c8949ed-4d73-4aa9-8498-8b1d18f9d4a8 · outbound

This paper cites Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379, 2024

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.183096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.183096Z digest=sha256:e120f1771bcfd4ae030791f76ced98a7e937167ba76039dad5d097824ea901c6

Observation 55c7ca74-60f9-4a68-b872-7ce402b8ab7c · outbound

This paper cites Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation.arXiv preprint arXiv:2503.18135, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Mllm-for3d: Adapting multimodal large language model for 3d reasoning segmentation.arXiv preprint arXiv:2503.18135, 2025

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.291848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.291848Z digest=sha256:1f43f632d83a6270951e018a188a52f3aae9aaa8ec59d3c230361d777fbc0af1

Observation 8f09c9d4-b4b3-4248-8fe2-a15307309153 · outbound

This paper cites GPT-4o System Card.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs GPT-4o System Card

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.358912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.358912Z digest=sha256:94c0469e11c522591bd64d19b27d6402c5c301551924df63ade9acd7482e7675

Observation 352c02da-8821-42d0-80a8-3558b13df6f2 · outbound

This paper cites Geobenchx: Benchmarking llms in agent solving multistep geospatial tasks.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Geobenchx: Benchmarking llms in agent solving multistep geospatial tasks

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.432499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.432499Z digest=sha256:4f9972af83edc9326f872d8b1c017ef7494cad8be8ed79a285122409a9645628

Observation d477d8c0-a048-43cf-9752-c1307870ddc2 · outbound

This paper cites MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs MMCode: Benchmarking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.512766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.512766Z digest=sha256:40ac12bbb3635ebc1c91450b5521d4394537480dd68ab5349914fab7a37c9cd5

Observation 0b89fce9-6d2b-4769-a573-665ce850cb80 · outbound

This paper cites Eee-bench: A comprehensive multimodal electrical and electronics engineering benchmark.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Eee-bench: A comprehensive multimodal electrical and electronics engineering benchmark

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.594107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.594107Z digest=sha256:4b9ee97425e933b48b54dc9247d65a1bc0d444b618e0e012da6be87dccc65766

Observation 140f6a16-e8d8-42f4-9429-cb22bec91de2 · outbound

This paper cites MapQA: Open-domain Geospatial Question Answering on Map Data.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs MapQA: Open-domain Geospatial Question Answering on Map Data

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.674087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.674087Z digest=sha256:6457a9dd8a817baaf2843d2fd2f1b0a4626e5265146204493bd6325d3c5826ae

Observation 77845e4a-2fc1-4621-a842-c2d12150f598 · outbound

This paper cites Improved baselines with visual instruction tuning, 2023.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Improved baselines with visual instruction tuning, 2023

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.721453Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.721453Z digest=sha256:c318a9167ec230eb8273634d52d845f02d89513847a09fcb31dfb854a263d5b7

Observation 6dabc6dd-63a6-434f-ab24-e836b93fdf50 · outbound

This paper cites AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.791321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.791321Z digest=sha256:b016317dab6038e49ffb344b2f4520761fc62115ce0750e63f862b65e303960c

Observation 561dd6c1-2514-4dc9-acac-9f48c28a3d4c · outbound

This paper cites Uniugp: Unifying understanding, generation, and planing for end-to-end autonomous driving.arXiv preprint arXiv:2512.09864, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Uniugp: Unifying understanding, generation, and planing for end-to-end autonomous driving.arXiv preprint arXiv:2512.09864, 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.863224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.863224Z digest=sha256:7ad3f3eb16743764c6e09a9bb97edc2f991c3cbede0d4b41697035f2164ee4cf

Observation 09d9ed37-a6a6-44b0-81fc-68960bd9c2ae · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.951391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.951391Z digest=sha256:dc6185b04f4c2fb983323a757798d24c5ab0ed368fd2552b5c47d54c6b37e7c6

Observation fbb0382c-0bd2-476f-99ce-953d3579fe7d · outbound

This paper cites Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:06.971790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:06.971790Z digest=sha256:6c086d99bb68464d68b6d30122924637858eeb8e26743c19b975d1e3217b029e

Observation 8c57d4dc-35b2-44c2-93aa-e22c930bf6b3 · outbound

This paper cites Ovis2.5 Technical Report.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Ovis2.5 Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.080552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.080552Z digest=sha256:1afe2721791d6f0baa0ea81240d9aaefe0b4cde42f812021d8018bc5eca9f718

Observation f5f8ffce-3e0a-4b13-a6cb-a408093d7064 · outbound

This paper cites RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.204123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.204123Z digest=sha256:c2fe88c9e51fdc3e54033c7b8128413d8f67594f034a1d676d2f75594adee6d6

Observation a16e3937-089a-41e4-8dfd-3b9e8afcd7fd · outbound

This paper cites Mc-search: Evaluating and enhancing multimodal agentic search with structured long reasoning chains.arXiv preprint arXiv:2603.00873, 2026.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Mc-search: Evaluating and enhancing multimodal agentic search with structured long reasoning chains.arXiv preprint arXiv:2603.00873, 2026

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.313907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.313907Z digest=sha256:fc22f2f3aa0b7823ed08b7328d57f792e13c20aff060db327967e4946b6ce117

Observation 34669a3f-a63f-467e-a0e9-b7a77e90a910 · outbound

This paper cites OpenAI o1.https://openai.com/o1/, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs OpenAI o1.https://openai.com/o1/, 2024

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.434606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.434606Z digest=sha256:fc21809a5792b81ec658014fcbc240277584b877005063225ffe11fc48325a70

Observation 80ad7055-cc56-4efa-bab0-3f616b8dd603 · outbound

This paper cites Gpt-4.1 model card.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Gpt-4.1 model card

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.511714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.511714Z digest=sha256:a741e8647afbed54f47676dfcefeda79af798ad0b16cbae9f2cf62ad96d36263

Observation e2935462-bcb1-4c41-833d-c5ad38c0e86c · outbound

This paper cites OpenAI o3 and o4-mini System Card.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs OpenAI o3 and o4-mini System Card

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.604304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.604304Z digest=sha256:a78aeeda9a4683e31c2895c591a19d28f9052efe7a7e077797a6eda44ae5298b

Observation d4192d26-e2d5-4d7c-a621-06027986651b · outbound

This paper cites Kosmos-2: Grounding Multimodal Large Language Models to the World.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Kosmos-2: Grounding Multimodal Large Language Models to the World

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.716563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.716563Z digest=sha256:ef1fbd359601b0524b9eac591e86389960eb78b8d72e01cd40715a94301e815a

Observation 9ee2d850-ddef-4416-b9fd-722eeec1b4b2 · outbound

This paper cites Frieda: Benchmarking multi-step cartographic reasoning in vision-language models.arXiv preprint arXiv:2512.08016, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Frieda: Benchmarking multi-step cartographic reasoning in vision-language models.arXiv preprint arXiv:2512.08016, 2025

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.839105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.839105Z digest=sha256:cc0f0174c6d9d3206f4b886e21e7d08343eaa1bf8b9f264f9c00a3c631f94ec5

Observation 762ae906-cfe1-4646-9c74-f618c3b2a733 · outbound

This paper cites Bear: Benchmarking and enhancing multimodal language models for atomic embodied capabilities.arXiv preprint arXiv:2510.08759, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Bear: Benchmarking and enhancing multimodal language models for atomic embodied capabilities.arXiv preprint arXiv:2510.08759, 2025

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:07.960870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:07.960870Z digest=sha256:c9be3d9a6aae92d713e16c93d136f9a8094008dd97b85b950c535fc99fd31028

Observation b825bd79-bdb6-450a-956a-a797a50eaa78 · outbound

This paper cites an unresolved cited work.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.085794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.085794Z digest=sha256:7f7cf4132789582db3b1dd862ff13b97b1128a304467333e13f9fde798a0f291

Observation 9e96874f-a3bc-4662-ac17-b6d6368fe404 · outbound

This paper cites NavBench: Probing Multimodal Large Language Models for Embodied Navigation.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs NavBench: Probing Multimodal Large Language Models for Embodied Navigation

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.208686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.208686Z digest=sha256:f613994079f9709bcf4c1031f3474c9ef18a9c2703ba40c6217ea8631cae5958

Observation 61dcc186-c6f3-47be-a25f-c51523771045 · outbound

This paper cites Urbandrivepathway: A decision-making framework for navigating urban autonomous vehicles in complex traffic systems.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Urbandrivepathway: A decision-making framework for navigating urban autonomous vehicles in complex traffic systems

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.296019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.296019Z digest=sha256:068d20b0774efee9a3265a3e20f277e6cee99cdd2f9990e3f971a9aa9f038d33

Observation 7235af6b-ec94-4326-80c7-96d88d53c2e4 · outbound

This paper cites VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.370312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.370312Z digest=sha256:ef4f9b964f1770e06e7a8e62146a1d878a79b063714ecdafb5f2d990167f18cc

Observation d7845d23-02f4-4a7d-a8cd-988d9a7b39f5 · outbound

This paper cites Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.443131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.443131Z digest=sha256:8feab0f74fbe6e7f8bbcab95617e303b4892da277df1ded1257e8660b1d53469

Observation c506fbf7-a31f-4311-afb1-5275865f18fa · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.546863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.546863Z digest=sha256:fa638306b29dd5f9ff8bb1fc2864350404b427e0d066112b5d7f36bc14c4118c

Observation 4a414d1c-39a0-4d94-b7b5-80a25c6ad6c3 · outbound

This paper cites A survey on the applications of frontier ai, foundation models, and large language models to intelligent transportation systems.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs A survey on the applications of frontier ai, foundation models, and large language models to intelligent transportation systems

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.645001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.645001Z digest=sha256:f09061946c5946b996c14024c23c3e78144d5aa69b0d03305500921a8fba6ead

Observation 2581d5de-67cc-4449-a7b8-f89873a4c55a · outbound

This paper cites ALFWorld: Aligning Text and Embodied Environments for Interactive Learning.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs ALFWorld: Aligning Text and Embodied Environments for Interactive Learning

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.728546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.728546Z digest=sha256:2a64ccbf7bb8cdc0d4fcda9699415541164269dd03631f240601706d92812745

Observation 41f07098-dda3-4401-8034-59dff4d847b6 · outbound

This paper cites Drivelm: Driving with graph visual question answering.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Drivelm: Driving with graph visual question answering

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.813881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.813881Z digest=sha256:e3c48df6159c025970d694f8d1ac2b3ce07f3eae20106aa2d45aca3c8d6c9176

Observation c33ff88e-6a0d-4925-a272-ceeff71401fe · outbound

This paper cites Codedance: A dynamic tool-integrated mllm for executable visual reasoning.arXiv preprint arXiv:2512.17312, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Codedance: A dynamic tool-integrated mllm for executable visual reasoning.arXiv preprint arXiv:2512.17312, 2025

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:08.905820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:08.905820Z digest=sha256:265d4a4eb18f0de632a94eaec0938e7e2c9a81d8719f039d3d6e84195218f28c

Observation 36dc0cea-f4ce-4c15-8b78-2988d4cbaf90 · outbound

This paper cites VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.028700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.028700Z digest=sha256:f6161a359371e9f8a44b0e33bba0bd3841fedd6fd14d0306f9e1f5be1248d919

Observation 9832f600-de36-4fb3-95a5-57e903336dfe · outbound

This paper cites Mapiq: Evaluating multimodal large language models for map question answering.arXiv preprint arXiv:2507.11625, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Mapiq: Evaluating multimodal large language models for map question answering.arXiv preprint arXiv:2507.11625, 2025

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.113094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.113094Z digest=sha256:e3cd0926f2a5a220f8a434e15215bd46afaf3f455e275f378a6d379c550e7586

Observation 58091742-7f94-4278-8ea3-8b59a9a6534a · outbound

This paper cites Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv preprint arXiv:2503.20752, 2025

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.230606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.230606Z digest=sha256:05c95d812c531a6cf9c047d5a954e587e1236c3c489a172c6f44fc4eab13a9ac

Observation 0d802c50-fad7-474d-9cd4-56d2b5cc4d55 · outbound

This paper cites StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.367189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.367189Z digest=sha256:e9f89bcc22ef02199274c3f240bc89333021d5405e6f097b5388f83f99cbf78d

Observation b4975958-faaa-4ba6-8cec-fcc0477fcf8d · outbound

This paper cites Lumine: An open recipe for building generalist agents in 3d open worlds.arXiv preprint arXiv:2511.08892, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Lumine: An open recipe for building generalist agents in 3d open worlds.arXiv preprint arXiv:2511.08892, 2025

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.444665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.444665Z digest=sha256:124ee8afcd1addcef39009e1f60e671b9010af25d00cbb9a98f835fe50496187

Observation a0487b0e-7c7b-4da3-bd64-cf3febce441c · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Gemini: A Family of Highly Capable Multimodal Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.518948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.518948Z digest=sha256:c94b1bea0b67239d00020ee60a6d9fd96c018f33c700ccac635d198809ba5d84

Observation 3d042823-38ec-4a82-96de-2a6eeda89d5d · outbound

This paper cites Kimi-VL Technical Report.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Kimi-VL Technical Report

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.601701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.601701Z digest=sha256:e044810dd9ba51a93f11e065570c5f6a848001744373e921ca555eaa48fba214

Observation ea740d21-64b6-46fe-b3dd-426af8624823 · outbound

This paper cites Cartomapqa: A fundamental benchmark dataset evaluating vision-language models on cartographic map understanding.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Cartomapqa: A fundamental benchmark dataset evaluating vision-language models on cartographic map understanding

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.714549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.714549Z digest=sha256:c5ff6e60f8cb9eacf73a20a2abd186fe5bcfb575fa911a3038c5faa01515c227

Observation 33406bcb-2368-43aa-8241-54b92d751721 · outbound

This paper cites A comprehensive review of path planning algorithms for autonomous navigation.Results in Engineering, page 107750, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs A comprehensive review of path planning algorithms for autonomous navigation.Results in Engineering, page 107750, 2025

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.832561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.832561Z digest=sha256:f7dff4255e560b2ed5e9511cee975afd093082e5a9e3299e29d83a13f4400528

Observation 1826de9c-0425-4fae-8d6a-d6c2f8aa555c · outbound

This paper cites Measuring multimodal mathematical reasoning with math-vision dataset.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Measuring multimodal mathematical reasoning with math-vision dataset

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:09.944398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:09.944398Z digest=sha256:4896d621a4181ec4f5ee1595aaae3f0f1f55dcaa353196f3596257e1f63645f2

Observation 035edf20-8dd3-41d9-9857-dbd78fffe30b · outbound

This paper cites Multi-level symmetric semantic alignment network for image–text matching.Neurocomputing, 599:128082, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Multi-level symmetric semantic alignment network for image–text matching.Neurocomputing, 599:128082, 2024

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.073653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.073653Z digest=sha256:3967bfa788c5038d13715bf438b3f518fe22f7b9c47b8f0bb051b7bce02f7995

Observation 8bf1fa6a-ae1d-4042-8c52-3df0ba6d862e · outbound

This paper cites Perception-Aware Policy Optimization for Multimodal Reasoning.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Perception-Aware Policy Optimization for Multimodal Reasoning

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.239223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.239223Z digest=sha256:5708b9a9403ff9e27110b03ef87906cd7af7b81d940bc5a51f3774dc2706ec4a

Observation 72c85b5d-f702-4d5b-8d40-e856e5f0b5be · outbound

This paper cites Game-tars: Pretrained foundation models for scalable generalist multimodal game agents.arXiv preprint arXiv:2510.23691, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Game-tars: Pretrained foundation models for scalable generalist multimodal game agents.arXiv preprint arXiv:2510.23691, 2025

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.406633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.406633Z digest=sha256:6d7ceb7132f41e9afdd5e3abc2e46356e84161701cc368ad2c757a59afd8a895

Observation b8c44219-c814-4963-8e7b-fff753666ea3 · outbound

This paper cites DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs DiLu: A Knowledge-Driven Approach to Autonomous Driving with Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.532491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.532491Z digest=sha256:a5f596277c991604e7be79d2c053e4c99c725287629a4a31c4a2f209f6a0f740

Observation a818eba7-179f-44a7-8497-899eeaccfe8f · outbound

This paper cites A Survey of Robotic Navigation and Manipulation with Physics Simulators in the Era of Embodied AI.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs A Survey of Robotic Navigation and Manipulation with Physics Simulators in the Era of Embodied AI

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.678551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.678551Z digest=sha256:c04b7ac992354b3211c37a7f619ca82cbd17c9924fce39fd5e95d1df7017316f

Observation 0615f639-c8fa-451f-aa91-ff21b880f49e · outbound

This paper cites SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.803404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.803404Z digest=sha256:4036f5106e6aad1d87129a9cba535ca9e66cd4d94e18a3af7864e98e7e4d874c

Observation 21e896e0-9140-4511-b558-7704a73b85c7 · outbound

This paper cites V*: Guided visual search as a core mechanism in multi- modal llms.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs V*: Guided visual search as a core mechanism in multi- modal llms

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:10.915336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:10.915336Z digest=sha256:1eb73aeb6ced8c9ec1615ef0403d9715af25450fdeff54d891de6e29c9d746b2

Observation c169f84f-97ab-44c8-892c-540897c2a763 · outbound

This paper cites DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.051278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.051278Z digest=sha256:e72f53f1a7d4962ddba9ae276045e1679e318b25e363f5f2080bf658c3c1d2d4

Observation e2ac3779-6808-4d7e-9752-796e5e3bd6b3 · outbound

This paper cites LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.176578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.176578Z digest=sha256:fe925d1e0804f299d1929fe8105c8e01dbcf048c2058c272d57d0f4dde8eeb9e

Observation 1cad9375-d121-48b9-8ed3-a5f7ef3dd87d · outbound

This paper cites Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.292826Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.292826Z digest=sha256:1b1960baa4c25d597b95b5314d00741a403bc8fbac35db1e52defd6f6b491bae

Observation c2d14b2a-e6c5-4596-9bcd-7dfccb1eff87 · outbound

This paper cites Can Large Vision Language Models Read Maps Like a Human?.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Can Large Vision Language Models Read Maps Like a Human?

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.432989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.432989Z digest=sha256:fa6da9d63076418737c8363164a19ec498362712ea3524f0285c765312e7a7fa

Observation 2cf87a76-6b03-4093-8110-adb4e5a2f468 · outbound

This paper cites Geonav: Empowering mllms with explicit geospatial reasoning abilities for language-goal aerial navigation.arXiv preprint arXiv:2504.09587, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Geonav: Empowering mllms with explicit geospatial reasoning abilities for language-goal aerial navigation.arXiv preprint arXiv:2504.09587, 2025

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.575622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.575622Z digest=sha256:06f96ffaa3a3fc2bbfe8bdf9cbb98cd6ef8f2b111d39af2e1b45642ba8a41800

Observation 38e9c3f6-cde0-4fe3-bd2b-5fc5105dc20e · outbound

This paper cites VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.584146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.584146Z digest=sha256:11120b28d392b9b9d0e870db5f22f5a19a08a2b2147fbb9c5a53320ca466dd62

Observation 2b6ad6f1-1988-42f0-867e-11a1b2cb2d8f · outbound

This paper cites Flame: Learning to navigate with multimodal llm in urban environments.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Flame: Learning to navigate with multimodal llm in urban environments

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.645653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.645653Z digest=sha256:fce9ce0e1ff894473f93ccba31af96eeb9e6040b0985a30163094cb8bbdff433

Observation 276ca3fe-559f-4c33-89e5-a01dffb70474 · outbound

This paper cites A survey of sustainable development of intelligent transportation system based on urban travel demand.Development, 2(1):2399, 2024.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs A survey of sustainable development of intelligent transportation system based on urban travel demand.Development, 2(1):2399, 2024

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.752284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.752284Z digest=sha256:4fbf8fbfdc67169362da117e865f99ce735b5902566887278e2d06f5fcabfc86

Observation 3a4c1508-cbfe-4c6d-bdc7-f28ea50faec0 · outbound

This paper cites Thinking in space: How multimodal large language models see, remember, and recall spaces.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Thinking in space: How multimodal large language models see, remember, and recall spaces

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:11.838420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:11.838420Z digest=sha256:67f4acc93c64df817e3bc75eef9d5a1f95b7cbcafcef12770f7b29ca2f024831

Observation e8579d2d-49ba-4eb7-b5a9-329f5edd818a · outbound

This paper cites EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.003747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.003747Z digest=sha256:c1fea51caa372684cfdbd3640b394caf08923c42b2aa8aa21112135b06ac46e9

Observation 543b561f-495d-4977-859b-b72bcfeaded6 · outbound

This paper cites MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs MathGLM-Vision: Solving Mathematical Problems with Multi-Modal Large Language Model

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.193820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.193820Z digest=sha256:e1d6d884f11a01d83e6b8aafa323914cce514327d4a2c08cc5c5ecdac5cf5f82

Observation c216e41a-b8b9-4edf-82b9-fc812a1cafb9 · outbound

This paper cites Understand- ing the repeat curse in large language models from a feature perspective.arXiv preprint arXiv:2504.14218, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Understand- ing the repeat curse in large language models from a feature perspective.arXiv preprint arXiv:2504.14218, 2025

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.366069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.366069Z digest=sha256:ab7ee7d96c463b32018769a83fe52960609e38f6d97abd226d319cfcafd63de7

Observation a4c568c9-e89a-41c1-a8cb-cf661c034227 · outbound

This paper cites What you see is what you read? improving text-image alignment evaluation.Advances in Neural Information Processing Systems, 36:1601–1619, 2023.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs What you see is what you read? improving text-image alignment evaluation.Advances in Neural Information Processing Systems, 36:1601–1619, 2023

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.544586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.544586Z digest=sha256:0b0bd567753fc50b673a083244baf3d9a505b058473e8722a091d5ca499e4191

Observation f19d2e7b-d5e3-4403-a4dc-f0baa4491e32 · outbound

This paper cites Introducing Visual Perception Token into Multimodal Large Language Model.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Introducing Visual Perception Token into Multimodal Large Language Model

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.709967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.709967Z digest=sha256:b1ef88da35b201a2f4c21832035f026f8cf096e9c26051e995aa9e25f9554b05

Observation df1d12bf-0b7e-4f0f-b9b6-b36b9bd33e48 · outbound

This paper cites Gsm8k-v: Can vision language models solve grade school math word problems in visual contexts.arXiv preprint arXiv:2509.25160, 2025.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Gsm8k-v: Can vision language models solve grade school math word problems in visual contexts.arXiv preprint arXiv:2509.25160, 2025

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:12.918139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:12.918139Z digest=sha256:80db8c96c6f881b4590eca65955e4faae8e841ecb243f3d9715836a14f905ff6

Observation 7c36f1bc-1a70-4b36-9e86-5f4b87a0857e · outbound

This paper cites Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:13.159131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:13.159131Z digest=sha256:c008dab4a9f7e06adede521ff7318c129c0a9a0fbe7f7f88f9cfbaf3cd573c28

Observation fdb6dc83-d920-42a8-8bdc-bd457d35aca7 · outbound

This paper cites Instruction-augmented multimodal alignment for image-text and element matching.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Instruction-augmented multimodal alignment for image-text and element matching

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:13.408609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:13.408609Z digest=sha256:3a7725a257137b75f85bffa1ef3518196acd0e3821df6deab29f41280047725e

Observation 86820087-3c4b-4c81-b188-6b4e368fd2f6 · outbound

This paper cites Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:13.636042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:13.636042Z digest=sha256:3909c44ed0d97af66eca1db0a904546dfe04ae99966f73d62d4142eb61d06764

Observation 6e32a0b0-e437-430c-b73f-cb9f38343f12 · outbound

This paper cites OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:13.802598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:13.802598Z digest=sha256:e0058f0b9d6c9d4f45e3db772fc6814e248ab994260f92ae7247996f108a561d

Observation 19ceb54c-3958-4e88-af33-f3976542382c · outbound

This paper cites Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186.

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-02T22:00:13.891720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T22:00:13.891720Z digest=sha256:48f11bd8365ad8f5385e4f20e07e94798ca55d21331a306e653a45e825844e65

Pith citing papers

Observation 59bb7911-6bb9-4cbc-a51f-48a6c4e5425e · inbound

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models cites this paper.

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-05-10T23:00:47.620002Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-10T19:26:23.660206Z digest=sha256:32ac68b54bb640d77bc4d3129f6ef7e00c0db05cff1c3f76ffd24927078417bc

Observation 570a44d3-e969-4c5b-ad08-00d117a45101 · inbound

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ? cites this paper.

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ? MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-04T08:39:42.501661Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T11:07:50.534593Z digest=sha256:dce7dfb23d79e1148f1431c0e879b71e03f819fa46fe557c83539deb79cbf0b8

Observation b7641b32-c2c3-4da9-b257-69e33e6c7157 · inbound

InSight-doc: Agentic Visual Perception for Long-Document Understanding cites this paper.

InSight-doc: Agentic Visual Perception for Long-Document Understanding MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T20:43:51.464398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:43:51.464398Z digest=sha256:101f85332cb6ce75f89819ca52bbd3dfc0569a4c27958eabdfc9ba9dc03be627