Pith. sign in

Paper Citation Record · LEDGER

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

As of 20 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2607.20868.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.20868 v1

Coverage vector

measured 93 of 93 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-01T09:09:24.905094Z

measured 93 of 93 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

93 of 93 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved92
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8125c7ac-7cdf-4e38-9344-8fc03592cdb2 · outbound

This paper cites Anthropic Model System Cards,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Anthropic Model System Cards,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.663697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.663697Z digest=sha256:cddd9d04e159231cbf146f8e79243ea6432322bb23e790d2ba3154c37d567a8f

Observation 66b3c9d1-5eac-4fcc-b675-245d1353e068 · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.668129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.668129Z digest=sha256:a51e94f3ce951531889da4bb5169677f9909f4a771435fb3414126587121ef44

Observation c603d0e4-fa8f-48d3-91b0-3c234ede0cbd · outbound

This paper cites Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.671372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.671372Z digest=sha256:f837c9c159bc8cc92f6c95dd363f66ab102d4e22222a13fa9790578a396ac7bf

Observation 0dfb85d0-7dcb-4255-b922-e76af0dfe948 · outbound

This paper cites MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MATHVERSE: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.674212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.674212Z digest=sha256:ac420f034d868c8b33871114ca455872911e9dd48c5c828f5a457b27b5f18a61

Observation d3a52870-9495-4760-80a0-20d6d78dfc39 · outbound

This paper cites MMCode: Bench- marking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MMCode: Bench- marking Multimodal Large Language Models for Code Generation with Visually Rich Programming Problems,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.677053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.677053Z digest=sha256:4e028ff024afa402a8d170ceff302c838788768552e43bb33318e91da3e3a4c7

Observation 6f30c3b6-0f4a-439d-ae62-4ba10ff86033 · outbound

This paper cites Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.679870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.679870Z digest=sha256:736f064d0a19f8dbabc5d6596adc9c2c013adbb89dd7fd68e2cf2a0ac5619abd

Observation 2e42d47d-a9aa-425d-bbe5-8ce38f1520ea · outbound

This paper cites Emu3: Next-Token Prediction is All You Need.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Emu3: Next-Token Prediction is All You Need

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.683051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.683051Z digest=sha256:dcf6cd7401abd6f111da722114d15593408e3951eb4b1899823b1442bc45f924

Observation 1a587680-5cd6-4e9a-ab65-1ac8f160b1f8 · outbound

This paper cites NExT-GPT: Any-to-Any Multimodal LLM,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? NExT-GPT: Any-to-Any Multimodal LLM,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.686490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.686490Z digest=sha256:40a3ff1047d9e6d797c4dc51aecfebcea8635eb1049d013c39c8cd4d9ba5f71b

Observation b646d324-077b-4ef7-bf9e-3076e5feab10 · outbound

This paper cites MiniGPT-5: Interleaved Vision- and-Language Generation via Generative V okens,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MiniGPT-5: Interleaved Vision- and-Language Generation via Generative V okens,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.689064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.689064Z digest=sha256:9d33331e7699450bff1f08b52ec3765bd406d5f06aef8e98930c2aae01a0ccd6

Observation e092185f-4012-463c-8ad9-5caf242f27f1 · outbound

This paper cites Introducing GPT-5,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Introducing GPT-5,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.692319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.692319Z digest=sha256:bf80468df97d5ec74f4e20f02e540a1c02441fe0d0dbdab8770f01ab4757ce2e

Observation d5414616-3fa1-4111-81e7-c2254d124fb8 · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.694712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.694712Z digest=sha256:ce57dbfd94180c0fd065354e0d993e5e4c8c8bdfc2d261277a3f062432504da6

Observation 4a219f89-569b-4bcb-983f-01c58090da0d · outbound

This paper cites Gemini Achieves Gold-Medal Level at the Interna- tional Collegiate Programming Contest World Finals,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Gemini Achieves Gold-Medal Level at the Interna- tional Collegiate Programming Contest World Finals,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.697578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.697578Z digest=sha256:d73eadfd29a4ab2c611a0d78e98d4a22d1f85adf34c2e6fe4f138d88bc4d59b5

Observation 999c13da-e07a-4e30-886b-2152ef9bb75c · outbound

This paper cites LMDrive: Closed-Loop End-to-End Driving with Large Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LMDrive: Closed-Loop End-to-End Driving with Large Language Models,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.699983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.699983Z digest=sha256:cd52596b10ccada168afd37abed482711c07aebda919370474b3f07b503b4728

Observation 88ca3259-f664-4575-9707-708e924734c5 · outbound

This paper cites DriveLM: Driving with Graph Visual Question Answering,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? DriveLM: Driving with Graph Visual Question Answering,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.702398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.702398Z digest=sha256:a9f4096e5fc5d74a6a9f3bb396175c5d262accf84e22aeea8cf8749c618a507a

Observation 875c0729-2bc9-4309-8560-39c395827fa0 · outbound

This paper cites DriveGPT4: Interpretable End-to-End Autonomous Driving Via Large Language Model,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? DriveGPT4: Interpretable End-to-End Autonomous Driving Via Large Language Model,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.704882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.704882Z digest=sha256:dcf9c83c62e53050c121876511a9dea08de17ed730f9d8c746a88a8739950880

Observation ff14f369-bb9d-4d3e-a525-eefa7817b933 · outbound

This paper cites OpenVLA: An Open-Source Vision-Language-Action Model.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? OpenVLA: An Open-Source Vision-Language-Action Model

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.707452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.707452Z digest=sha256:89d51fa7aa83595d30f31ca652a5ce7e80462231d409e29c064387a95fe3a369

Observation a1097f00-afa0-4748-85b3-b4a86d71b181 · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.710169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.710169Z digest=sha256:23d94cd040b0b91a822966306511d373d50af2ff908a7cfd1299e61a611e63d4

Observation 932ca2e5-c28f-44e2-9e9a-d088986d966d · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.713143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.713143Z digest=sha256:67f15e2481078eb09e4937e23bae12135ea7d074b8315f345943913585e20ad6

Observation e0694721-20aa-4bcc-82a2-4ce2beb7384d · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? PaLM-E: An Embodied Multimodal Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.716271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.716271Z digest=sha256:7629fbcdfee489b79da1ba1cb640769a104e0935b5ff1b24424a3dfb1d5ec8b0

Observation 41ae75f9-3ea0-4dc3-96ab-dfaa6c831990 · outbound

This paper cites OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.719792Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.719792Z digest=sha256:e202ec883ae34316882702e8a191a85e70113e0b82526ec9f45cfc02763a98e9

Observation 50629123-22f8-4624-bc15-ab6f08732a88 · outbound

This paper cites MMSI-Video-Bench: A Holistic Benchmark for Video- Based Spatial Intelligence,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MMSI-Video-Bench: A Holistic Benchmark for Video- Based Spatial Intelligence,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.722330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.722330Z digest=sha256:753ae1e505555b8b9bc655ee7f2a0ba6659c21da9c246cba26263147126970f6

Observation 6f47daa6-4eac-4045-8d67-766dd6457b75 · outbound

This paper cites SpaceR: Reinforcing MLLMs in Video Spatial Reasoning.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.724789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.724789Z digest=sha256:b73911c14a2548d0dde946db8992f71a3282d3d131dd2e2e44927d456074ac3a

Observation 2e2a0d0c-1278-4573-9d1d-47c318a0ba71 · outbound

This paper cites Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.727867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.727867Z digest=sha256:eaa719d140e6d296d5bca4ed1bb056275565b7d99ac5d208da845e54a9a9fc35

Observation 681bffab-3e86-480f-b187-6841f26bc275 · outbound

This paper cites Cambrian-S: Towards Spatial Supersensing in Video,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Cambrian-S: Towards Spatial Supersensing in Video,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.730202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.730202Z digest=sha256:3085a15274a9582b5a56defa3636d8bb4dfa511ce8c8746bb5b07ed40d2c2671

Observation cbff37c7-3f65-47ca-ad89-4b8ee1f4dc27 · outbound

This paper cites From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.733000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.733000Z digest=sha256:6e7a0e12550b3a248b4835bcf569ea3250d2c88b609dd43793cd47a6e6950cd9

Observation c46b15c0-31fe-4bbf-8168-4f84d3b93821 · outbound

This paper cites Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.735966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.735966Z digest=sha256:8d4b1d1ff1298a6da8bae8c97095d357028987d66a8e7644d8bdf6296d8033cc

Observation e0fc3fc2-9ee6-46d0-b1ba-665cc9a35428 · outbound

This paper cites STI- Bench: Are MLLMs Ready for Precise Spatial-Temporal World Under- standing?.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? STI- Bench: Are MLLMs Ready for Precise Spatial-Temporal World Under- standing?

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.738778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.738778Z digest=sha256:838f2aa0a3af9d25cec098579067f14af61cb6c11c11165d979fe26e76cc64bf

Observation e7d91ab7-bc77-41c4-9f5b-7740f17bfe69 · outbound

This paper cites OST- Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? OST- Bench: Evaluating the Capabilities of MLLMs in Online Spatio-temporal Scene Understanding,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.741574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.741574Z digest=sha256:eb2afec28a49af730ae365131425744870551985ff84da1864a2274597e7f72b

Observation 8e438968-41c0-4e76-87c2-3143e44f20e1 · outbound

This paper cites VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.743929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.743929Z digest=sha256:451682bd62159cea5c9a770fde6119ab2990f71228b8abc5ea56445edfe3d4ca

Observation 99fcb42e-2cd8-47a6-8527-7d5036bf4f43 · outbound

This paper cites MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.746577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.746577Z digest=sha256:575827083aa50678eba1b7f56dfdb62173eaaa91974c5654a31149f4ef21ed9f

Observation 632c029d-ae40-4b0a-9287-5be632dd2d34 · outbound

This paper cites DSI-Bench: A Benchmark for Dynamic Spatial Intelligence,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? DSI-Bench: A Benchmark for Dynamic Spatial Intelligence,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.748874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.748874Z digest=sha256:9bfd7f6f75ec6a9a439367a64afd71165ffc29263de841c4bf6497ced5029503

Observation 4f25c53d-8930-4d28-90c6-36fd72a12aaa · outbound

This paper cites Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.751284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.751284Z digest=sha256:853ad5b7c95c5b2abd2bf53687e0a22892bdd08b327b73af6fb5de57db5b6d37

Observation 23a937fd-b478-45b6-9168-acefdddd79b4 · outbound

This paper cites VLM4D: Towards Spatiotemporal Awareness in Vision Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VLM4D: Towards Spatiotemporal Awareness in Vision Language Models,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.753671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.753671Z digest=sha256:96e4d04c752ad626a60c9b2a0d3523b7ba9ec99c305d8a44c25e55493735338f

Observation 6c921455-a00c-4eda-9ec9-2b29bf2ca76c · outbound

This paper cites Ego4D: Around the World in 3,000 Hours of Egocentric Video,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Ego4D: Around the World in 3,000 Hours of Egocentric Video,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.756395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.756395Z digest=sha256:05463be8cdb84a835c60b39d3e1d94a9f057880c521f776a42d5245e786859cf

Observation d5a9cd58-b35e-4787-b9ea-d3a24d45bd36 · outbound

This paper cites ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.759041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.759041Z digest=sha256:3f1bb0d250331bf36691ec6a1ff8a4b85ffd1e6790ec746b57eb2d11296b9de2

Observation dbee15b2-dffa-44e3-8b21-9ed07d5187f3 · outbound

This paper cites ScanNet++: A High- Fidelity Dataset of 3D Indoor Scenes,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? ScanNet++: A High- Fidelity Dataset of 3D Indoor Scenes,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.761354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.761354Z digest=sha256:6276849df64fd55f3bca1f7849c080a5389cc3e373642266079041aee3f150a6

Observation 6cc901f7-7838-409d-9765-20db563219af · outbound

This paper cites ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.763704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.763704Z digest=sha256:96a22b14c1a3da7369a9015360473a93611d8d639b78bac1a7e4bf33e1c203e6

Observation 8ced9224-8fc2-47cb-ac81-07854632bd49 · outbound

This paper cites Scalability in Perception for Autonomous Driving: Waymo Open Dataset,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Scalability in Perception for Autonomous Driving: Waymo Open Dataset,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.766167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.766167Z digest=sha256:6c5b7d6e81989a0db1ab8ad3d632dad037900012ee08a6ef75ee33767233f133

Observation e4bb028a-ca57-4dee-b0d1-c42c7325a144 · outbound

This paper cites Motion-X: A Large-scale 3D Expressive Whole-body Human Motion Dataset,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Motion-X: A Large-scale 3D Expressive Whole-body Human Motion Dataset,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.768553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.768553Z digest=sha256:44c41b4f3772cc0f20fe8d2601ce747def52fb6f6fcc1eaac69510052dc58e66

Observation 92f9d890-4491-4575-89c3-834484b10ef8 · outbound

This paper cites OpenAI GPT-5 System Card.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? OpenAI GPT-5 System Card

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.770874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.770874Z digest=sha256:367d54f389d52361175d4b440bc0fe402122c9be64cce1455ea459b8e1a75ae9

Observation 247ccc9a-97cb-43c8-9e23-f0a745cc11c3 · outbound

This paper cites Google DeepMind Model Cards,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Google DeepMind Model Cards,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.773584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.773584Z digest=sha256:346b415263df775aa09505845c0603a127c768cdf07cb6249f4dc7cca3a051cb

Observation 98f70b11-33f6-48ac-a5db-a7d93346b331 · outbound

This paper cites Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.776046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.776046Z digest=sha256:0e5d004dad0a0e9f16418a33661f49e78dd62a7144678d342174532ce98e43ee

Observation 337004c1-8c65-4208-9792-2559028c0d95 · outbound

This paper cites Xiaomi MiMo-V2.5: A Leap in Agency and Multimodality,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Xiaomi MiMo-V2.5: A Leap in Agency and Multimodality,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.778427Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.778427Z digest=sha256:c8e596941976e7ad63a01c741303b73cb38ba912af96f9c7397aaed24084accc

Observation 33d380a1-a1f7-4aa6-9722-3a6bf90d670d · outbound

This paper cites LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.780739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.780739Z digest=sha256:225f9c6ab4fc888df5c4ac936379949834cae72da0111caa9870568c8c070f8f

Observation 4cf4b523-2e5a-4b0e-936b-6018b2bd5414 · outbound

This paper cites Qwen3.5: Towards Native Multimodal Agents,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Qwen3.5: Towards Native Multimodal Agents,

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.783278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.783278Z digest=sha256:20c0222fd052ffefdfd050b5deb3b577191c6f78758d3035555b06d454f926ff

Observation 6455fee5-e63b-46c8-9063-9e292c0667d1 · outbound

This paper cites InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.785627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.785627Z digest=sha256:5b44c2708da95a1514c562931da3b3c654861e9973ac70fb7f085599a1ef69c2

Observation 5da3ae93-117f-48fa-aaf2-e6e92ac16acb · outbound

This paper cites GLM-4.6V: Open Source Multimodal Models with Native Multi- modal Tool Use,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? GLM-4.6V: Open Source Multimodal Models with Native Multi- modal Tool Use,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.788197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.788197Z digest=sha256:45b9fe59466a493c173579dcb0d38c2e0e5db42f367e04429cc476f4c492cab4

Observation 5e90f630-c0bb-4991-b1e6-85310d822e28 · outbound

This paper cites Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.790764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.790764Z digest=sha256:ee49020803029b4f572e1fdf81a77d4934376835af300d9bd0a01143090af867

Observation c77c7cc0-872d-45d2-ba58-5634e812fa33 · outbound

This paper cites Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.792992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.792992Z digest=sha256:9bbddb62f6cd1e41581ce7b12b66643dc4b4ec64b5e7737a04034793e1f07511

Observation 4cfc4348-ae37-4563-81a8-274ba30d4094 · outbound

This paper cites Spatial-SSRL: Enhancing Spatial Understanding via Self- Supervised Reinforcement Learning,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Spatial-SSRL: Enhancing Spatial Understanding via Self- Supervised Reinforcement Learning,

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.795701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.795701Z digest=sha256:e6258d06bb2862a3912363a099d3dae27d0bc876f80eb05ac30fe1e3858fdf24

Observation b84a6140-9ecb-4bcc-9046-4edac70496b4 · outbound

This paper cites Thinking with Geometry: Active Geometry Integration for Spatial Reasoning.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.798206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.798206Z digest=sha256:1282de07e19d04b7b2f76bc8b51b5368127c1aa3705f5ea8270ba219e7328af8

Observation 03be65a3-aa7f-4204-8ec4-665c49ad8588 · outbound

This paper cites SEED-Bench: Benchmarking Multimodal Large Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SEED-Bench: Benchmarking Multimodal Large Language Models,

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.800745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.800745Z digest=sha256:455fd5e8c676b54e358c29032d872c113334ec72c8f6001b871ce112bb168d88

Observation 89616508-088f-4ae6-90f7-2d7ae391846a · outbound

This paper cites MMBench: Is Your Multi-modal Model an All- around Player?.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MMBench: Is Your Multi-modal Model an All- around Player?

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.803050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.803050Z digest=sha256:188ca79a8c6c2476938f55b677c47d6aa1bc2bf25f5c2bbc8aa03cbdb8b0ca43

Observation 6948210e-ade8-4669-bdde-8e30be83d835 · outbound

This paper cites MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.805758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.805758Z digest=sha256:e261f8acda41cc63f3a76ce6f71d3481758ed39482f95ebcf38828e39494c729

Observation e166ab93-87c6-4c3b-b29e-a20fccb9a6a4 · outbound

This paper cites MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.808032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.808032Z digest=sha256:f41f11bcb6dcae3e281b21cf832647c6fe12baa1715bfa157e6815da5796098c

Observation 13d929df-7a87-4e2f-be7f-833a94d8cddd · outbound

This paper cites MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.810555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.810555Z digest=sha256:a70da8f8072d6e9b3e29aae0c577d25e68a3277794a9f6bc9c9cb4b0125ce641

Observation fb8d6b51-583c-4c71-aee1-e45228e295bc · outbound

This paper cites Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.813414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.813414Z digest=sha256:6f1c71b6b08d297886ab107567d6212dad93683193f8703325cb44982bae3ce6

Observation b6d05bc6-eccd-48a7-b2a8-d7b69db06a4e · outbound

This paper cites MVBench: A Comprehensive Multi-modal Video Understanding Benchmark,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MVBench: A Comprehensive Multi-modal Video Understanding Benchmark,

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.816253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.816253Z digest=sha256:93315cb8e6e9ee81996f990c8ee19801167f588fa5b0fc82667103b68df7350e

Observation e41dc602-b913-4dbb-9eb1-9da3df568b13 · outbound

This paper cites VI- TATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VI- TATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.818649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.818649Z digest=sha256:663ddfdc9e41ca858675258bf5932d90b6ab8456f51cd76415ee1d2c0c1e6fae

Observation 524bb6cc-c8cd-42aa-b39e-26b785af56bb · outbound

This paper cites Multi-modal Situated Reasoning in 3D Scenes,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Multi-modal Situated Reasoning in 3D Scenes,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.820974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.820974Z digest=sha256:6f7143a4dffeea56b370880399d3f6aeb4c3efa670381309a0717e4a3bdb2719

Observation 0bd3159b-4ab0-4644-8bd1-b6ce4ab685b2 · outbound

This paper cites TempCompass: Do Video LLMs Really Understand Videos?.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? TempCompass: Do Video LLMs Really Understand Videos?

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.823535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.823535Z digest=sha256:20215c7cabeaffdaefffb34401f6bb6444a90984cd692e05f37f04eb66bd106a

Observation 5d18da41-9fde-47ab-9a22-e8f88c443101 · outbound

This paper cites OpenEQA: Embodied Question Answering in the Era of Foundation Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? OpenEQA: Embodied Question Answering in the Era of Foundation Models,

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.825795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.825795Z digest=sha256:b52176b54b40956dea9ce1a02902614ae0bf127704a3e4f0d5b45895a32b6377

Observation fde51b8d-79f0-4ace-81d5-51ad129d2d86 · outbound

This paper cites EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding,

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.828521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.828521Z digest=sha256:46005055c3671d1875892163331b72311e9b12472c0af28fcf28671ac2443515

Observation e8dde046-2a09-4779-9adc-afc15e2487f4 · outbound

This paper cites Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models,

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.830810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.830810Z digest=sha256:4fa1c8e57da95dc1cb25baaadd5b39f49c0bff0a37b60918029653ebf47ff5da

Observation 2a345f21-38be-4288-af8b-a5b1c96cb446 · outbound

This paper cites TOMATO: Assessing Visual Temporal Reasoning Capabili- ties in Multimodal Foundation Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? TOMATO: Assessing Visual Temporal Reasoning Capabili- ties in Multimodal Foundation Models,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.833173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.833173Z digest=sha256:d6ba137cef9f84a24da7553392bbb159cc170ef52c94153193fac8c3e3f67dcb

Observation ff9858ce-15bf-4eb1-aa57-f8cfb0b83e54 · outbound

This paper cites Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for 14 Vision Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for 14 Vision Language Models,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.835897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.835897Z digest=sha256:52caae03e74f3ae817c4daa3a5571b4cc811a26690e32838c1bc54014d742baa

Observation 6551dddb-c522-45a8-9185-daaba9d91f10 · outbound

This paper cites MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.838563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.838563Z digest=sha256:7729504f537c829f54e249f9bbab07a0449aed2d402d4e1de67496bf4c6d59ec

Observation 8de799c9-32c9-4146-a16d-4d1b0ec32444 · outbound

This paper cites LongVILA: Scaling Long-Context Visual Language Models for Long Videos.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LongVILA: Scaling Long-Context Visual Language Models for Long Videos

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.840911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.840911Z digest=sha256:462bb6c33c47b300be6e799f6649dca59fd601c01def3bd8a91e0c2ad84014bb

Observation 39dce1a1-745c-4a50-b46d-6c43222b2287 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LLaVA-OneVision: Easy Visual Task Transfer

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.843366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.843366Z digest=sha256:f965ab7c2c58822063fcbe0318ca2b42dae20be15d313163c6431ea77364be8c

Observation 882ebf22-81cb-44cd-b186-957cea2eff66 · outbound

This paper cites VILA: On Pre-training for Visual Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VILA: On Pre-training for Visual Language Models,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.845806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.845806Z digest=sha256:48809904d8b2392e3551e5fb7e1c19340649e2b6ab9b6e3b22fab5d6e66cc971

Observation 883af380-5307-4f7e-ab65-3a07c3726633 · outbound

This paper cites Long Context Transfer from Language to Vision.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Long Context Transfer from Language to Vision

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.848120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.848120Z digest=sha256:5a795ec759ab38b1d0960b8c8c35f6778c051d0a8a8dc2c21677dc426f156027

Observation 9a87c986-facc-45bf-96c2-e2730d1a1934 · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.850709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.850709Z digest=sha256:106528a16d51be8b99d3a961acb06b4b14b8cab69c65c909022dabe690fdb07e

Observation d42219e3-3d23-455c-a964-dfce1e82254e · outbound

This paper cites SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities,

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.853411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.853411Z digest=sha256:1741ba9229beacaee7bdc911d71444308f3ec35d2c461c4735083596af16fd26

Observation b57eb1c8-c706-43c6-9117-8cb5704b1a7c · outbound

This paper cites VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.856306Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.856306Z digest=sha256:d742f8486330210b28721482f9771d93db840b3bb5425fccbd792b917ac3a930

Observation 6e38d04a-b57f-4306-9cc8-c17f46773ee0 · outbound

This paper cites 3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? 3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.859084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.859084Z digest=sha256:ff8d78dcc057b0d8eef8bb279a05d6a4f1a0928fcadc1119e9e586355c16086e

Observation 743219f6-c244-41e2-8a38-3154353896ba · outbound

This paper cites SpatialLadder: Progressive Training for Spatial Rea- soning in Vision-Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SpatialLadder: Progressive Training for Spatial Rea- soning in Vision-Language Models,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.861575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.861575Z digest=sha256:1cfa02fb6dc29627c234104a22318ae2b8f261b7e9e755ab7d7e6cc313bad24c

Observation ddc2f67e-6117-4bc4-8b82-5fb77958e9ed · outbound

This paper cites SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.863958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.863958Z digest=sha256:e21319c8f8a9ffa0256628b771259e8637bd7582bf6a0bc6f6f75a910d895f1f

Observation 14b0b770-7908-4719-8dff-ecf4885d6455 · outbound

This paper cites SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation,

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.866486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.866486Z digest=sha256:b0eb46f9751497c1ef976ddc111a0c99ec47a275fba2178b87749f4982d75bbf

Observation e93bd3a3-2d60-4ff0-b19f-c9060cbf3e57 · outbound

This paper cites Visual Spatial Tuning,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Visual Spatial Tuning,

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.869265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.869265Z digest=sha256:d896cae8623a6a18212943f930c75e10ff5e0616a169034485bdd85ef3ff5f7c

Observation 33160b22-2cbc-44e1-8997-73fbb7384a94 · outbound

This paper cites Make Geometry Matter for Spatial Reasoning,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Make Geometry Matter for Spatial Reasoning,

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.872032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.872032Z digest=sha256:6308ac297fc318bf30aa0fc650bacbb818e3adf23d89dbd02a75dc3b705696c6

Observation 3e848a5f-55d4-489b-aa0f-50fabea23b58 · outbound

This paper cites Think3D: Thinking with Space for Spatial Reasoning,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Think3D: Thinking with Space for Spatial Reasoning,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.874635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.874635Z digest=sha256:6f2749dfeff46c3726142e5e1881469551b6b6c29dc0b34aaf847bddd3f29899

Observation 8fd70c46-7875-4f27-8e60-647ad55a4dc6 · outbound

This paper cites LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.877243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.877243Z digest=sha256:0b912daa612383065e5ebf718b0774230c2aceb509d1e45bf56f51202b2a6e4e

Observation 580c64bb-00ed-4e6d-ab08-d8e487189a6d · outbound

This paper cites LLaV A-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? LLaV A-4D: Embedding SpatioTemporal Prompt into LMMs for 4D Scene Understanding,

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.880262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.880262Z digest=sha256:315ec49e6d62045e9914051cc6d0ca5b1a7d40686d8bd81d2af67d563de4084a

Observation bb0b883b-ef1c-4982-a3ad-26960e6d9e7e · outbound

This paper cites Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Uni4D-LLM: A Unified SpatioTemporal-Aware VLM for 4D Understanding and Generation,

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.882646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.882646Z digest=sha256:3b31e12ac92264ed6910cccf5aabff98cbf61456b7931fe08ed25dee9251a8d7

Observation 280bde41-c338-4562-a0c0-b2dcfa96dfbf · outbound

This paper cites Intern-S1: A Scientific Multimodal Foundation Model,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Intern-S1: A Scientific Multimodal Foundation Model,

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.885007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.885007Z digest=sha256:9cc1221434ce66ad1a9e880a27e070fef1f638e45fc4519f5b9a8f915ac5fb0a

Observation 9a91b1af-aaaa-408e-9f59-3c47bbe65175 · outbound

This paper cites Intern-S1-Pro: Sci- entific Multimodal Foundation Model at Trillion Scale,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Intern-S1-Pro: Sci- entific Multimodal Foundation Model at Trillion Scale,

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.887384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.887384Z digest=sha256:5fefd38bb0e6c9ec24a06a94d19a1956c94046e76f03a7259e193811196759d3

Observation 0c89f018-dcca-4964-a10f-5587d10da16c · outbound

This paper cites Large Language Models are Zero-Shot Reasoners,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Large Language Models are Zero-Shot Reasoners,

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.889889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.889889Z digest=sha256:394e945f153e947335e27a81b5c232055185be03aa18add5925f4ed80e36b193

Observation 587cae99-1559-4369-96cb-9b89e10aceaa · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.892212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.892212Z digest=sha256:a48877d58e8cfec554834b7e76082d4e4baf7e92f5ba9798f4f5bc4ac1d530f9

Observation 3c507d2f-5628-4032-8526-de369a708b92 · outbound

This paper cites Plan-and-Solve Prompting: Improving Zero-Shot Chain-of- Thought Reasoning by Large Language Models,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Plan-and-Solve Prompting: Improving Zero-Shot Chain-of- Thought Reasoning by Large Language Models,

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.894758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.894758Z digest=sha256:b9e34e35b0c9a75c98a752c191b581834ca6e649414b5438c65a8e3202061e68

Observation 1b23c6ca-48b5-4ef3-9cc8-b2fafe368bfb · outbound

This paper cites VGGT-$\Omega$.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? VGGT-$\Omega$

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.897251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.897251Z digest=sha256:fbbf09e6a445ff2a796027be308076a15596ddb0571ffc46f4b36251edf84cc6

Observation c94e877c-cabd-403b-8e2a-0c82c5592813 · outbound

This paper cites W AFT: Warping-Alone Field Transforms for Optical Flow,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? W AFT: Warping-Alone Field Transforms for Optical Flow,

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.900080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.900080Z digest=sha256:7a56e3a085109b8cc5634d28a0e4a08aa43a196bbac2581507f89bfeceba0b6e

Observation 598cb3f3-053b-4e6d-be57-2e196cb507a1 · outbound

This paper cites Don’t Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Don’t Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs,

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-01T09:09:24.902395Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.902395Z digest=sha256:e776f3ede6363ba03054c1ba16df6fe63e4bf388d1429a305ca38eadc8bed428

Observation a120e0d9-4958-4b31-aeb2-b0ab30f7dd23 · outbound

This paper cites Expressive Body Capture: 3D Hands, Face, and Body From a Single Image,.

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Expressive Body Capture: 3D Hands, Face, and Body From a Single Image,

Reference 93

Resolution
malformed identifier
no resolver link, observed 2026-08-01T09:09:24.905094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T09:09:24.905094Z digest=sha256:96fac4c81f2c87257acef11a0945d2189a47fd72bb74ed807a5805e55e82da41

Pith citing papers

No inbound Pith citation observations are available.