Pith. sign in

Paper Citation Record · LEDGER

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

As of 14 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2607.04610.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.04610 v1

Coverage vector

measured 83 of 83 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T16:28:31.916881Z

measured 83 of 83 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

83 of 83 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved82
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 01186be2-f58e-4c94-b126-1b974a401e16 · outbound

This paper cites Industrial robot grasping with deep learning using a programmable logic controller (plc),.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Industrial robot grasping with deep learning using a programmable logic controller (plc),

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:2f4fc0a2c43994e88937db18f48e9d08c775de8eb5ab4afd512e7dbebce29884

Observation c9a6cfec-acac-4f57-9366-73803669a415 · outbound

This paper cites Automating deformable gasket assembly,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Automating deformable gasket assembly,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:545565442f63d23bcc6209e17c121240f875c7f8b230e3a42778ed259d5cdd84

Observation bf1f1891-fbca-4df0-af84-4d11eff487e5 · outbound

This paper cites Energy efficient planning for repetitive heterogeneous tasks in precision agriculture,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Energy efficient planning for repetitive heterogeneous tasks in precision agriculture,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:eb52427084ac3c3e30641ee3eb696180e8a82802f69d9bdd719aa8089f11e0e9

Observation 8fb997fa-4995-4cb5-85f2-399cf179b4e7 · outbound

This paper cites Can machines garden? systematically comparing the alphagarden vs. professional horticulturalists,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Can machines garden? systematically comparing the alphagarden vs. professional horticulturalists,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:ebf111399ed6a6f4729022afb1c6e7665e5f524d883054b99a91517703216702

Observation 9a394b2f-7c9a-4b36-a4d7-188a4e20eb00 · outbound

This paper cites Surgical d-knot: Augmented dexterity for tying double knots by monitoring optical flow in monocular attention windows,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Surgical d-knot: Augmented dexterity for tying double knots by monitoring optical flow in monocular attention windows,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5d6587fa5103a3001dbae16d1c7aea31bbd43411db1b1c10312dae425e8cefab

Observation c89e152f-c97c-4740-868c-0f8e9512c0f5 · outbound

This paper cites Stitch 2.0: Extending augmented suturing with ekf needle estimation and thread management,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Stitch 2.0: Extending augmented suturing with ekf needle estimation and thread management,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:8a5ef520eaf3212a7eb03f90c0ee6133e0884aea867b8fdf32d47cd0012f6aea

Observation bbe90ded-c4d7-43b9-b597-0345eaa90149 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Learning transferable visual models from natural language supervision,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:7e9540a3041ebf6175d7d1225154464c2df9880f7445ad642a8013a52e05a27a

Observation 5e7f0901-94d9-4cb5-aa69-c894d17338f2 · outbound

This paper cites An Introduction to Vision-Language Modeling.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications An Introduction to Vision-Language Modeling

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:f0ff5368e50740199cd63e4280479a8c7755bea65a7e8171ab26e0621dd45482

Observation e7e45190-4924-4f4e-9ff0-702c4c833261 · outbound

This paper cites Design2Code: Benchmarking multimodal code generation for automated front-end engineering,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Design2Code: Benchmarking multimodal code generation for automated front-end engineering,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:e6c0794bd1fafcd2e3423818612be7f8bb7e6fdb4545ab06c17c2d7a68101d86

Observation 701a8b97-46e4-4637-9229-fef608610add · outbound

This paper cites Gemini Robotics: Bringing AI into the Physical World.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Gemini Robotics: Bringing AI into the Physical World

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:411b58e3a08184b058d6b7f436fc0a86d95d41df9449eb12af5d96109a007754

Observation 4415190a-b01d-450d-8a97-f2a252a2bd3c · outbound

This paper cites VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:ac78e3624d964536af53abd045e7744b0727defe32364f14cd957dcc2c351012

Observation c96a452f-4d6d-4cbe-83dc-f326c748afaf · outbound

This paper cites Prompting with the future: Open-world model predictive control with interactive digital twins,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Prompting with the future: Open-world model predictive control with interactive digital twins,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:03f0dbc608f5aa5220fe5b4463ef64466312d86beb7ffff723c2a556435bc76b

Observation 929b54c6-a86d-4fbf-9725-24f5e150e958 · outbound

This paper cites Vqa: Visual question answering,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Vqa: Visual question answering,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5f963f7b5f3e95c4fd385da34e29b91d249a49c913173f1d6d953b6bcb433cd3

Observation dac7bf41-01f3-4640-868b-3f3bf031dca6 · outbound

This paper cites Visual question answering: A survey of methods, datasets, evaluation, and challenges,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Visual question answering: A survey of methods, datasets, evaluation, and challenges,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:3986a890b5f8e36e380bcd5dd8646bff08cee9b6abd78a322d41c54a6301ec79

Observation acc121ab-c54c-48df-b2be-cb6555c6521b · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Making the v in vqa matter: Elevating the role of image understanding in visual question answering,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:9c91c59174f461c41b659d3f4346f74148a1d529e758995b7db116dfcfebe721

Observation b8190b57-7ebf-445c-aa9c-c570a63d5aa4 · outbound

This paper cites What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:12e05276ed013065f5153691f11954ecc78198a3ecccc2ae9cf6f322e00ac0b3

Observation 5766059d-9fa2-4402-9eb8-711383e47ad7 · outbound

This paper cites Mmmu: A massive multi- discipline multimodal understanding and reasoning benchmark for expert agi,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Mmmu: A massive multi- discipline multimodal understanding and reasoning benchmark for expert agi,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:1e9db24803a4ddf3d12cfb1465d82bfb3175770ab0867c0b330faaf444495807

Observation 88c82b6b-7ab7-4fd8-a191-0315e28430bd · outbound

This paper cites MMMU-pro: A more robust multi-discipline multimodal understanding benchmark,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications MMMU-pro: A more robust multi-discipline multimodal understanding benchmark,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:8c5e070e8a8eb4b9e9c66fd599ea26b7aff19b87f8b93fcabf6da077d2293672

Observation 5127ea08-3c9c-44c6-a3c6-5a8924dd71ea · outbound

This paper cites Robo2vlm: Improving visual question answering using large- 10 scale robot manipulation data,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Robo2vlm: Improving visual question answering using large- 10 scale robot manipulation data,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:09a326ac48c1da9f526b0e965b7b7a6ad061819d86b9fb4f271a72b36eaf549d

Observation 953e5a0c-7f1f-4975-8d39-b7be43a4ee20 · outbound

This paper cites Robobrain: A unified brain model for robotic manipulation from abstract to concrete,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Robobrain: A unified brain model for robotic manipulation from abstract to concrete,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:30bb070f304904ab44eaa561c6292ae653fb8f9cc2ca382c4320581eeea6bea4

Observation 2f671b03-57d0-4d50-8135-e4827c377145 · outbound

This paper cites Open X-Embodiment: Robotic Learning Datasets and RT-X Models.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Open X-Embodiment: Robotic Learning Datasets and RT-X Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:66ec8fa62bcd08711b6299f325470d84012794d28911b9a4fbc905cfddac4806

Observation 21af20c0-4a3e-4e1d-946d-5d7cd6eea857 · outbound

This paper cites Manip: A modular architecture for integrating inter- active perception for robot manipulation,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Manip: A modular architecture for integrating inter- active perception for robot manipulation,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:342e1481b270938b89b9deb08bd688cecaf558e450056376a1bff6fd97940947

Observation d1f88dc5-aac0-46c1-87c3-9a08f4bba0df · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Chain-of-thought prompting elicits reasoning in large language models,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:19e1a7c995e3168373ba8f6c17ca55a4ba3bc67162d4014510e5f55909bdc287

Observation 563b22c7-b2fa-4669-889f-232ecb2385fa · outbound

This paper cites A survey on in-context learning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications A survey on in-context learning,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5821db80cb9b75fd1a147231135783b3d8d6507c6937c3cf054f15bb59157775

Observation c0ee503a-35a7-4c0a-bcf9-1be705471131 · outbound

This paper cites Language models are few-shot learners,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Language models are few-shot learners,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:4a7081b2b00e0b0a9a92fe8b4c95325c5fb0e71234a8822c791278628ae1484d

Observation 67c1e8f1-5df5-4c27-93f7-8391e6480f20 · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:da01fb9a14956e97679386106ba29df2ac077be30eafa573060dbe75408deecd

Observation c73ce8a4-96dc-4f55-9d76-0ee5ff5be991 · outbound

This paper cites Toward robotic weed control: Detection of nutsedge weed in bermuda- grass turf using inaccurate and insufficient training data,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Toward robotic weed control: Detection of nutsedge weed in bermuda- grass turf using inaccurate and insufficient training data,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:05120f50873aea2b60b7087e2edb3e662045694218153b9be78a58b0de221161

Observation 38983377-ebd0-46a5-ae1e-35728f9a3c2b · outbound

This paper cites Coupled active perception and manipulation planning for a mobile manipulator in precision agriculture applications,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Coupled active perception and manipulation planning for a mobile manipulator in precision agriculture applications,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:a46211575e95db938af7734c24e059afe209e5447a1d094fee8d32223fc5447c

Observation e5db8395-f84d-4ecb-b809-a437499b1d7a · outbound

This paper cites Botany-bot: Digital twin monitoring of occluded and underleaf plant structures with gaussian splats,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Botany-bot: Digital twin monitoring of occluded and underleaf plant structures with gaussian splats,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:e8eb1fe653116d2bf71f5e957323811cd02920de157a5434aa1484a2c5ac569a

Observation ad9cea2f-4fb1-47ac-bc29-1cdb7e061b91 · outbound

This paper cites Omni-scan: Creating visually-accurate digital twin object models using a bimanual robot with handover and gaussian splat merging,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Omni-scan: Creating visually-accurate digital twin object models using a bimanual robot with handover and gaussian splat merging,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:9195a1baacad5ac0a6b91e0c5e5b6e86373101697c349644c5c70d792399104b

Observation bff3016a-2dfa-4291-bfe1-2bf433cc43ac · outbound

This paper cites The Teenager's Problem: Efficient Garment Decluttering as Probabilistic Set Cover.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications The Teenager's Problem: Efficient Garment Decluttering as Probabilistic Set Cover

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:cc303170088f4254a81af4b98d1e9b75fe6a15ff480a43d415af8596f13e6346

Observation 4f98c170-ae56-400f-8b72-a3b8f1b71904 · outbound

This paper cites Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:a1cf5e87151b2ccae55d8993ef79eb9b083f80ee01cb2486c60c65ee3d56849a

Observation 755acb1d-4a54-4eb9-b275-9a669d289b11 · outbound

This paper cites Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:b931556bb5345d70251b2747e73122eee449c9a4179e49f5e188e80d0fe83084

Observation 444587f2-2bfb-46e9-83f2-88239790173c · outbound

This paper cites Openvla: An open-source vision-language-action model,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Openvla: An open-source vision-language-action model,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:038db1ec17d8de47cbe0ed119cc9e32fcfd309306e8b535430f1b5f5fc26d56f

Observation 1742113b-6569-49c7-a666-c56f98223f64 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:814be20a04acbf41a8148e928e6259b091746c5ecce94d36d00317921b78b205

Observation cc851cf1-44a6-417f-a6ab-cc51c712589b · outbound

This paper cites Text2motion: From natural language instructions to feasible plans,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Text2motion: From natural language instructions to feasible plans,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5382ed6ad832509fbc3fdb783f90ee937b9b70f1a454d4c93381a8a541f449af

Observation 531e10f6-dfaf-44f0-8d53-8a6f5b96435c · outbound

This paper cites PaLM- E: An embodied multimodal language model,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications PaLM- E: An embodied multimodal language model,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:181f1f2d11acc898e0f943b597d682f37188c58b100262022928e4307316dcfe

Observation 49060ff9-15c3-4627-984f-01522233711f · outbound

This paper cites ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:3f78532fee014009771647ffbd6c770bd57bc14df83ac9d4cd0e64326eb8a1a7

Observation 0b8619d1-4fc6-42be-9daf-eab10f18a5cd · outbound

This paper cites Moka: Open-world robotic manipulation through mark-based visual prompting,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Moka: Open-world robotic manipulation through mark-based visual prompting,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:a3d05a09a080389872218b5671b10a2970e86f15c869e4baac5f3718ec49fcb5

Observation 510f6453-ef36-4d65-94f4-f1806340afcf · outbound

This paper cites Kalie: Fine-tuning vision-language models for open-world manipulation without robot data,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Kalie: Fine-tuning vision-language models for open-world manipulation without robot data,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5fd3261bbdf2226919030479fc57f34a9c6fdaa695d89351b10413d8dfdfe620

Observation 493780d7-3c81-46e8-ab9c-40fc3bfbc163 · outbound

This paper cites Maestro: Orchestrating robotics modules with vision-language models for zero-shot generalist robots,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Maestro: Orchestrating robotics modules with vision-language models for zero-shot generalist robots,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:24eba5b9847fcc701f9b0143012b088c78993639bb01ff7c36278fe5ee0bf2ef

Observation 97a60c6b-ff31-425b-a671-7f4228e0ac45 · outbound

This paper cites ChartQA: A benchmark for question answering about charts with visual and logical reasoning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications ChartQA: A benchmark for question answering about charts with visual and logical reasoning,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:f14cecde54a383818bfc5ba990b366cf4ea8eec5e8a3d7ebb3ab66b23200eb40

Observation 8f257786-7c61-4a49-bfbc-484afb06a906 · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5a54a4ab5aeb95d4bf64da4020907b26d449b54860b0c2017254edb12e191f79

Observation 09cc1cdc-c39c-4511-8cc4-21e35708cbe4 · outbound

This paper cites MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:12945233e95e04a8c8b691abd4ce1b48dadd6c4ed9a60e67c28b89d270f492ab

Observation 745ed919-1266-4cba-8e69-d52ab57bb5f3 · outbound

This paper cites Embodied question answering,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Embodied question answering,

Reference 45

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:2cf9e8b2918c2ac1cd0f36aefe5e9c81b7d25cff42eda23a85a0dfe6de9f298f

Observation dbcf99c4-f162-4959-b9c6-8fd5ca334563 · outbound

This paper cites Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,

Reference 46

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:fee94419e14e1ebfa326503677247acd06dbc82b600de4cec5dbd7a662e92b31

Observation 7821c92d-0140-4428-819a-4c81912bad7f · outbound

This paper cites Manipbench: Benchmarking vision-language models for low-level robot manipulation,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Manipbench: Benchmarking vision-language models for low-level robot manipulation,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:4c88ab85528d06fac60bdbbff7a26c63a22c5b2418faa6e5ec2662863879abae

Observation c8bbd9c2-417e-456c-b3f9-35123367fce8 · outbound

This paper cites Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipulation,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipulation,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:e4d5fa5300e05dfe072b1e2d3ba447251efb04c61d7a00cf61ca233944bd1a0b

Observation 0493a1e5-7051-470b-9c5d-d4067fbd9f21 · outbound

This paper cites TurnaboutLLM: A deductive reasoning benchmark from detective games,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications TurnaboutLLM: A deductive reasoning benchmark from detective games,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:8e34add42d6acec9522b994e9a51352ddfc88685e833d7fba4cfb772299f80eb

Observation 4e99822f-2ec0-4add-a15d-d80021202a40 · outbound

This paper cites MuSR: Testing the limits of chain-of-thought with multistep 11 soft reasoning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications MuSR: Testing the limits of chain-of-thought with multistep 11 soft reasoning,

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:58bb03ef9ec2759c60161ccbd6c2b26a48b0056e52b343dca44990b7d625b2a8

Observation a70b811f-61ca-461b-b0e8-59bb275e51af · outbound

This paper cites Glazer, E.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Glazer, E

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:d6b4bdde311c0530d734e432b878f8613257c93693df43b3aaff8089c16bacfd

Observation 1f0fb2d6-37aa-475d-80e2-8014fb4f94bd · outbound

This paper cites Siciliano and O.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Siciliano and O

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:78c436925b68fed3e17ec5595affd3a56f0ef7e2dbd348efed7d82b665cc784c

Observation 317128dc-a7df-4fce-836c-faca1b8ba930 · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:b08998cf4633774340e595121989f7c5a820e56b4afcb43b754ea22b9760dff1

Observation d8df9d49-b281-4467-a976-edaf1d20acc1 · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:217df918c7b4f4d587927e9c5fcaed8430ec9be9f4f5c1fe8b62bcd407d24f11

Observation 45b152f4-4e02-4c6f-827c-8723a9880f25 · outbound

This paper cites A unified approach for motion and force control of robot manipulators: The operational space formulation,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications A unified approach for motion and force control of robot manipulators: The operational space formulation,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:04266d37e06fe2ef32fa57d6447b04c1d7c4973711141f705a5cbc58285152b4

Observation 31993a2c-b683-4c3a-b757-4ad7b4409491 · outbound

This paper cites Neural module networks,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Neural module networks,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:7f5798270c8804c3bfa9c77a83fcb35a581dc5a7351bd5d02026dfab18a2e409

Observation b1a01fdf-f857-4434-b50c-a16ebab554b8 · outbound

This paper cites Spatial planning: A configuration space approach,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Spatial planning: A configuration space approach,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:76675c2f7d21485a537f1a925cf781e30a4415fcf375f804b971c0789f94f168

Observation a2097d6e-467e-444d-a173-8fcd94296980 · outbound

This paper cites Thrun, W.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Thrun, W

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:750528b884f6d1ba10e01e634c5d684c986d715ac96dfe64d24f58e9a7b6e4e6

Observation f4ae289c-099c-46f2-9e36-f2ac93f798ea · outbound

This paper cites Chomp: Gradient optimization techniques for efficient motion planning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Chomp: Gradient optimization techniques for efficient motion planning,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:77bdf22ef5c94abb327087da64c182ffcb8e088b0d8be52f0b6c8055123770ec

Observation ed711460-3b01-4dbd-a311-a68d98f45fce · outbound

This paper cites Learning ambidextrous robot grasping policies,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Learning ambidextrous robot grasping policies,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:31198c00835fc4b8b72d04352db9a1d7d43b77f260a98c73d04273c60861dc40

Observation e7aee019-064f-45f5-9262-ddeefe886f2a · outbound

This paper cites Automated pruning of polyculture plants,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Automated pruning of polyculture plants,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:3b858ec136c5b8ab5325e3cf74b00cf7cc56d815c65174fb26e1a5f64684b113

Observation 38b7b409-765e-40b7-ac9a-441a65dce6bc · outbound

This paper cites Algorithm and system development for robotic micro-volume herbicide spray towards precision weed management,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Algorithm and system development for robotic micro-volume herbicide spray towards precision weed management,

Reference 62

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:e99b9821b85e0541ce85b2bd2852da9275904958297d30df2d7940a899d631de

Observation 794283ed-a0b3-4359-9c8b-b8cdcce042c3 · outbound

This paper cites Toward Precise Robotic Weed Flaming Using a Mobile Manipulator with a Flamethrower.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Toward Precise Robotic Weed Flaming Using a Mobile Manipulator with a Flamethrower

Reference 63

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:40fae94b8bcbb3041142cb6fd1f60e93b0805b5d8f534cec32edf78ecccfb32c

Observation a1a76242-7d25-489f-8d3d-f88043669c08 · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:2c091eaf3fc84bf00b1200fbd8ea671135c977077cfb94e4f6c5af556ce30473

Observation 831a048a-0188-4a70-a0c6-70bc77f24d40 · outbound

This paper cites Points2plans: From point clouds to long-horizon plans with composable relational dynamics,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Points2plans: From point clouds to long-horizon plans with composable relational dynamics,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:95de0a8d234170dfafb92d086e40f3c358180fedd1bc60a390b93b2adc0087ae

Observation c2e70ae3-f311-43b1-8f79-5ef0e5d517f6 · outbound

This paper cites Fail2progress: Learning from real-world robot failures with stein variational inference,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Fail2progress: Learning from real-world robot failures with stein variational inference,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:2abc88749395f3374a46e9daa9f1ba752280607238cab1d7ab6675594ddf3f50

Observation d3527820-770a-4244-83fe-afd29d12e961 · outbound

This paper cites Handloom: Learned tracing of one-dimensional objects for inspection and manipulation,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Handloom: Learned tracing of one-dimensional objects for inspection and manipulation,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:6b9d88d61a8b8346489752e59308cbef13bba9bf93b3135df492ededb5075b10

Observation 9ba1501c-a0d5-46eb-85cb-84267ed6b3cc · outbound

This paper cites Bagging by learning to singulate layers using interactive perception,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Bagging by learning to singulate layers using interactive perception,

Reference 68

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:062cd5a54e6db0ecf1a40135e3e3dd31e67fe482562c5420257039df98f812d3

Observation 3c55635f-17a4-47f5-aa3b-3a0a3c51f4f1 · outbound

This paper cites Autobag: Learning to open plastic bags and insert objects,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Autobag: Learning to open plastic bags and insert objects,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:0ef66bf15c4cdec4bd4965ca5dd93d2af7ea0142c9424249a4acb1d37a586d26

Observation 30213f44-8d76-49e5-9a1f-0f3c92af50dc · outbound

This paper cites Blox-net: Generative design-for-robot-assembly using vlm supervision, physics simulation, and a robot with reset,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Blox-net: Generative design-for-robot-assembly using vlm supervision, physics simulation, and a robot with reset,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:66d55708050c62997f5f0313074810cf82f8eb82e0bfed731235472046a09000

Observation d74885c5-3eba-4c47-a820-c394609c2c34 · outbound

This paper cites Bomp: Bin-optimized motion planning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Bomp: Bin-optimized motion planning,

Reference 71

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:f4a3addd45e494c2e48d911cd99253b8f8f4162ff16f59284130767a81a14c28

Observation 6e09072c-709d-4181-9546-dd7049064502 · outbound

This paper cites Learning to efficiently plan robust frictional multi-object grasps,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Learning to efficiently plan robust frictional multi-object grasps,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:3e0c61ca6d4377126560f1f610f277393fb39245756e1bf3587b5575aaf955fa

Observation b9b2c148-2132-48d3-a46c-562c4f509ce9 · outbound

This paper cites Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,

Reference 73

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:c8e061890f0faa17647eb3303724c4b32c5e5ebe49f765c2a646c93cb43412a6

Observation e0c092c2-137b-4a8d-8ff7-6d05081f6ba2 · outbound

This paper cites Waveform Manipulation Against DNN-based Modulation Classification Attacks.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Waveform Manipulation Against DNN-based Modulation Classification Attacks

Reference 74

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:dcb19ceae04350e9ca6827ae462806454ef797d985b62c12313bd21cd11fc6bf

Observation 0b1e6b4c-c8ab-43ce-9e30-e30351c4ad00 · outbound

This paper cites An open-source research kit for the da vinci® surgical system,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications An open-source research kit for the da vinci® surgical system,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:96247f68b6c87f8cc45a186dd31883dd67adf3d8b738c816a01f38083dcf2751

Observation 23b21f19-d25f-4659-92e9-b7222d0c5204 · outbound

This paper cites Qwen2.5-VL Technical Report.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Qwen2.5-VL Technical Report

Reference 76

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:cedf5f575a49e741292d11ad2ffe5d2aa639bfb1a9e5a16ad9476a15a48c1524

Observation 2cebfbf2-38f3-4070-9dc9-174f1650c030 · outbound

This paper cites Qwen3 Technical Report.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Qwen3 Technical Report

Reference 77

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:7511bccf971d7cce3169dddea60ce2781ff6b18dd37f74ba7e58dde251fe7947

Observation 1f57dc0a-bfc1-499e-a28e-169ca881d356 · outbound

This paper cites Robobrain 2.5: Depth in sight, time in mind,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Robobrain 2.5: Depth in sight, time in mind,

Reference 78

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:9a09754d4dcb5d4a91c6895dfa7be8b2eab855e56df4d21b40ff174ab9d9fbbb

Observation e62fe250-0038-4fcc-86f6-b393388ecd27 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 79

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:719df68c205b99b847f6f47c85e972cd5e1af4c2b6e313905c1b3ecdc463cfbf

Observation c9f9e928-89bb-49cd-8717-9c77d00af282 · outbound

This paper cites To think or not to think: A study of thinking in rule- based visual reinforcement fine-tuning,.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications To think or not to think: A study of thinking in rule- based visual reinforcement fine-tuning,

Reference 80

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:f402df6308efb738637034de9f7d06c963fc56f96ee77be89de907b6bbda2f36

Observation 3aa13332-620e-4e14-a951-4036ff011f02 · outbound

This paper cites Measuring short-form factuality in large language models.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Measuring short-form factuality in large language models

Reference 81

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:5b8351c98a083de7d2af23b6ace1f6d736143023cf3744c9814cf2f32434c513

Observation 2b5d4a93-26e4-4f81-b1d0-f94f9e5a8d58 · outbound

This paper cites Humanity's Last Exam.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Humanity's Last Exam

Reference 82

Resolution
malformed identifier
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:030175e1174db1b4ee2a82f35db0f7e4eb212171a2e7e74f6e59dc5620e9f124

Observation 586a0724-f2f4-4753-97dd-f384b139c52c · outbound

This paper cites an unresolved cited work.

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications Unresolved cited work

Reference 83

Resolution
unresolved
no resolver link, observed 2026-07-11T16:28:31.916881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T16:28:31.916881Z digest=sha256:d618c7460551acc8e636e0f7115c37f6389a85a926029570a8e1da4c0ef3af1c

Pith citing papers

No inbound Pith citation observations are available.