{"as_of":"2026-08-14T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9f7d1836ae4a486786810debfb1de851057f2775d4a70608d70e1f6aab58db0","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T16:28:31.916881Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04610/citation-record","integrity":"/paper/2607.04610/integrity","json":"/paper/2607.04610/citation-record.json","paper":"/paper/2607.04610"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Industrial robot grasping with deep learning using a programmable logic controller (plc),","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:2f4fc0a2c43994e88937db18f48e9d08c775de8eb5ab4afd512e7dbebce29884","observation_id":"01186be2-f58e-4c94-b126-1b974a401e16","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Automating deformable gasket assembly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:545565442f63d23bcc6209e17c121240f875c7f8b230e3a42778ed259d5cdd84","observation_id":"c9a6cfec-acac-4f57-9366-73803669a415","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Energy efficient planning for repetitive heterogeneous tasks in precision agriculture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:eb52427084ac3c3e30641ee3eb696180e8a82802f69d9bdd719aa8089f11e0e9","observation_id":"bf1f1891-fbca-4df0-af84-4d11eff487e5","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Can machines garden? systematically comparing the alphagarden vs. professional horticulturalists,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:ebf111399ed6a6f4729022afb1c6e7665e5f524d883054b99a91517703216702","observation_id":"8fb997fa-4995-4cb5-85f2-399cf179b4e7","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Surgical d-knot: Augmented dexterity for tying double knots by monitoring optical flow in monocular attention windows,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5d6587fa5103a3001dbae16d1c7aea31bbd43411db1b1c10312dae425e8cefab","observation_id":"9a394b2f-7c9a-4b36-a4d7-188a4e20eb00","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Stitch 2.0: Extending augmented suturing with ekf needle estimation and thread management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:8a5ef520eaf3212a7eb03f90c0ee6133e0884aea867b8fdf32d47cd0012f6aea","observation_id":"c89e152f-c97c-4740-868c-0f8e9512c0f5","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:7e9540a3041ebf6175d7d1225154464c2df9880f7445ad642a8013a52e05a27a","observation_id":"bbe90ded-c4d7-43b9-b597-0345eaa90149","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-12T23:57:02.109382Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"An introduction to vision-language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:f0ff5368e50740199cd63e4280479a8c7755bea65a7e8171ab26e0621dd45482","observation_id":"5e7f0901-94d9-4cb5-aa69-c894d17338f2","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Design2Code: Benchmarking multimodal code generation for automated front-end engineering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:e6c0794bd1fafcd2e3423818612be7f8bb7e6fdb4545ab06c17c2d7a68101d86","observation_id":"e7e45190-4924-4f4e-9ff0-702c4c833261","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:411b58e3a08184b058d6b7f436fc0a86d95d41df9449eb12af5d96109a007754","observation_id":"701a8b97-46e4-4637-9229-fef608610add","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:ac78e3624d964536af53abd045e7744b0727defe32364f14cd957dcc2c351012","observation_id":"4415190a-b01d-450d-8a97-f2a252a2bd3c","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Prompting with the future: Open-world model predictive control with interactive digital twins,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:03f0dbc608f5aa5220fe5b4463ef64466312d86beb7ffff723c2a556435bc76b","observation_id":"c96a452f-4d6d-4cbe-83dc-f326c748afaf","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5f963f7b5f3e95c4fd385da34e29b91d249a49c913173f1d6d953b6bcb433cd3","observation_id":"929b54c6-a86d-4fbf-9725-24f5e150e958","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Visual question answering: A survey of methods, datasets, evaluation, and challenges,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:3986a890b5f8e36e380bcd5dd8646bff08cee9b6abd78a322d41c54a6301ec79","observation_id":"dac7bf41-01f3-4640-868b-3f3bf031dca6","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:9c91c59174f461c41b659d3f4346f74148a1d529e758995b7db116dfcfebe721","observation_id":"acc121ab-c54c-48df-b2be-cb6555c6521b","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02671","last_updated":"2022-05-05T14:25:46Z","snapshot_observed_at":"2026-08-13T15:49:32.784832Z","submitted_at":"2022-05-05T14:25:46Z","title":"What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02671","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"What is right for me is not yet right for you: A dataset for grounding relative directions via multi-task learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2205.02671","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:12e05276ed013065f5153691f11954ecc78198a3ecccc2ae9cf6f322e00ac0b3","observation_id":"b8190b57-7ebf-445c-aa9c-c570a63d5aa4","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Mmmu: A massive multi- discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:1e9db24803a4ddf3d12cfb1465d82bfb3175770ab0867c0b330faaf444495807","observation_id":"5766059d-9fa2-4402-9eb8-711383e47ad7","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"MMMU-pro: A more robust multi-discipline multimodal understanding benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:8c5e070e8a8eb4b9e9c66fd599ea26b7aff19b87f8b93fcabf6da077d2293672","observation_id":"88c82b6b-7ab7-4fd8-a191-0315e28430bd","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Robo2vlm: Improving visual question answering using large- 10 scale robot manipulation data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:09a326ac48c1da9f526b0e965b7b7a6ad061819d86b9fb4f271a72b36eaf549d","observation_id":"5127ea08-3c9c-44c6-a3c6-5a8924dd71ea","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:30bb070f304904ab44eaa561c6292ae653fb8f9cc2ca382c4320581eeea6bea4","observation_id":"953e5a0c-7f1f-4975-8d39-b7be43a4ee20","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:66ec8fa62bcd08711b6299f325470d84012794d28911b9a4fbc905cfddac4806","observation_id":"2f671b03-57d0-4d50-8135-e4827c377145","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Manip: A modular architecture for integrating inter- active perception for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:342e1481b270938b89b9deb08bd688cecaf558e450056376a1bff6fd97940947","observation_id":"21af20c0-4a3e-4e1d-946d-5d7cd6eea857","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:19e1a7c995e3168373ba8f6c17ca55a4ba3bc67162d4014510e5f55909bdc287","observation_id":"d1f88dc5-aac0-46c1-87c3-9a08f4bba0df","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"A survey on in-context learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5821db80cb9b75fd1a147231135783b3d8d6507c6937c3cf054f15bb59157775","observation_id":"563b22c7-b2fa-4669-889f-232ecb2385fa","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:4a7081b2b00e0b0a9a92fe8b4c95325c5fb0e71234a8822c791278628ae1484d","observation_id":"c0ee503a-35a7-4c0a-bcf9-1be705471131","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:da01fb9a14956e97679386106ba29df2ac077be30eafa573060dbe75408deecd","observation_id":"67c1e8f1-5df5-4c27-93f7-8391e6480f20","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Toward robotic weed control: Detection of nutsedge weed in bermuda- grass turf using inaccurate and insufficient training data,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:05120f50873aea2b60b7087e2edb3e662045694218153b9be78a58b0de221161","observation_id":"c73ce8a4-96dc-4f55-9d76-0ee5ff5be991","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Coupled active perception and manipulation planning for a mobile manipulator in precision agriculture applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:a46211575e95db938af7734c24e059afe209e5447a1d094fee8d32223fc5447c","observation_id":"38983377-ebd0-46a5-ae1e-35728f9a3c2b","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Botany-bot: Digital twin monitoring of occluded and underleaf plant structures with gaussian splats,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:e8eb1fe653116d2bf71f5e957323811cd02920de157a5434aa1484a2c5ac569a","observation_id":"e5db8395-f84d-4ecb-b809-a437499b1d7a","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Omni-scan: Creating visually-accurate digital twin object models using a bimanual robot with handover and gaussian splat merging,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:9195a1baacad5ac0a6b91e0c5e5b6e86373101697c349644c5c70d792399104b","observation_id":"ad9cea2f-4fb1-47ac-bc29-1cdb7e061b91","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16951","last_updated":"2024-10-29T13:07:16Z","snapshot_observed_at":"2026-08-13T05:40:23.403137Z","submitted_at":"2023-10-25T19:36:28Z","title":"The Teenager's Problem: Efficient Garment Decluttering as Probabilistic Set Cover","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16951","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"The teenager’s problem: Efficient garment decluttering as probabilistic set cover,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2310.16951","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:cc303170088f4254a81af4b98d1e9b75fe6a15ff480a43d415af8596f13e6346","observation_id":"bff3016a-2dfa-4291-bfe1-2bf433cc43ac","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:a1cf5e87151b2ccae55d8993ef79eb9b083f80ee01cb2486c60c65ee3d56849a","observation_id":"4f98c170-ae56-400f-8b72-a3b8f1b71904","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-13T04:20:22.694273Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Karamcheti, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:b931556bb5345d70251b2747e73122eee449c9a4179e49f5e188e80d0fe83084","observation_id":"755acb1d-4a54-4eb9-b275-9a669d289b11","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:038db1ec17d8de47cbe0ed119cc9e32fcfd309306e8b535430f1b5f5fc26d56f","observation_id":"444587f2-2bfb-46e9-83f2-88239790173c","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"π0: A generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:814be20a04acbf41a8148e928e6259b091746c5ecce94d36d00317921b78b205","observation_id":"1742113b-6569-49c7-a666-c56f98223f64","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Text2motion: From natural language instructions to feasible plans,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5382ed6ad832509fbc3fdb783f90ee937b9b70f1a454d4c93381a8a541f449af","observation_id":"cc851cf1-44a6-417f-a6ab-cc51c712589b","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"PaLM- E: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:181f1f2d11acc898e0f943b597d682f37188c58b100262022928e4307316dcfe","observation_id":"531e10f6-dfaf-44f0-8d53-8a6f5b96435c","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Rekep: Spatio-temporal reasoning of relational keypoint constraints for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:3f78532fee014009771647ffbd6c770bd57bc14df83ac9d4cd0e64326eb8a1a7","observation_id":"49060ff9-15c3-4627-984f-01522233711f","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:a3d05a09a080389872218b5671b10a2970e86f15c869e4baac5f3718ec49fcb5","observation_id":"0b8619d1-4fc6-42be-9daf-eab10f18a5cd","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Kalie: Fine-tuning vision-language models for open-world manipulation without robot data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5fd3261bbdf2226919030479fc57f34a9c6fdaa695d89351b10413d8dfdfe620","observation_id":"510f6453-ef36-4d65-94f4-f1806340afcf","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Maestro: Orchestrating robotics modules with vision-language models for zero-shot generalist robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:24eba5b9847fcc701f9b0143012b088c78993639bb01ff7c36278fe5ee0bf2ef","observation_id":"493780d7-3c81-46e8-ab9c-40fc3bfbc163","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:f14cecde54a383818bfc5ba990b366cf4ea8eec5e8a3d7ebb3ab66b23200eb40","observation_id":"97a60c6b-ff31-425b-a671-7f4228e0ac45","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5a54a4ab5aeb95d4bf64da4020907b26d449b54860b0c2017254edb12e191f79","observation_id":"8f257786-7c61-4a49-bfbc-484afb06a906","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:12945233e95e04a8c8b691abd4ce1b48dadd6c4ed9a60e67c28b89d270f492ab","observation_id":"09cc1cdc-c39c-4511-8cc4-21e35708cbe4","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Embodied question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:2cf9e8b2918c2ac1cd0f36aefe5e9c81b7d25cff42eda23a85a0dfe6de9f298f","observation_id":"745ed919-1266-4cba-8e69-d52ab57bb5f3","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:fee94419e14e1ebfa326503677247acd06dbc82b600de4cec5dbd7a662e92b31","observation_id":"dbcf99c4-f162-4959-b9c6-8fd5ca334563","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Manipbench: Benchmarking vision-language models for low-level robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:4c88ab85528d06fac60bdbbff7a26c63a22c5b2418faa6e5ec2662863879abae","observation_id":"7821c92d-0140-4428-819a-4c81912bad7f","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:e4d5fa5300e05dfe072b1e2d3ba447251efb04c61d7a00cf61ca233944bd1a0b","observation_id":"c8bbd9c2-417e-456c-b3f9-35123367fce8","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"TurnaboutLLM: A deductive reasoning benchmark from detective games,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:8e34add42d6acec9522b994e9a51352ddfc88685e833d7fba4cfb772299f80eb","observation_id":"0493a1e5-7051-470b-9c5d-d4067fbd9f21","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"MuSR: Testing the limits of chain-of-thought with multistep 11 soft reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:58bb03ef9ec2759c60161ccbd6c2b26a48b0056e52b343dca44990b7d625b2a8","observation_id":"4e99822f-2ec0-4add-a15d-d80021202a40","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Glazer, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:d6b4bdde311c0530d734e432b878f8613257c93693df43b3aaff8089c16bacfd","observation_id":"a70b811f-61ca-461b-b0e8-59bb275e51af","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Siciliano and O","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:78c436925b68fed3e17ec5595affd3a56f0ef7e2dbd348efed7d82b665cc784c","observation_id":"1f0fb2d6-37aa-475d-80e2-8014fb4f94bd","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:b08998cf4633774340e595121989f7c5a820e56b4afcb43b754ea22b9760dff1","observation_id":"317128dc-a7df-4fce-836c-faca1b8ba930","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:217df918c7b4f4d587927e9c5fcaed8430ec9be9f4f5c1fe8b62bcd407d24f11","observation_id":"d8df9d49-b281-4467-a976-edaf1d20acc1","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"A unified approach for motion and force control of robot manipulators: The operational space formulation,","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:04266d37e06fe2ef32fa57d6447b04c1d7c4973711141f705a5cbc58285152b4","observation_id":"45b152f4-4e02-4c6f-827c-8723a9880f25","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Neural module networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:7f5798270c8804c3bfa9c77a83fcb35a581dc5a7351bd5d02026dfab18a2e409","observation_id":"31993a2c-b683-4c3a-b757-4ad7b4409491","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Spatial planning: A configuration space approach,","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:76675c2f7d21485a537f1a925cf781e30a4415fcf375f804b971c0789f94f168","observation_id":"b1a01fdf-f857-4434-b50c-a16ebab554b8","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Thrun, W","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:750528b884f6d1ba10e01e634c5d684c986d715ac96dfe64d24f58e9a7b6e4e6","observation_id":"a2097d6e-467e-444d-a173-8fcd94296980","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Chomp: Gradient optimization techniques for efficient motion planning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:77bdf22ef5c94abb327087da64c182ffcb8e088b0d8be52f0b6c8055123770ec","observation_id":"f4ae289c-099c-46f2-9e36-f2ac93f798ea","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Learning ambidextrous robot grasping policies,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:31198c00835fc4b8b72d04352db9a1d7d43b77f260a98c73d04273c60861dc40","observation_id":"ed711460-3b01-4dbd-a311-a68d98f45fce","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Automated pruning of polyculture plants,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:3b858ec136c5b8ab5325e3cf74b00cf7cc56d815c65174fb26e1a5f64684b113","observation_id":"e7aee019-064f-45f5-9262-ddeefe886f2a","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Algorithm and system development for robotic micro-volume herbicide spray towards precision weed management,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:e99b9821b85e0541ce85b2bd2852da9275904958297d30df2d7940a899d631de","observation_id":"38b7b409-765e-40b7-ac9a-441a65dce6bc","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04929","last_updated":"2024-07-06T02:43:12Z","snapshot_observed_at":"2026-08-12T23:27:48.268397Z","submitted_at":"2024-07-06T02:43:12Z","title":"Toward Precise Robotic Weed Flaming Using a Mobile Manipulator with a Flamethrower","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04929","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Toward precise robotic weed flaming using a mobile manipulator with a flamethrower,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2407.04929","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:40fae94b8bcbb3041142cb6fd1f60e93b0805b5d8f534cec32edf78ecccfb32c","observation_id":"794283ed-a0b3-4359-9c8b-b8cdcce042c3","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:2c091eaf3fc84bf00b1200fbd8ea671135c977077cfb94e4f6c5af556ce30473","observation_id":"a1a76242-7d25-489f-8d3d-f88043669c08","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Points2plans: From point clouds to long-horizon plans with composable relational dynamics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:95de0a8d234170dfafb92d086e40f3c358180fedd1bc60a390b93b2adc0087ae","observation_id":"831a048a-0188-4a70-a0c6-70bc77f24d40","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Fail2progress: Learning from real-world robot failures with stein variational inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:2abc88749395f3374a46e9daa9f1ba752280607238cab1d7ab6675594ddf3f50","observation_id":"c2e70ae3-f311-43b1-8f79-5ef0e5d517f6","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Handloom: Learned tracing of one-dimensional objects for inspection and manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:6b9d88d61a8b8346489752e59308cbef13bba9bf93b3135df492ededb5075b10","observation_id":"d3527820-770a-4244-83fe-afd29d12e961","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Bagging by learning to singulate layers using interactive perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:062cd5a54e6db0ecf1a40135e3e3dd31e67fe482562c5420257039df98f812d3","observation_id":"9ba1501c-a0d5-46eb-85cb-84267ed6b3cc","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Autobag: Learning to open plastic bags and insert objects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:0ef66bf15c4cdec4bd4965ca5dd93d2af7ea0142c9424249a4acb1d37a586d26","observation_id":"3c55635f-17a4-47f5-aa3b-3a0a3c51f4f1","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Blox-net: Generative design-for-robot-assembly using vlm supervision, physics simulation, and a robot with reset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:66d55708050c62997f5f0313074810cf82f8eb82e0bfed731235472046a09000","observation_id":"30213f44-8d76-49e5-9a1f-0f3c92af50dc","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Bomp: Bin-optimized motion planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:f4a3addd45e494c2e48d911cd99253b8f8f4162ff16f59284130767a81a14c28","observation_id":"d74885c5-3eba-4c47-a820-c394609c2c34","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Learning to efficiently plan robust frictional multi-object grasps,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:3e0c61ca6d4377126560f1f610f277393fb39245756e1bf3587b5575aaf955fa","observation_id":"6e09072c-709d-4181-9546-dd7049064502","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:c8e061890f0faa17647eb3303724c4b32c5e5ebe49f765c2a646c93cb43412a6","observation_id":"b9b2c148-2132-48d3-a46c-562c4f509ce9","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01894","last_updated":"2023-10-03T09:03:34Z","snapshot_observed_at":"2026-08-13T05:58:36.941151Z","submitted_at":"2023-10-03T09:03:34Z","title":"Waveform Manipulation Against DNN-based Modulation Classification Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01894","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2310.01894","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:dcb19ceae04350e9ca6827ae462806454ef797d985b62c12313bd21cd11fc6bf","observation_id":"e0c092c2-137b-4a8d-8ff7-6d05081f6ba2","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"An open-source research kit for the da vinci® surgical system,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:96247f68b6c87f8cc45a186dd31883dd67adf3d8b738c816a01f38083dcf2751","observation_id":"0b1e6b4c-c8ab-43ce-9e30-e30351c4ad00","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:cedf5f575a49e741292d11ad2ffe5d2aa639bfb1a9e5a16ad9476a15a48c1524","observation_id":"23b21f19-d25f-4659-92e9-b7222d0c5204","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:7511bccf971d7cce3169dddea60ce2781ff6b18dd37f74ba7e58dde251fe7947","observation_id":"2cebfbf2-38f3-4070-9dc9-174f1650c030","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Robobrain 2.5: Depth in sight, time in mind,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:9a09754d4dcb5d4a91c6895dfa7be8b2eab855e56df4d21b40ff174ab9d9fbbb","observation_id":"1f57dc0a-bfc1-499e-a28e-169ca881d356","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:719df68c205b99b847f6f47c85e972cd5e1af4c2b6e313905c1b3ecdc463cfbf","observation_id":"e62fe250-0038-4fcc-86f6-b393388ecd27","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"To think or not to think: A study of thinking in rule- based visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:f402df6308efb738637034de9f7d06c963fc56f96ee77be89de907b6bbda2f36","observation_id":"c9f9e928-89bb-49cd-8717-9c77d00af282","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-14T05:05:23.381011Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Measuring short-form factuality in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:5b8351c98a083de7d2af23b6ace1f6d736143023cf3744c9814cf2f32434c513","observation_id":"3aa13332-620e-4e14-a951-4036ff011f02","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":"Humanity’s last exam,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:030175e1174db1b4ee2a82f35db0f7e4eb212171a2e7e74f6e59dc5620e9f124","observation_id":"2b5d4a93-26e4-4f81-b1d0-f94f9e5a8d58","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:28:31.916881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T16:28:31.916881Z"},"links":{"citing_paper":"/paper/2607.04610"},"observation_digest":"sha256:d618c7460551acc8e636e0f7115c37f6389a85a926029570a8e1da4c0ef3af1c","observation_id":"586a0724-f2f4-4753-97dd-f384b139c52c","resolution":{"observed_at":"2026-07-11T16:28:31.916881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04610","last_updated":"2026-07-06T02:34:56Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T10:15:48.664927Z","submitted_at":"2026-07-06T02:34:56Z","title":"RoboVista: Evaluating Vision Language Models for Diverse Robot Applications"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2607.04610."}