{"as_of":"2026-08-09T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2795f1648320db364e62cf2d2903b1dd3258c58e8493fd57cd071d788c73c67","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:21:15.562904Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:56:37.191428Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:59:46.871127Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T23:56:37.191428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15645","last_updated":"2025-06-18T17:14:07Z","snapshot_observed_at":"2026-08-07T21:48:56.620256Z","submitted_at":"2025-06-18T17:14:07Z","title":"Demystifying the Visual Quality Paradox in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:56:37.191428Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.15645"},"observation_digest":"sha256:8718a3ecb1b816af652d34e80d804a54ad1a33bfa3909e785268667b71428720","observation_id":"3958f27a-cd4c-4d43-a2c9-5896bb4b176d","resolution":{"observed_at":"2026-08-06T23:56:37.191428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T22:49:07.721472Z","title":"arXiv preprint arXiv:2505.15517 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.721472Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:f1bd6e979a2633caea6ab75f617a4dcb682b4a50550a74991166a55fd8063a31","observation_id":"71e0cde9-4a6e-48b7-bf08-c46222e1b4e5","resolution":{"observed_at":"2026-08-06T22:49:07.721472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T17:43:53.200688Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10087","last_updated":"2025-07-14T09:13:07Z","snapshot_observed_at":"2026-08-07T22:45:28.938815Z","submitted_at":"2025-07-14T09:13:07Z","title":"Foundation Model Driven Robotics: A Comprehensive Review","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T17:43:53.200688Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2507.10087"},"observation_digest":"sha256:2d17c5fe628d377763a6cbb9962656d8d3b049be8fc3d403a7c210a4fa6be432","observation_id":"b5371277-8e79-4797-ab8d-c1eabf6250ec","resolution":{"observed_at":"2026-08-06T17:43:53.200688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-03T13:29:54.177769Z","title":"Robo2vlm: Visual question answering from large- scale in-the-wild robot manipulation datasets,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-08T10:23:37.779496Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:54.177769Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:e09d36e98b4e728020158090f8604e2699811a270fb247dec61a71b68ce64535","observation_id":"84347f74-b78d-436e-b668-2d701380c58b","resolution":{"observed_at":"2026-08-03T13:29:54.177769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":"R., and Goldberg, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-06T10:59:04.687049Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:6ff10fec19b2c36825cdce4f105c49c60a31920ec60a5a1ce8b72a28cf84842d","observation_id":"ab07615c-fe48-4386-9ebc-e6962892d043","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2604.20012","last_updated":"2026-04-21T21:40:58Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T21:40:58Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:08.687340Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2604.20012"},"observation_digest":"sha256:7a332c51e1e156822aab4929a3eacc9bf531380b8b91ed871326ad487a5640b5","observation_id":"db4d926e-04c7-4446-82ee-35e3b02bbd32","resolution":{"observed_at":"2026-05-11T13:11:03.769973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:35:22.595183Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.13119"},"observation_digest":"sha256:aabea734572b4ede7572f56a66ec817f907caf0ebe9b1f8f6ee8f5c68793ae54","observation_id":"7d10b362-674a-4162-8a8b-2ffdfcf7c6aa","resolution":{"observed_at":"2026-05-14T18:37:35.557834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.19328","last_updated":"2026-05-19T04:07:24Z","snapshot_observed_at":"2026-08-03T19:21:56.538777Z","submitted_at":"2026-05-19T04:07:24Z","title":"RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:05:42.451746Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.19328"},"observation_digest":"sha256:47fd83709f6a67540afa9504bfc39403d1389ef6e4005fd2340ee9da38925b1e","observation_id":"6597ac9a-428c-4f63-81ed-4b8b7612e738","resolution":{"observed_at":"2026-05-20T05:08:05.177944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.25802","last_updated":"2026-05-25T12:51:35Z","snapshot_observed_at":"2026-08-05T08:07:09.530165Z","submitted_at":"2026-05-25T12:51:35Z","title":"Rethinking VLM Representation for VLA Initialization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:21:29.733181Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.25802"},"observation_digest":"sha256:5a83d13d8ee23b258aa58590d7385e3e19231cdb39b9599998aa42f713c93b72","observation_id":"13d6f012-16b6-44f1-a40d-981388de4813","resolution":{"observed_at":"2026-06-29T22:24:00.128773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-02T22:10:19.505273Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:f5f3176efae5036baa7e9c029841ff5f15d69ceaf8d98a039101c66ee796b00c","observation_id":"69813e01-6f70-4049-8b54-9152fed034f7","resolution":{"observed_at":"2026-06-29T21:33:58.981062Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:af717a63d8bb43fa422adf7e724bece944d011e67cddd90896ebc3d4a3547b5b","observation_id":"78ecdf25-e94e-4225-b0d2-a12583a15c8c","resolution":{"observed_at":"2026-06-29T13:43:28.939856Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:bc50aff2f6d7b8010750268798172160276a21669fe43f73b694e0ef770f85ea","observation_id":"6657bccb-16d3-4b2f-b549-c6a75779ff99","resolution":{"observed_at":"2026-07-01T19:26:00.530454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:fcaedf913268b5223fb2f41d956f3eb786c13e52530e98624f91bfc0b924b30e","observation_id":"6d129ccf-4039-44f3-a1d0-427ab9ba868a","resolution":{"observed_at":"2026-07-02T22:57:26.630648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:9e2ba28b824541ac250a55ee7981398c9286d9c94a430d94d6a2ce11ecb33cea","observation_id":"ea05806d-e451-4a73-87e4-ebb4d88fd28c","resolution":{"observed_at":"2026-07-03T15:28:34.770570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-02T11:43:49.379947Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:49.379947Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:2c5b0a1bab0e62788cff8e249998566731cb605273610e502993db2446875329","observation_id":"93a450d5-0507-48c7-8596-c619c4fb2a52","resolution":{"observed_at":"2026-08-02T11:43:49.379947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.20905","last_updated":"2026-06-18T20:01:32Z","snapshot_observed_at":"2026-08-03T03:13:19.923134Z","submitted_at":"2026-06-18T20:01:32Z","title":"Vesta: A Generalist Embodied Reasoning Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T16:55:12.518255Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.20905"},"observation_digest":"sha256:d5be5eeb1f93d2ec483122f3a764522771c82ea0b75e6212051fb316a5fd671f","observation_id":"e9149a18-0ed3-4570-b74c-381e2a561269","resolution":{"observed_at":"2026-07-04T04:29:35.736977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-03T12:04:36.736234Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:1214f177be32cbed4b8f644e731f7f5f3e02c21cb371d66c92a46b2d3e40c600","observation_id":"974cc6a3-9b1b-4118-884a-d95e485da3ce","resolution":{"observed_at":"2026-07-04T10:59:46.873792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-14T17:30:54.988498Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09701","last_updated":"2026-06-21T16:16:02Z","snapshot_observed_at":"2026-08-01T23:36:03.315592Z","submitted_at":"2026-06-21T16:16:02Z","title":"EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T17:30:54.988498Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.09701"},"observation_digest":"sha256:b1a449579aa750515487c3ee685e7f5879e838bdcf1413937bee037750f595fb","observation_id":"a99f9c32-9729-45bf-81f1-806a6e7e4970","resolution":{"observed_at":"2026-07-14T17:30:54.988498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-02T05:16:35.354226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-07T12:37:37.871440Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.354226Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:53547b09aa21ca85e6f1006018fb9b7b22ac0ca29aae6c8430f399816adc7a88","observation_id":"f7c34079-fe85-4677-91b1-0d98d1ed7f7e","resolution":{"observed_at":"2026-08-02T05:16:35.354226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-01T16:32:46.402572Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets.arXiv preprint arXiv:2505.15517, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:32:46.402572Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:d8676b75a570581562db3f6d8bdf53d934bd0384570377407c50dc93bcb9cd39","observation_id":"0ac0bafc-1318-471d-8f61-4b03a1718018","resolution":{"observed_at":"2026-08-01T16:32:46.402572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-03T01:57:27.437916Z","title":"Robo2vlm: Visual question answering from large-scale in-the-wild robot manipulation datasets.arXiv preprint arXiv:2505.15517, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17977","last_updated":"2026-07-31T13:34:17Z","snapshot_observed_at":"2026-08-06T12:49:54.995384Z","submitted_at":"2026-07-20T14:13:27Z","title":"RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T01:57:27.437916Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.17977"},"observation_digest":"sha256:8839d4743dfd3fa4c4935643d88893ce2c4691e547999808f361ae781c8424b7","observation_id":"21826f6d-47ea-4d4c-be0f-410311188457","resolution":{"observed_at":"2026-08-03T01:57:27.437916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15517/citation-record","integrity":"/paper/2505.15517/integrity","json":"/paper/2505.15517/citation-record.json","paper":"/paper/2505.15517"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.661547Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.661547Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b04fbd70df1011a6df2cb945a5d4ce13e39e16316d1ceddb28d4cad6df8b2c23","observation_id":"2810f855-b6ec-49ef-bff6-84e1f1ed0461","resolution":{"observed_at":"2026-08-07T15:21:10.661547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.774245Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.774245Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:1478e6fa9188ebe3dd7d37dd43b75a41a801ce02fdfbfe139ad2b9cd3b19252b","observation_id":"46b306a3-2f10-4c8b-aeca-419db50ceaf2","resolution":{"observed_at":"2026-08-07T15:21:10.774245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:21:10.925490Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.925490Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a5c7cdf91a8dccc5b52e01f978b201bb10e9849250f15c864fa70627f932a219","observation_id":"a6f7afe0-db68-498b-9577-5941013cbed1","resolution":{"observed_at":"2026-08-07T15:21:10.925490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:10.987905Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:10.987905Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:2f03747f0bebacac8c4e6e708d3cac4b74072a9b4c7880e22fe83a0bea3fa9fa","observation_id":"b283527a-94e2-4907-8815-859bfbf2d01c","resolution":{"observed_at":"2026-08-07T15:21:10.987905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.720533Z","title":"Claude 3.5 Sonnet","venue":null,"work_id":"0c6420e1-5bbf-4572-b5ce-370f3006e80f","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.067543Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7a77ae370f59601aefba6d26a6ca22c6c54289b348ff524127696129eeece284","observation_id":"c42254d0-0d1d-4b9c-8e6f-866eea83b1ce","resolution":{"observed_at":"2026-08-07T15:21:21.793205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.561774Z","title":"GPT-4o System Card","venue":null,"work_id":"b89cf26b-5367-4914-a900-5b247840df45","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.157025Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:52089e08141ece7e085224c11954a00cf71666ec06240bfe5513f0daa110a98a","observation_id":"d9087d7c-72a7-4cd8-a609-f6258e7b940c","resolution":{"observed_at":"2026-08-07T15:21:21.645637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.426951Z","title":"Gemini 2.5: Our most intelligent AI model","venue":null,"work_id":"58163245-c433-4a43-94ae-95aebf4df7af","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.248985Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:4683f53a1bb6a8179e93c46d16f02a946c448cb9ef700f4fee3530dc184f93f3","observation_id":"88ad1e3c-4542-4184-9ad1-b9195e891e99","resolution":{"observed_at":"2026-08-07T15:21:21.474603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.317851Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.317851Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:380b788aa421793566e98848f1b72bb6eada3a1bc49e34946f452879a1844daa","observation_id":"fc579134-c768-4c91-bc3b-cbe21cff9066","resolution":{"observed_at":"2026-08-07T15:21:11.317851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.431731Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.431731Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b119e9bcae7db0df0944a0c964bfaa9c92570b80cffceae3d089982f9cac0fcf","observation_id":"ef00d9c1-6dce-42c5-9560-73ebf9d79a41","resolution":{"observed_at":"2026-08-07T15:21:11.431731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T15:21:11.524858Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.524858Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a939ecbb4e53e9fa8bf2926dc523f2496d5125bf303fe20cfe65605bf4169439","observation_id":"5c840a04-665a-46c8-86d0-de2aaf072892","resolution":{"observed_at":"2026-08-07T15:21:11.524858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.277466Z","title":"Gemini robotics: Bringing ai into the physical world, 2025","venue":null,"work_id":"228383eb-e149-4876-9811-56f381d0aeeb","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.617361Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0dc2dc40f40c629313cc7547cbc662e4828338192baf9353f6ae30d3fca06dd8","observation_id":"37ae5ddd-834d-4fde-8be4-6d2b444708e5","resolution":{"observed_at":"2026-08-07T15:21:21.320767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:11.717767Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.717767Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0b87ea43e9340f3525761994be14c7131469edde9e11a73b58efefc1f5a3d07d","observation_id":"e53a4628-f2d8-499f-a70b-27291e9247b3","resolution":{"observed_at":"2026-08-07T15:21:11.717767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:21.072091Z","title":"EQA-MX: Embodied question answering using multimodal expression","venue":null,"work_id":"6fdae6e5-184a-43cb-a1a9-35b06de7f0c3","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.843051Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:3254cb9c1b9a14c9c107fd12536f18467210bd8f3e1266f7964ffdac87b3a3a8","observation_id":"49756c7c-1796-49b5-ac41-6576e0eeaaac","resolution":{"observed_at":"2026-08-07T15:21:21.177361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-07T15:21:11.971065Z","title":"EM- BODIEDBENCH: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:11.971065Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:25b129bc7fd7daf5e095a770fd6dfa5b0fb242b6e1953b4c0d0e5101d066cf04","observation_id":"d5486305-0b77-41c1-abe9-ad1f99cd4ad6","resolution":{"observed_at":"2026-08-07T15:21:11.971065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.901803Z","title":"Embodied agent interface: Benchmarking LLMs for embodied decision making","venue":null,"work_id":"2750fad6-96d2-4817-a0e5-03dd8b714d3b","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.071017Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:46a0ec2e7ea9a5adc55ce2c9334886a97cb0ec2c28c8ed85f8ef57779049c4a4","observation_id":"a19ba6cb-a6b2-49fa-9a97-67f7ed454784","resolution":{"observed_at":"2026-08-07T15:21:20.976649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.701713Z","title":"ALFRED: A benchmark for interpreting grounded instructions for household robots","venue":null,"work_id":"5ea7e002-9273-4b52-91c0-dbd9bbabb910","year":2020},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.204644Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:f4ed5a4a9fea6b5443f1cc48372e394e91dfeef7efa2daf5c77c564a7f941799","observation_id":"0e4dabe6-a413-4a42-a05a-e30dad133706","resolution":{"observed_at":"2026-08-07T15:21:20.803252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.532514Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":"25d18b52-49bd-4f7a-939b-494248df5a69","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.307005Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9105fa126b121d150ddf3d287dbca8c3e448e94a4f15472b9f506da59d043b2a","observation_id":"4a5b6fda-a852-4c0e-87a3-444df8ed09ab","resolution":{"observed_at":"2026-08-07T15:21:20.597082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-07T15:21:12.433304Z","title":"AI2-THOR: An interactive 3d environment for visual AI","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.433304Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:2a371e9404e910e95d7c4f361d7afd4a1f784c1cf36a44acb5e6800d79207108","observation_id":"89fac9a5-be2f-424e-96fa-2ecab99ce51e","resolution":{"observed_at":"2026-08-07T15:21:12.433304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-07-06T16:41:56.099361Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-08-07T15:21:12.537196Z","title":"Joshi, Pete Florence, Wei Han, Robert Baruch, Yao Lu, Suvir Mirchandani, Peng Xu, Pannag Sanketi, Karol Hausman, Izhak Shafran, Brian Ichter, and Yuan Cao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.537196Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b3c8f8e725605e0dc0e2391de9e477ebb8522e25a6c1518ec03a66c5b7057dab","observation_id":"28ffec7f-042f-4d23-a4be-d9ff5dd7e60b","resolution":{"observed_at":"2026-08-07T15:21:12.537196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.324158Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":"f4fa45d2-ca19-4d18-9689-dc65252691a9","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.635029Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:cbaed8ed25fc0439ad393511b403b93c12dc156151f4971530fc1e0b97157231","observation_id":"fbbefaac-f9b0-4556-84d0-13326ffaa9a0","resolution":{"observed_at":"2026-08-07T15:21:20.429334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:12.705074Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.705074Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a4333af5b810a55b9f1e7218246e22fb959256e28e5c6925c3955bf3dcc61f00","observation_id":"8b530ecd-9b84-45c7-abe9-90bc9fa4d57f","resolution":{"observed_at":"2026-08-07T15:21:12.705074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:12.758835Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.758835Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:ff4b625e15b57d54f59ec94b60ca02723bac444d1a716d5ce198250537cc1644","observation_id":"b8bb77a2-732e-4716-a7e7-3ec37fe1b30c","resolution":{"observed_at":"2026-08-07T15:21:12.758835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:20.116244Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"059735af-97cc-4d65-9938-a1753de305c8","year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.855366Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:4ca2523d24dac72ffae00777cf85b22838a37f412f1768d9d619e7d21db7d8ad","observation_id":"7cb2f140-4df4-4fd6-8fd0-da4d723b5616","resolution":{"observed_at":"2026-08-07T15:21:20.205356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T15:21:12.929203Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:12.929203Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:5e3dcd7bf70bf5273568c2f5025c7bd8158a9e07c55c88d4373efd35706f9ec9","observation_id":"fadc7e27-88de-4086-9c27-191a49deb0b7","resolution":{"observed_at":"2026-08-07T15:21:12.929203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.895659Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":"f3428cb1-0d73-41cd-a09f-0074cf4cc3c3","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.048192Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:d46f5dca2d9f3ac5ceb732e87ca70260ca8825d989c3df334ef9c4ebc4e25498","observation_id":"70eef0d6-9a22-4c5e-9eeb-66ec350dfdf6","resolution":{"observed_at":"2026-08-07T15:21:19.989185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.551631Z","title":"Remix: Optimizing data mixtures for large scale imitation learning","venue":null,"work_id":"cab4a1e8-f8ac-4392-b948-08e9d9275fda","year":2025},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.138606Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8b1ee5f742aacefc5d45d01fd8a18e2e38b880b8498831ca932c99c33c5fb9f5","observation_id":"d8c58291-f7e2-482e-bbb5-1a69728bb5fa","resolution":{"observed_at":"2026-08-07T15:21:19.661846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01894","last_updated":"2023-10-03T09:03:34Z","snapshot_observed_at":"2026-08-06T05:58:01.917319Z","submitted_at":"2023-10-03T09:03:34Z","title":"Waveform Manipulation Against DNN-based Modulation Classification Attacks","version":1},"cited_work":{"arxiv_id":"2310.01894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01894","snapshot_observed_at":"2026-08-07T15:21:15.669653Z","title":"Waveform Manipulation Against DNN-based Modulation Classification Attacks","venue":"cs.CR","work_id":"c20350ab-d16b-405c-8047-5d0b10a1e9bf","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.327764Z"},"links":{"cited_paper":"/paper/2310.01894","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:93fb8817889823158eaf77a0eb0474526fd93ab29dd10abcab6a664c5a4aa86e","observation_id":"570b1f98-6c35-4d47-b7b7-fefbbd8c99e2","resolution":{"observed_at":"2026-08-07T15:21:15.736057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:19.296870Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":"425b5c3a-808f-46a9-a302-5367193d311e","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.602732Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9b648ac6a2d03e5046153cefb26dc8b55650d14f2d3402663ba34097d699f5e1","observation_id":"677fab60-abfd-4446-93b7-ff132fdf478e","resolution":{"observed_at":"2026-08-07T15:21:19.434336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.973540Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":"1772cde4-b1c4-4a82-8edb-39be7a7c9e80","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.799507Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:ae5a1374f335a1817c776a591188fd6c93ef36865ce6af293889485c68e9b303","observation_id":"2536aae8-b720-4680-bf63-10254c34c0d8","resolution":{"observed_at":"2026-08-07T15:21:19.132362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.640078Z","title":"https://physicalintelligence.company/blog/pi0, 2024","venue":null,"work_id":"2c040f86-4ef2-4897-a461-1abd7c6afd91","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.879589Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:b76372391e9a24ccceaad33a9509a499dcbde15470a016c553c25be5eb675720","observation_id":"f0380f50-e9a3-4b7f-9da8-cb92844a76ed","resolution":{"observed_at":"2026-08-07T15:21:18.775799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.326739Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":"da5bb159-b037-4693-a6fe-b39ec94f59d3","year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:13.987722Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:97cb291f056e72de0c68cf0b67036b892152fa666b38161268bbdeb0bc1b3874","observation_id":"7139a414-069e-42f3-816c-a11d6f3d5eb5","resolution":{"observed_at":"2026-08-07T15:21:18.499528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:18.114749Z","title":"Latent plans for task agnostic offline reinforcement learning","venue":null,"work_id":"b1e443a8-53b0-4a45-8f45-ee17d66425f9","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.087953Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:2d0cd71dc80e9880c6cf4f8d0956b354ac9c9abb6c3a0d8997f7a0a15cd850a4","observation_id":"f0516040-c53b-4e48-83ed-da47be961464","resolution":{"observed_at":"2026-08-07T15:21:18.204100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.185224Z","title":"Grounding language with visual affordances over unstructured data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.185224Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:f2b01bcf86df33c454425a3ca8d9bde0f883f00bfb48ec3c5067b04dc71a3735","observation_id":"4707bcc1-3f63-47b7-b916-875eb7225b2d","resolution":{"observed_at":"2026-08-07T15:21:14.185224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.870412Z","title":"Making sense of vision and touch: Self-supervised learning of multimodal representations for contact-rich tasks","venue":null,"work_id":"38bf12ea-0004-4520-a284-8cceb3ab2048","year":2019},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.254802Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8852d21887c13196db9ff55d628db510e73e5f9abcf238e8c813eccedd950931","observation_id":"723865a2-2ef1-487b-850f-bfe2f1c56e39","resolution":{"observed_at":"2026-08-07T15:21:17.966793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.336434Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.336434Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:39c7eca594d182090b0229b69db0dbdf7fa50b940511aff5a3e6a33ae8efe02e","observation_id":"721a2928-b8d1-4200-824a-7be393c81ebd","resolution":{"observed_at":"2026-08-07T15:21:14.336434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.431315Z","title":"Robot learning on the job: Human-in-the-loop autonomy and learning during deployment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.431315Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8ab4ceb0f5f3a00ba884846203bd32b59ff4c5713161d6414d702d4ab8091f9c","observation_id":"75e9d37e-1a9e-40d1-b3bd-f87294bb7b31","resolution":{"observed_at":"2026-08-07T15:21:14.431315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.603418Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"2956f6cd-845d-4ef6-a279-27574523ee5c","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.499268Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:ea9c4475f13fef063c0f727cdaa9dd740952579fda857bb8b2c3d43dcf5ee6fb","observation_id":"3a37763b-cb4e-483e-bcb7-c240ec7642cd","resolution":{"observed_at":"2026-08-07T15:21:17.727657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.425699Z","title":"The surprising effectiveness of representation learning for visual imitation, 2021","venue":null,"work_id":"ef9ad527-2fcf-4d25-95e6-8d9986e49783","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.577357Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:6651c97a8750e1243a6786f17454a18a5b930c05c71a6ecaef7308caf40e35ec","observation_id":"401421ae-7219-4c66-a579-481f77a0dbed","resolution":{"observed_at":"2026-08-07T15:21:17.481239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.640236Z","title":"Fanuc manipulation: A dataset for learning-based manipulation with fanuc mate 200id robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.640236Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7fdc8b885522b6519ef59ec3bdb70403e0453a9b7c7c224dca7dd710e1c81226","observation_id":"6e486d93-47b0-470d-92b1-8d69a030be3b","resolution":{"observed_at":"2026-08-07T15:21:14.640236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.279945Z","title":"Modularity through attention: Efficient training and transfer of language-conditioned policies for robot manipulation","venue":null,"work_id":"e78fd68e-05aa-4329-833a-c97abf0335e6","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.737882Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:97801b63c9e926233902d820a9ed73d444efad7a22a643f82b065491c033eb77","observation_id":"f58f7461-6395-421a-b962-82b99b8a7214","resolution":{"observed_at":"2026-08-07T15:21:17.381341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:17.030068Z","title":"Learning modular language-conditioned robot policies through attention","venue":null,"work_id":"463528fc-c6c5-49f0-b907-b22e5a16f188","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.840403Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:9ac6f00518da29a2cf90bcc4dd7b6ecc80da69fbd62d5ac07f0dd2fbc35c9caa","observation_id":"caa322b1-315a-47a2-8d3b-be8fcd050494","resolution":{"observed_at":"2026-08-07T15:21:17.152797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.824671Z","title":"Viola: Imitation learning for vision-based manipulation with object proposal priors","venue":null,"work_id":"15cf0d43-8595-4c6a-98c3-fd53cf9638c1","year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.915362Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:a0e9dcc25ca2428bd9a30f7b893d99738e8e57250e3de198dd4030c66cc08a72","observation_id":"3d21542a-2063-4be4-b112-479ab68a7519","resolution":{"observed_at":"2026-08-07T15:21:16.924497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:14.975665Z","title":"Bottom-up skill discovery from unsegmented demonstrations for long-horizon robot manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:14.975665Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8adc0f7c3be7602e8447e93b412d9cc1521aa0155413f19659c8f2592d76de0c","observation_id":"fada99ea-02d1-4d8e-afe3-83c6258a0d68","resolution":{"observed_at":"2026-08-07T15:21:14.975665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.555506Z","title":"Watch and match: Supercharging imitation with regularized optimal transport","venue":null,"work_id":"da91022d-40b3-432a-8d12-6fe13e81e530","year":2023},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.034438Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:97abfbb9fb32b4b942e8f5c5d9e588becf6b9a59311140909452ec2b0ee33cac","observation_id":"b2c6f6d8-9800-4059-a84c-c4873317280e","resolution":{"observed_at":"2026-08-07T15:21:16.689000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.093700Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.093700Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:d052b0f94ded59c9838e3b91d53efc8d0fec8f19fa1f07f93117d4baed3f9bbd","observation_id":"2c736d5f-51b0-4d83-b430-8bb752612624","resolution":{"observed_at":"2026-08-07T15:21:15.093700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.171551Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.171551Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:bdb3ef9eec703087c4f0d290af5f6784c70d00cf25a74de6b5c6c17f52beeac3","observation_id":"8d6a418f-6093-407c-94c2-7a97097d269f","resolution":{"observed_at":"2026-08-07T15:21:15.171551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02671","last_updated":"2022-05-05T14:25:46Z","snapshot_observed_at":"2026-07-06T13:07:01.819100Z","submitted_at":"2022-05-05T14:25:46Z","title":"What is Right for Me is Not Yet Right for You: A Dataset for Grounding Relative Directions via Multi-Task Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02671","snapshot_observed_at":"2026-08-07T15:21:15.234679Z","title":"What is right for me is not yet right for you: A dataset for grounding relative directions via multi-task learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.234679Z"},"links":{"cited_paper":"/paper/2205.02671","citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:7fcf14052670417c285132e820242050705a4bb527ab47b58d0c2acf6abc3609","observation_id":"9a429751-fb69-4ff3-b70e-16c03ab4fd54","resolution":{"observed_at":"2026-08-07T15:21:15.234679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.421271Z","title":"Embodied question answering","venue":null,"work_id":"37b9f44e-b158-470c-9b3e-f9ef755725df","year":2018},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.307972Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:8bef71ef73b8a12e814eb548c382ad48592674ac71fc8dc39ea970365a16d888","observation_id":"aa95f25d-8413-4f1c-bdc6-dff3c0d17766","resolution":{"observed_at":"2026-08-07T15:21:16.492098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.237663Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"514c2983-3e4a-4d62-98e4-8805c6c16adb","year":2018},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.362252Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:d7cd3cf2be133afcc29287067bd61589d82b0b28b39bfe0cd804c7d2d69a8e5a","observation_id":"d9b0369e-a073-456f-96b9-c14cb3d243d3","resolution":{"observed_at":"2026-08-07T15:21:16.324862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:16.037070Z","title":"Christensen and Gregory D","venue":null,"work_id":"3cb803eb-e7a1-48f5-8fe0-0ea96acb6d05","year":2016},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.406161Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:0f1f381f985806aac22c9293b12e6b6777b7fd32955bd0fdbbd3549b2339d5a0","observation_id":"2320ef47-b91b-4d3a-a440-3a5a62ef015f","resolution":{"observed_at":"2026-08-07T15:21:16.140182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.503226Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.503226Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:babb11553e35b0a5bac849d67ca78345bd808d6c44f4ff192d26b6f05e37fa30","observation_id":"8c0dbc78-7d6e-4cc4-8b85-fdebb3c0ba27","resolution":{"observed_at":"2026-08-07T15:21:15.503226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:15.878280Z","title":"Configuration D","venue":null,"work_id":"4c73c330-729f-4ead-8e80-2523fc743b1f","year":2021},"citing_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:15.562904Z"},"links":{"citing_paper":"/paper/2505.15517"},"observation_digest":"sha256:3bb0d43c902604c756bbe880c1d4b75f8afb0889c91138d1a5dbb913b56ccc5c","observation_id":"323bc312-f722-403f-a991-2854cc6ed622","resolution":{"observed_at":"2026-08-07T15:21:15.955382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 21 inbound Pith citation observations for arXiv:2505.15517."}