{"as_of":"2026-08-09T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26a4e8266b8be1d7114c82f3c68a2bef02a6c39c3bdbc0a3ae878a15ebdf403c","coverage":[{"denominator":112,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:16:15.718768Z","state":"measured"},{"denominator":124,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":124,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:29.605186Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:28:34.757769Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-06T20:47:29.605186Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-08T02:43:34.071635Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:29.605186Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:f0f38366128ca31f4442fdc46d9e6f74f0d628455ade39ad65c4ba4c4d5c4adf","observation_id":"92387108-7980-4289-8454-b5ce4b3b9582","resolution":{"observed_at":"2026-08-06T20:47:29.605186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2508.12043","last_updated":"2025-08-16T13:37:11Z","snapshot_observed_at":"2026-08-02T08:29:05.396468Z","submitted_at":"2025-08-16T13:37:11Z","title":"Talk Less, Fly Lighter: Autonomous Semantic Compression for UAV Swarm Communication via LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T07:37:38.901354Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2508.12043"},"observation_digest":"sha256:301d50e768794ff43e417627ec920b539c9c857f1e164546a24412d465f6fc6f","observation_id":"6253ce52-1ae4-49db-9f13-5e9949c949b3","resolution":{"observed_at":"2026-05-25T07:40:29.157371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-05T18:48:03.418621Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXivpreprintarXiv:2506.00123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.14157","last_updated":"2025-08-19T18:00:00Z","snapshot_observed_at":"2026-08-08T15:03:21.583227Z","submitted_at":"2025-08-19T18:00:00Z","title":"The high-speed X-ray camera on AXIS: design and performance updates","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T18:48:03.418621Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2508.14157"},"observation_digest":"sha256:d2f9ebba1156de170993c0bc8affee6c37b231d0f1d1f596bd2689d6b99db60e","observation_id":"cc80ffac-da6b-477b-bd31-f75cdccac3fc","resolution":{"observed_at":"2026-08-05T18:48:03.418621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-04T12:55:07.932813Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXiv preprint arXiv:2506.00123,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01711","last_updated":"2026-05-31T14:16:48Z","snapshot_observed_at":"2026-08-04T12:55:01.902418Z","submitted_at":"2025-10-02T06:41:22Z","title":"Contrastive Representation Regularization for Vision-Language-Action Models","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:07.932813Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2510.01711"},"observation_digest":"sha256:6de6ecbcb63608ee2ec795a0458ad222f9f126aa83b72a0e33243d74217d0bf2","observation_id":"8684ed19-c732-44f0-b64a-6561ec1fe91b","resolution":{"observed_at":"2026-08-04T12:55:07.932813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:a0c48235dcbc067943d58b69ec00673c11be37b41bd58738c3d0699111a92fef","observation_id":"80a4f563-9ab0-4a4d-96c2-d8e8d525ba01","resolution":{"observed_at":"2026-05-14T20:09:39.833644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:3d2b99e40b2978e7db7992a69a4fa35f209e6aa1c1debb0a1352a65fde2387d2","observation_id":"35c55ac7-b8a4-4f5b-ab32-c4361e29ce64","resolution":{"observed_at":"2026-05-17T20:42:05.714505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:07ccc105f47867c229d106218866c6a894d6d665c8d691bf345dacf410ea1bc1","observation_id":"189a4e30-35d9-47ed-9375-7da26e19f9ba","resolution":{"observed_at":"2026-05-13T21:08:17.373521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2604.08645","last_updated":"2026-04-09T17:57:35Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T17:57:35Z","title":"3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:51:52.063238Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2604.08645"},"observation_digest":"sha256:439cabd998be42bf418dcb13f1d7cab4fa21d71ba16b2d471b1205d6aff56d71","observation_id":"a7ea5a71-deb2-4e97-9c2b-897a4aad0f53","resolution":{"observed_at":"2026-05-11T05:56:00.254914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T17:57:00.909897Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:33ee9d6aa20e35012c9a6920ead3246c80de013ee4192aa999f4d46adb393b5b","observation_id":"0749cb87-7f03-44c0-bac1-e3af4955cb14","resolution":{"observed_at":"2026-05-20T17:58:49.605881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.16713","last_updated":"2026-06-11T14:17:29Z","snapshot_observed_at":"2026-07-06T23:27:48.303599Z","submitted_at":"2026-05-15T23:52:11Z","title":"GeoWorld-VLM: Geometry from World Models for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T19:02:05.125937Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.16713"},"observation_digest":"sha256:4bf36a6bbccf5d8b978232fbee9af21a1106f78bdeb6b0969b011ba886b740c9","observation_id":"37aa5277-49f8-4b04-8a43-0d65279cff87","resolution":{"observed_at":"2026-06-30T19:05:00.582050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.22536","last_updated":"2026-06-26T09:22:26Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:25:15Z","title":"SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T06:24:30.669956Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.22536"},"observation_digest":"sha256:fafaa9d159c72dc476ddae2da5613b8c9ca72316313a74acd7617daca7ded087","observation_id":"319808e9-17f6-4ce6-90d6-8db16d291176","resolution":{"observed_at":"2026-05-22T06:24:40.387049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.22536","last_updated":"2026-06-26T09:22:26Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:25:15Z","title":"SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:07:49.005419Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.22536"},"observation_digest":"sha256:29030fe49c69d3ec6810550467870fcebda6ea144db5e1d02583cc3605d00654","observation_id":"63e8f605-6c9f-4107-bda1-eca7581de84b","resolution":{"observed_at":"2026-06-30T17:14:57.282353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-09T12:02:18.891438Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:d024a89f941dbb9f2a3e9bab6f146d0721934dd1c550178cf5dc81ae195e2744","observation_id":"f8731dac-224d-47d0-9833-45ab6014a0b7","resolution":{"observed_at":"2026-06-29T21:33:58.950221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:944010c74cd96b00d0637e23047f296883bdedee3dfaac756ad06c14997d16cf","observation_id":"b4b13735-5d8f-4332-935e-4cce4db729cf","resolution":{"observed_at":"2026-06-29T13:43:28.937015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.03890","last_updated":"2026-06-02T16:51:32Z","snapshot_observed_at":"2026-07-06T23:44:05.167767Z","submitted_at":"2026-06-02T16:51:32Z","title":"OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:07.122615Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.03890"},"observation_digest":"sha256:1489d7aecbd7600ecca4095990ed251efa5bd913988e72be179cbfa4a6b6d620","observation_id":"cdae8602-7c06-4f94-b73c-6ab9c10f8ddd","resolution":{"observed_at":"2026-07-02T02:16:27.075845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:47.754632Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:7ea9f27ef5d903b11940cb291adf0d4a0b9e690f0bda4ddcbd4d697785095456","observation_id":"8b86d7ef-1904-4510-9c25-e011c7353b06","resolution":{"observed_at":"2026-07-03T06:07:41.154508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:7f7f388c98ed273d0174b40911112b991d413521a43aaae4ae820a75e1b1f8dd","observation_id":"ad9c88a9-defe-4f09-9434-36ed67cab158","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:26:32.209719Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:217a202296fdca6bce0b5a5a68be29b15899ed67fb98fac91258c0704462b0ea","observation_id":"be10cee9-94d9-40db-a399-91baf0cabd54","resolution":{"observed_at":"2026-07-03T15:28:34.760148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-02T11:43:49.639057Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces.arXiv preprint arXiv:2506.00123, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13040","last_updated":"2026-08-04T14:27:50Z","snapshot_observed_at":"2026-08-07T23:11:39.374619Z","submitted_at":"2026-06-11T08:20:42Z","title":"RoboProcessBench: Benchmarking Process-Aware Understanding in Vision-Language Robotic Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T11:43:49.639057Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13040"},"observation_digest":"sha256:a150b70cc3062c327b617f20a9f24f6d8e7f0eeedec36652b05f6ed86e750cef","observation_id":"ca74376b-ee0f-4340-892e-ef46ed4806a6","resolution":{"observed_at":"2026-08-02T11:43:49.639057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.13497","last_updated":"2026-06-11T15:46:28Z","snapshot_observed_at":"2026-08-08T06:01:02.358904Z","submitted_at":"2026-06-11T15:46:28Z","title":"SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T06:28:14.694168Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.13497"},"observation_digest":"sha256:45fac2d2430e02de56f24f470e7d6fb5848fdfd5a6b22993df3b122ff640d856","observation_id":"e7ce9633-15b2-48d6-adad-d5b498358984","resolution":{"observed_at":"2026-07-03T15:28:34.351453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":"2506.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-03T15:28:34.757769Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":"221fe55b-b4fc-4277-b4ad-6fcf8adb777a","year":2025},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T11:17:48.279808Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:3086610f9bef12a9d2fbfe7f5ef6b8302e2730398340ddba880b7ab7e9ccd5b2","observation_id":"880ac1a5-6849-4c80-8dfe-753e815bd6bb","resolution":{"observed_at":"2026-06-30T11:24:38.366106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-02T11:20:26.553333Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.15753","last_updated":"2026-07-28T07:01:04Z","snapshot_observed_at":"2026-08-02T11:20:24.852609Z","submitted_at":"2026-06-14T11:30:42Z","title":"RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T11:20:26.553333Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2606.15753"},"observation_digest":"sha256:9031f487ccc9ce1f5517a7e6be2c06c38c2379bca43d27a65f29b43c8742c331","observation_id":"9d610a94-38fe-468c-b91c-69837c2cc378","resolution":{"observed_at":"2026-08-02T11:20:26.553333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:dc465717418cb9957403eb02189d26a3e121ee37a73b65637d425afa38c1065a","observation_id":"5ca3a554-d397-484d-9748-597a412c8479","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-08-01T14:39:39.709300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-08T18:57:26.098275Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:39.709300Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:c5368ad50093af91729ccee01e1ea3b550f991df7db580c9b42e39b0491e73d8","observation_id":"e0899ac6-ff62-4be6-bdbd-271e62038c2b","resolution":{"observed_at":"2026-08-01T14:39:39.709300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00123/citation-record","integrity":"/paper/2506.00123/integrity","json":"/paper/2506.00123/citation-record.json","paper":"/paper/2506.00123"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:16:08.094257Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.094257Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cafacf5d42a24283a2385ee221d5c34a28ad25a073ee5f144099e2b500b03d51","observation_id":"1ee2d789-c94a-4f9b-a676-0cb0ed3ee942","resolution":{"observed_at":"2026-08-07T12:16:08.094257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T12:16:08.184567Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.184567Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:13c7a5666eb17970ac0e4cd110bab3b68dd44ce4600b619cd87c7aa352be0e6c","observation_id":"0674a851-2993-401b-9646-6fb3e9800e24","resolution":{"observed_at":"2026-08-07T12:16:08.184567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.271878Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Karén Simonyan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.271878Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9676cad2a7f1cc988c9aaebecf47769ba89f898d50e4a368ee22845c3ce43601","observation_id":"8518c5f4-2e1c-4473-9f98-374b29f9bc36","resolution":{"observed_at":"2026-08-07T12:16:08.271878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.351375Z","title":"Claude 3.5 sonnet.https://www.anthropic.com/news/claude-3-5-sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.351375Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:53da35c1e857b36f864fb01c8a140216ca5684cebd2cfced3a86024838bde09e","observation_id":"cb545fed-1e29-4216-b41d-865137d9a172","resolution":{"observed_at":"2026-08-07T12:16:08.351375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T12:16:08.414785Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.414785Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cee72247dcac59c4542181137df7fa8159d6056c290a829548fb13e91cd76164","observation_id":"0e05a99f-c97b-4d81-8e45-9c47448f95e1","resolution":{"observed_at":"2026-08-07T12:16:08.414785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.495975Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.495975Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:256f0118dcf268552256df00742ebaed86fece92b660ac0d66b2d0eadf06d189","observation_id":"fc79de96-659e-4e20-85b5-93b6aabad814","resolution":{"observed_at":"2026-08-07T12:16:08.495975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T12:16:08.566118Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.566118Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e5768d3d40ad5342629b64ff6298b27f07c93d8b98d6b435af1048c88552cbcd","observation_id":"e5e7458e-0d66-4212-a353-de4c5255c4d4","resolution":{"observed_at":"2026-08-07T12:16:08.566118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:16:08.626048Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.626048Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:03b858b20c9afded707cfcb2da136d48bff6f1cabb504dbbb7ab775a03b62465","observation_id":"3d9a7022-2f3a-407a-8a0b-fd1d9156406f","resolution":{"observed_at":"2026-08-07T12:16:08.626048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:16:08.701912Z","title":"arXiv preprint arXiv:2410.24164 , 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.701912Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:54f2541c9eb0d3fbd8b2d9ffabc44f3a98a61dbb66309e01f0582c390e202085","observation_id":"c32fc78d-0066-4baf-b491-4b4462ee1345","resolution":{"observed_at":"2026-08-07T12:16:08.701912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T12:16:08.777108Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.777108Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:03db3b900ae9d63ffef488ad2f459278c4fc645b4840d968131c015a44fabd7a","observation_id":"38f2732e-a4a2-4351-b414-6069c7abdd9b","resolution":{"observed_at":"2026-08-07T12:16:08.777108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T12:16:08.844533Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.844533Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:502d82c8ab5126f30261b61a5885795a6684134e6e82071495134c76cdb864a4","observation_id":"a0719468-b015-4571-b5ab-ce5ab0cee77c","resolution":{"observed_at":"2026-08-07T12:16:08.844533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:08.930024Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:08.930024Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:96bbb68f8d51d156b833770284ef18c2b2731debbf48750ed77bdf3cf3c02880","observation_id":"696b5cb8-bf54-4657-aabd-a0663a8265c3","resolution":{"observed_at":"2026-08-07T12:16:08.930024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02666","last_updated":"2024-07-02T21:00:30Z","snapshot_observed_at":"2026-08-01T19:41:22.511699Z","submitted_at":"2024-07-02T21:00:30Z","title":"Commonsense Reasoning for Legged Robot Adaptation with Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02666","snapshot_observed_at":"2026-08-07T12:16:09.000071Z","title":"Com- monsense reasoning for legged robot adaptation with vision-language models.arXiv preprint arXiv:2407.02666 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.000071Z"},"links":{"cited_paper":"/paper/2407.02666","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9242867f2e82afd21c76b952094e144f3ff6426454f4dc27f6bbe24cb1166e71","observation_id":"0b5be8d8-f62e-46fc-830e-a9989623dece","resolution":{"observed_at":"2026-08-07T12:16:09.000071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.066166Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.066166Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e1b7e8433fb27ecd0dcee37749f646a80a343caef68bbb196ff06af5dc0c3257","observation_id":"105cfb30-dcb7-4e70-8984-d9e75ec5ad05","resolution":{"observed_at":"2026-08-07T12:16:09.066166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.119149Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.119149Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0033d7885c9e418acb25433d60e9f740cc0acf695ce03f7a656613928dbf4b47","observation_id":"8675d496-772e-46a3-bca9-59a9e49115ab","resolution":{"observed_at":"2026-08-07T12:16:09.119149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T12:16:09.213009Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.213009Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:338412c7a2d178852a0e6f0481c2a808beb9d3d425a3cbec385dba9e1048fc70","observation_id":"1e55fa0c-5216-4a00-976a-ae8b94f5868f","resolution":{"observed_at":"2026-08-07T12:16:09.213009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.277793Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.277793Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:c5e297f76f7b857e2b3228cfc4f29b0b445b57ea7d609f7ce698c97d38bca46e","observation_id":"a4876270-6c15-403f-a4a6-07c8cb24c66d","resolution":{"observed_at":"2026-08-07T12:16:09.277793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T12:16:09.351955Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.351955Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0c145f9a927c0108c13003a57272f7d8dd56bc80988bdc1a7bce63f180abd6b2","observation_id":"d1407922-9ad2-4d3f-a646-e4f4e64c2731","resolution":{"observed_at":"2026-08-07T12:16:09.351955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T12:16:09.427092Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv: 2312.14238 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.427092Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d883f50609c8e6bbc6543fd42c43b69b1d3bbb63d483ce68d8f6957be0ed0343","observation_id":"3984c22a-1ba4-4e61-8e53-46502b5649fb","resolution":{"observed_at":"2026-08-07T12:16:09.427092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:16:09.508644Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.508644Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2602cc2285f29e18d7d6c4d130171008967ef1a17656ba0467848d1fb5b4b9f6","observation_id":"faf511ce-2e13-437b-8378-3041049502fe","resolution":{"observed_at":"2026-08-07T12:16:09.508644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T12:16:09.590815Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.590815Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:719a20ba720a6a39517069e6c753b69af44cc0c65ce6125ecb928404e909bd54","observation_id":"89df5c1a-f92d-4388-af89-4fa46b24b6bb","resolution":{"observed_at":"2026-08-07T12:16:09.590815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:16:09.666040Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.666040Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9d64877ee015c64a84da7bbb094289fcce97965c20661f7549488e34bca6fb3f","observation_id":"38816cc3-5d58-4c66-9782-0b54dcd0d5d0","resolution":{"observed_at":"2026-08-07T12:16:09.666040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15160","last_updated":"2024-03-01T00:58:50Z","snapshot_observed_at":"2026-08-06T05:19:02.464452Z","submitted_at":"2024-02-23T07:46:30Z","title":"Spatially-Aware Transformer for Embodied Agents","version":3},"cited_work":{"arxiv_id":"2402.15160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15160","snapshot_observed_at":"2026-08-07T12:16:18.353166Z","title":"Spatially-Aware Transformer for Embodied Agents","venue":"cs.LG","work_id":"e28dcb0d-f57a-4169-bbb9-5ba3eed7d927","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.736172Z"},"links":{"cited_paper":"/paper/2402.15160","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:7fd42117b1741f2bd3f9a46cc923be99f1fd0b35616b9559a88d27a1fe325e6f","observation_id":"75ef2d6e-407d-4877-85d3-9cfbbaa58328","resolution":{"observed_at":"2026-08-07T12:16:18.467967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.802384Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.802384Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a27c84052de3fd619a9097cdb03ebeb47bdce86bb10d3b35cae5f48026d632fa","observation_id":"80793765-2150-4de9-a05f-3f5f0f266ed7","resolution":{"observed_at":"2026-08-07T12:16:09.802384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.857532Z","title":"Simple and effective multi-paragraph reading comprehension","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.857532Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:12b975dc37203a44756e2c5ee25bd3ffcfd70729c1375422e7eb9a1d1657ef03","observation_id":"8d538287-bf9c-432d-833a-3fc1eeb760c6","resolution":{"observed_at":"2026-08-07T12:16:09.857532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:09.945386Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.945386Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:c2bba0ad8ee08f4cb967ef5a00108d672961b21a92fac95ef0abd04e1607384b","observation_id":"d85376bb-fe9a-4889-b1b1-c7529397f013","resolution":{"observed_at":"2026-08-07T12:16:09.945386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.021970Z","title":"Language modeling with gated convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.021970Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:83b7380ebba637aa5419acf6592dbe48d1ff918b7bbd86cd392f0db9e9a34d85","observation_id":"d9cd709d-1052-43be-89e4-9d466b983348","resolution":{"observed_at":"2026-08-07T12:16:10.021970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.102883Z","title":"Quar-vla: Vision-language-action model for quadruped robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.102883Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:c00bb9f2de5231d3f9753eff62bf20fb79b3437bda9845701f03a6428ec5bc81","observation_id":"2d053136-7bcb-43c0-81e8-7dbfb24ed116","resolution":{"observed_at":"2026-08-07T12:16:10.102883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.177298Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.177298Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d14192a850032c03d6d2c0373705daca5c998babee66e708e57c2a7ed1d6643f","observation_id":"e06e275e-ba11-47ba-aa0b-f6fc31c2dc26","resolution":{"observed_at":"2026-08-07T12:16:10.177298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T12:16:10.243116Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.243116Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:45482e1abf8a4592cf1e647ab764b0560470059868f679b276e867329bc2340b","observation_id":"6db3c8b1-01e1-4c50-9129-6fd6c48ccb2a","resolution":{"observed_at":"2026-08-07T12:16:10.243116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.287797Z","title":"Centernet: Keypoint triplets for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.287797Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:73cb94aeef72e4aca64917b1a958ee85f4cab528362b0ed017dfc9a3e433207f","observation_id":"2a0ae299-5844-406f-b090-fe6419e2ce68","resolution":{"observed_at":"2026-08-07T12:16:10.287797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.334062Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.334062Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b9bc6abf4090c213beb7cdd8639efa1394614efa3547125cbb371dbace5e44ba","observation_id":"f4629046-9ed0-43c9-80a3-4f6dfb2ca8a7","resolution":{"observed_at":"2026-08-07T12:16:10.334062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.403215Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.403215Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ce6ae4cefe35b24747a4ff1bebf095bef1c33e8f0da7b936fcee3eeeaf22f3f4","observation_id":"a8224738-d488-4f4f-8a18-9997eb7fa620","resolution":{"observed_at":"2026-08-07T12:16:10.403215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:16:10.499411Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models.arXiv: 2306.13394 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.499411Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f532268a48d7e171fff0eb80fcc0b689d0520eac664df6e47430f16b03e167ed","observation_id":"7c64dda6-17a7-4488-b991-c933513eb539","resolution":{"observed_at":"2026-08-07T12:16:10.499411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.597240Z","title":"Rlafford: End-to-end affordance learning for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.597240Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cd146a1004f57e20efde1891d1469096a7b896883a0bff4d3d588fe2ce4eea5c","observation_id":"a21a4e9b-e31b-4fac-89a6-3bdabb2ecf9c","resolution":{"observed_at":"2026-08-07T12:16:10.597240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.648005Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.648005Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4de19291729d501e7f9ed4dbe2bf6cc50240f0ffe87900d81a0656043c4d5dda","observation_id":"c49009cd-d63c-43e9-8140-b302563f7a46","resolution":{"observed_at":"2026-08-07T12:16:10.648005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.708199Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.708199Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:adf6d7fae4cc4747734f0414ce48606e11d351f41e29184e73b92a822490afd8","observation_id":"442877b5-7d93-4dc8-9674-df4b5cbf5740","resolution":{"observed_at":"2026-08-07T12:16:10.708199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.791941Z","title":"Girshick","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.791941Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:59b7447d85be687212b53fa11e6699807ac1f8d1a281e8633e64fd8669db7fa7","observation_id":"dee8501e-5fbc-4928-8892-5c0aed834f35","resolution":{"observed_at":"2026-08-07T12:16:10.791941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:10.876192Z","title":"3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems , 36: 20482–20494, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.876192Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d9d2cca764b0ec10059b261b679c65fbbb96b1a987787cca6a3a032acb211c89","observation_id":"d24edc9a-76f8-4ada-9938-76c194bc2301","resolution":{"observed_at":"2026-08-07T12:16:10.876192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-07T12:16:10.945513Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:10.945513Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2433f9eb86928e8ce2a36d78f708881e96faa5c78ec0f28e9a391fbf7338d787","observation_id":"ae01a1b4-d01c-473e-8aa0-0758d5d666d8","resolution":{"observed_at":"2026-08-07T12:16:10.945513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-07T17:07:05.445620Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-07T12:16:11.043939Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.043939Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:37520eb9fdf0debf798c2612dfbadf691943587f00152b9e9d76e1b21ea8ef96","observation_id":"83ed7cf1-98a9-455c-92d6-50f5faa34813","resolution":{"observed_at":"2026-08-07T12:16:11.043939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.134735Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.134735Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a4d66c6a658d52fde6cb5dc02e23bb927a331ac4b3bd18ae824bed23a73113c2","observation_id":"10c4ad44-4a1e-4e28-a4ca-ca0c0ec860da","resolution":{"observed_at":"2026-08-07T12:16:11.134735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-07T12:16:11.217497Z","title":"An embodied generalist agent in 3d world.arXiv preprint arXiv:2311.12871 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.217497Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f028a3c892b445d3bc4f13ff14e67f6482090426c8227c1f9a9a83f081b5445c","observation_id":"cc41a651-4953-4a73-932e-78c486576128","resolution":{"observed_at":"2026-08-07T12:16:11.217497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T12:16:11.289544Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.289544Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e63e988afa2b81af19247409a1e71862ffd981f4f46611e4d5c93325066655da","observation_id":"c08a66b9-b8f2-4040-b0e6-1a299e52ec87","resolution":{"observed_at":"2026-08-07T12:16:11.289544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.361561Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.361561Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:933c97e249bab6ff39f7224cd3089cb615dbe8770f0623e5372845a95a67d8ad","observation_id":"834ff20c-66be-4c9f-b9db-6b92c79dadcc","resolution":{"observed_at":"2026-08-07T12:16:11.361561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-07T17:39:03.240589Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-07T12:16:11.470944Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.470944Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:7755a710c392b8ddd350ebba0831ec44d3adf5a4f070025631eec85acea6fa9c","observation_id":"77e4ec0b-04f0-4385-a4a5-3a983426f210","resolution":{"observed_at":"2026-08-07T12:16:11.470944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.541136Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.541136Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:1fd8c55cb7bd58c294a0dabd4a51386d97db3be193d9c1d464b1ed5c53c8ab52","observation_id":"f7dafc7f-ff80-4db9-b147-1bce094aaacd","resolution":{"observed_at":"2026-08-07T12:16:11.541136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.628090Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.628090Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:a1c9f277190cbb3f59edd534a3ab423b1a44978007597cc32825e7a93f32d687","observation_id":"44b23ff9-3d8f-47d5-a5bf-9b174e55b26c","resolution":{"observed_at":"2026-08-07T12:16:11.628090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:16:11.687388Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.687388Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d219e38b1dec5d543ab0e056850b35199510da835765a8456c0334e62629da94","observation_id":"bf0d064b-94e1-4314-b8cc-85003f6d3a3e","resolution":{"observed_at":"2026-08-07T12:16:11.687388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-06T07:43:56.889679Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T12:16:11.756541Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.756541Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:c0db3870596aaf7baf37e9d5ad73069927e18638f1926a2276f38f89550c51db","observation_id":"22f767ef-56a2-4155-a22e-5bbff6497ade","resolution":{"observed_at":"2026-08-07T12:16:11.756541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.826342Z","title":"Cornernet: Detecting objects as paired keypoints","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.826342Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:1e7f49800c3124c11987db1ec930f86e027199e7d71001fa31b7f3ab78a70ed3","observation_id":"fe47318a-98c5-404b-89ef-ab3a454e34fc","resolution":{"observed_at":"2026-08-07T12:16:11.826342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:11.899475Z","title":"Learning hand-eye coordination for robotic grasping with deep learning and large-scale data collection.The International journal of robotics research, 37(4-5):421–436, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.899475Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:072e26466b403330959d588c67e369d53d733ada17d234e9c2b00e8be3759e8c","observation_id":"89609035-90f0-40cf-a3e8-4f2913f97ebc","resolution":{"observed_at":"2026-08-07T12:16:11.899475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T12:16:11.985639Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension.arXiv preprint arXiv:2404.16790 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.985639Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:81c3a56755921fc18bc2369782d86c906637853bd4a2ff9bcadfea96e897f80a","observation_id":"a87c0ae9-e60d-4481-af81-960fba18264f","resolution":{"observed_at":"2026-08-07T12:16:11.985639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:16:12.062017Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.062017Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:38c08d6d9d5aeb55815560765fe31d99bdcb077ac4feca610c1072dd0f62bc02","observation_id":"fb31d28c-6296-4572-9949-15950c5d4bab","resolution":{"observed_at":"2026-08-07T12:16:12.062017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.141295Z","title":"Learning agile skills via adversarial imitation of rough partial demonstrations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.141295Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:623fccece05a6131692a549c7925c1212e985c98ed0eb593cebefc3a8d334ab7","observation_id":"2d328658-9d72-4246-910b-1096cea908fd","resolution":{"observed_at":"2026-08-07T12:16:12.141295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.205947Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.205947Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:6f5d955b767f63e874bea679b84390ccbc9413c46cfce9d22f9116d4187b3d66","observation_id":"96670f96-a2ab-47ea-be94-64bf0c89c8af","resolution":{"observed_at":"2026-08-07T12:16:12.205947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.285277Z","title":"Omnicorpus: A unified multimodal corpus of 10 billion-level images interleaved with text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.285277Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:faf0a9e8d0052f9e547044d75049cfe11abd3b7542c92d7cbb7b0f207fe51d36","observation_id":"e3e139c2-7507-4bfa-abf1-f3de348530d5","resolution":{"observed_at":"2026-08-07T12:16:12.285277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16527","last_updated":"2022-06-10T16:57:51Z","snapshot_observed_at":"2026-07-06T12:54:54.273968Z","submitted_at":"2022-03-30T17:58:23Z","title":"Exploring Plain Vision Transformer Backbones for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16527","snapshot_observed_at":"2026-08-07T12:16:12.363276Z","title":"Exploring plain vision transformer backbones for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.363276Z"},"links":{"cited_paper":"/paper/2203.16527","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:8361bfaf24d91a8bf81e5d47a409a9dc384177410c48c8377d812edea5180951","observation_id":"b3524013-2008-4470-84d9-193b96830b34","resolution":{"observed_at":"2026-08-07T12:16:12.363276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00693","last_updated":"2025-07-27T09:58:24Z","snapshot_observed_at":"2026-08-07T15:57:18.694747Z","submitted_at":"2025-05-01T17:55:05Z","title":"Robotic Visual Instruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00693","snapshot_observed_at":"2026-08-07T12:16:12.453068Z","title":"Robotic visual instruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.453068Z"},"links":{"cited_paper":"/paper/2505.00693","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:779aa3aefdafa5cdb8ff5b34a67ae951f2838ddf0bcb8a7d4b63bf26519f3b95","observation_id":"2c551f63-1ff8-4ab4-af58-6f087d92ba59","resolution":{"observed_at":"2026-08-07T12:16:12.453068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.537280Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.537280Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b4de281667fd0e89b53fd90f755ed2677d63592e3c264e856b799816a833a9eb","observation_id":"8f210c89-75f5-4c59-8221-675fa03e43a8","resolution":{"observed_at":"2026-08-07T12:16:12.537280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.611092Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.611092Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b8c213562acf4926a92a9672941046ee3e6ce50309134d4206f67a3df0fac890","observation_id":"1f13fe24-c711-4692-bfd3-03c1f25cdbde","resolution":{"observed_at":"2026-08-07T12:16:12.611092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.689514Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.689514Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0d848607d170be63006233bbdc5349f32209b4a2c0360ff01c7770ab3a2c3482","observation_id":"e8a3dc0b-fc1d-446d-ac2b-f7452a92d593","resolution":{"observed_at":"2026-08-07T12:16:12.689514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00754","last_updated":"2024-11-21T18:52:31Z","snapshot_observed_at":"2026-07-06T18:55:45.493755Z","submitted_at":"2024-08-01T17:57:12Z","title":"Coarse Correspondences Boost Spatial-Temporal Reasoning in Multimodal Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00754","snapshot_observed_at":"2026-08-07T12:16:12.740878Z","title":"Coarse correspondence elicit 3d spacetime understanding in multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.740878Z"},"links":{"cited_paper":"/paper/2408.00754","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4520fecd0d4d11be9d6a208966e627a70630b66f0db4d093768f6e5fa3015934","observation_id":"06ca9977-97ca-4c6e-a229-b1cf9a2edc0a","resolution":{"observed_at":"2026-08-07T12:16:12.740878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:12.799211Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.799211Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:3efdb80a45b192042713845edc28df2df177fa9966b0291e70c9e4facc04df14","observation_id":"3daa9635-42f0-475b-8fd9-4acffa328232","resolution":{"observed_at":"2026-08-07T12:16:12.799211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T12:16:12.881890Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv: 2307.06281 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.881890Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:5a10383ace6c105e9b2501ee3d22738c8593d9cc6792aa745406cf1c852bb1bd","observation_id":"36f2259d-718a-4b25-8a9e-45b2f0ae47fc","resolution":{"observed_at":"2026-08-07T12:16:12.881890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-07T12:16:12.944251Z","title":"On the hidden mystery of ocr in large multimodal models.arXiv preprint arXiv:2305.07895, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:12.944251Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e7ce92be04cdf04645ba1d74d791976e98a63a2dc5983c76b459995bcabd966a","observation_id":"689a1580-0f37-41e1-a0c9-08676e08dfa2","resolution":{"observed_at":"2026-08-07T12:16:12.944251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.808678Z","title":"Mminstruct: A high-quality multi-modal instruction tuning dataset with extensive diversity","venue":null,"work_id":"65c09e78-5e76-4584-873a-4cd7cc87f636","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.046266Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d59cf36d58085dcbba9d621ed6c79a5ac4790302fbf565c4a457f6ffd7122352","observation_id":"1a306407-9e2e-46b0-b61d-48280076fd1e","resolution":{"observed_at":"2026-08-07T12:16:22.878623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-07-06T15:25:12.782361Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-07T12:16:13.117762Z","title":"Interngpt: Solving vision-centric tasks by interacting with chatgpt beyond language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.117762Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:34d5abc0916e0a2ad201aefd35bd4848471d2d4f4c979800e4a8dff562e53182","observation_id":"9e31acdc-ec99-411c-8518-ebe57bced002","resolution":{"observed_at":"2026-08-07T12:16:13.117762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08202","last_updated":"2025-03-13T06:09:17Z","snapshot_observed_at":"2026-08-09T05:13:18.023230Z","submitted_at":"2024-10-10T17:59:22Z","title":"Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08202","snapshot_observed_at":"2026-08-07T12:16:13.209440Z","title":"Mono- internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.209440Z"},"links":{"cited_paper":"/paper/2410.08202","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:03a6aa4e18bd9d7b25276ab7dafd63a19304d1c1263bab2ce940d27511875491","observation_id":"8ef13d95-c7ca-4dad-b000-c89cc7399d84","resolution":{"observed_at":"2026-08-07T12:16:13.209440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-07T12:16:13.281354Z","title":"Sqa3d: Situated question answering in 3d scenes.arXiv preprint arXiv:2210.07474 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.281354Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:1314b9d3bb61b2d136a092383596bb256a50e055f0da18170d4798f838cb08c0","observation_id":"5e872cd2-3e60-48b5-b16e-e9c2b767fd75","resolution":{"observed_at":"2026-08-07T12:16:13.281354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.651464Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence? Advances in Neural Information Processing Systems , 36:655–677, 2023","venue":null,"work_id":"484adb4d-82fa-452d-a08f-ef391cb6568e","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.345167Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:9134090e22f4f4fc90ffa11f4ee1f6b1798b959fbcc7f1e32f0ab35d3e0f7be4","observation_id":"3213c8d1-cdf6-4d3c-ad23-d6aa78d04de1","resolution":{"observed_at":"2026-08-07T12:16:22.723933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.421333Z","title":"Walk these ways: Tuning robot control for generalization with multiplicity of behavior","venue":null,"work_id":"2509d694-793b-496b-8542-5933f3d5df5a","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.401055Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:53f731495ec90951cb28cd5758f5b05fc3f31321152582e5c969f8c3bcafaf21","observation_id":"0efa2d26-a987-441b-8041-4ffb0a5eeab3","resolution":{"observed_at":"2026-08-07T12:16:22.514359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:22.156544Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"f7d9aec3-0a85-466e-ad27-5cae7ec9a91d","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.458663Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e838a517322ce3cfe18b0a41ba104b79fcf3ab636b7c26b5778401e39239cc20","observation_id":"060f98ff-3b53-4e2c-a68b-e3d12ac5f5be","resolution":{"observed_at":"2026-08-07T12:16:22.241222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.944644Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"dbdee591-eaed-41b7-9dd0-e511320b6ca1","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.513833Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b511eb0932883121bf9a7e42e6c5d79cc9dff9af7b789a1bb61123802dce39f0","observation_id":"8129ca85-7683-47cb-b8ce-15aea4b9dbb6","resolution":{"observed_at":"2026-08-07T12:16:22.059153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.759653Z","title":"Infograph- icvqa","venue":null,"work_id":"daf8fe64-5fa4-4e45-9d79-2cdb697268f4","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.613661Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:5d06f55169d6306fe8a8f5a16be87890d46e723f2c474a3d9190e0e880ae83aa","observation_id":"3251f2c2-46c5-4ac7-92ad-062f19267b9b","resolution":{"observed_at":"2026-08-07T12:16:21.829698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16578","last_updated":"2024-12-03T03:49:24Z","snapshot_observed_at":"2026-07-06T18:35:59.208843Z","submitted_at":"2024-06-24T12:14:24Z","title":"QuadrupedGPT: Towards a Versatile Quadruped Agent in Open-ended Worlds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16578","snapshot_observed_at":"2026-08-07T12:16:13.696485Z","title":"Quadrupedgpt: Towards a versatile quadruped agent in open-ended worlds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.696485Z"},"links":{"cited_paper":"/paper/2406.16578","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b36dbb9a55fbdb93fe76998ae304ef866b4006e4592101298e2d9039869ec6a3","observation_id":"453ef401-645e-4c86-b12e-a34b569110d1","resolution":{"observed_at":"2026-08-07T12:16:13.696485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.460883Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought.Advances in Neural Information Processing Systems, 36:25081–25094, 2023","venue":null,"work_id":"b1ed10a9-7b2f-418f-acb2-859890975be3","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.764571Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d3fcf9794adc4d92687003122c19fb8f0efad56d315d387d718be61b39c3d1f1","observation_id":"93073953-f24b-452a-846b-123bb4f6078a","resolution":{"observed_at":"2026-08-07T12:16:21.643942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-07T12:16:13.840242Z","title":"R3m: A universal visual representation for robot manipulation.arXiv preprint arXiv:2203.12601 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.840242Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:44fc412da49230d5670903860eb7065931c015e556ba62b746a7c97476a440c0","observation_id":"20ec6a30-082c-4364-9530-38aabc8e2478","resolution":{"observed_at":"2026-08-07T12:16:13.840242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.210202Z","title":"Gpt-4o system card","venue":null,"work_id":"a93df020-cfc3-4005-9e92-68341f4b8154","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.906541Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:577b3feecf10d65a2942350cc24281852b272de4f989718678cfbdb4cb4153bf","observation_id":"59d906ba-aa13-49cb-bb2d-79eef539f927","resolution":{"observed_at":"2026-08-07T12:16:21.324300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:16:13.992330Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:13.992330Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:0245e7930a84188ce36b60c82683eb6b0109338753e9c7bb482ca4681bdb34ba","observation_id":"6fa5edb8-db68-4971-9e85-c132ddab602c","resolution":{"observed_at":"2026-08-07T12:16:13.992330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-07T12:16:14.104148Z","title":"Gpt4scene: Understand 3d scenes from videos with vision-language models.arXiv preprint arXiv:2501.01428 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.104148Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:17486df099d792c90f63eef19b9305ca45cc0b88cc19dbe0a4d48175294c324b","observation_id":"859eb22a-392a-4190-b6e6-45f594123c8b","resolution":{"observed_at":"2026-08-07T12:16:14.104148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:21.005886Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":"b52d6918-cc28-48df-821b-99478485ebef","year":2018},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.201504Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:13f71fe958fbeae2c194eb7ff3bc8b73ee828b0a290ad45ef0a0652b203b0fa7","observation_id":"f0efc46c-7e1b-425c-8ae2-b32a44a583ca","resolution":{"observed_at":"2026-08-07T12:16:21.114182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.803992Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d7bce5e8-26cc-47b6-a8a5-43ac4cfafee8","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.275120Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:083d2a1578a0559520c49d6da0b8248cc726110b88e5bdf73351245e1254c565","observation_id":"5c89e3d8-d4fe-4810-833e-1931d3ffc11c","resolution":{"observed_at":"2026-08-07T12:16:20.918889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.521579Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b98225cb-92ae-4311-ab2f-01676c792297","year":2021},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.329877Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:403625e0a328b3674b45e189b88d140369de916f4d6023a580ab9fd053227e87","observation_id":"ee3335e7-0fd7-4dfd-b5a8-50e2e5a0eabb","resolution":{"observed_at":"2026-08-07T12:16:20.665790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.292167Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":"0532ae15-bb09-4995-aeac-6f7d87a6564e","year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.436516Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ca91f961118573865ce1dd46993d0370f73b16d3d9ee707dd0337c00e395df51","observation_id":"cf7157ea-f21c-4296-8883-60c90dca772f","resolution":{"observed_at":"2026-08-07T12:16:20.397881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:20.080656Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"ded98445-16ac-4e30-acc5-f89cd9ab971c","year":2022},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.584871Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:d89d20996ac18f5747cba87532e50896c3cff428aa41176ca68aede4e9378992","observation_id":"9add7871-7f36-4f34-a621-f36582eb566d","resolution":{"observed_at":"2026-08-07T12:16:20.194602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.893717Z","title":"Towards VQA models that can read","venue":null,"work_id":"a4ac7f18-c8ff-473f-81da-ff5afa304d9f","year":2019},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.692031Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:65fdd61d8f4a2234cedb32c0b859418b1452f43c225efd1611189fdb476f5342","observation_id":"2a71a9fb-6724-476b-abb4-411f7b0e9b7c","resolution":{"observed_at":"2026-08-07T12:16:19.971053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-07T12:16:14.782958Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.782958Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:b94082077c8944c37b878653b577f6fb3834faed6e392dde55772a56a3ca10ce","observation_id":"e6059b5a-5b2a-4cda-8596-327f9ed638db","resolution":{"observed_at":"2026-08-07T12:16:14.782958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09816","last_updated":"2023-01-24T05:01:23Z","snapshot_observed_at":"2026-08-04T13:36:36.479540Z","submitted_at":"2023-01-24T05:01:23Z","title":"SMART: Self-supervised Multi-task pretrAining with contRol Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.09816","snapshot_observed_at":"2026-08-07T12:16:14.859943Z","title":"Smart: Self-supervised multi-task pretraining with control transformers.arXiv preprint arXiv:2301.09816 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.859943Z"},"links":{"cited_paper":"/paper/2301.09816","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:f8414eb79bdcacd62bc65f798c1a9d8c2ddf4fd8dece67d1d41d0837fcc9a5ab","observation_id":"74674bf9-e778-4018-b380-b4b587df19cd","resolution":{"observed_at":"2026-08-07T12:16:14.859943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:16:14.937333Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:14.937333Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:00ca8f94f730c03fbad1bd079a227ad89fc657a72c1ca94b9f85c87e1a9d866b","observation_id":"8ffe0a2d-f610-42fa-841c-d5d9ab45293f","resolution":{"observed_at":"2026-08-07T12:16:14.937333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:16:15.034425Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.034425Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:459d277d269dca83c7251389665b0001c6b0e03a030c6e590d4c40262b6ed1c4","observation_id":"34992c8b-5c2f-461a-9ebd-97bd33f16688","resolution":{"observed_at":"2026-08-07T12:16:15.034425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T12:16:15.105152Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.105152Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:315f8153e88e5e27f546646775a3e97b2f9c69f58e829d4f34f08e99dee60223","observation_id":"dfa936c2-1361-44c1-aca6-700a74758dfc","resolution":{"observed_at":"2026-08-07T12:16:15.105152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:16:15.176031Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.176031Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:704e195119a7a37f6090ab65e13c1f0a880243eb81e02c115543ee5caa183714","observation_id":"61693193-d58e-4177-8a7d-ee10df47b7af","resolution":{"observed_at":"2026-08-07T12:16:15.176031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:16:15.268308Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.268308Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:86da66fec11138b4f7c4b57718edbe8e9ecf6df121a3dcee379f22c2c3d54e77","observation_id":"06719993-6dd7-4eac-95f8-55b4e8a21ec3","resolution":{"observed_at":"2026-08-07T12:16:15.268308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.787135Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world","venue":null,"work_id":"51b916ec-bd3e-465b-8202-d3dcfbea47b9","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.352827Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cb1a5df08658e433cbbaf1a019cca0630188e2e2202c4dd684c3f6a7d5533c9b","observation_id":"a41ee9bc-cd25-455a-8f98-20c48cd04f0e","resolution":{"observed_at":"2026-08-07T12:16:19.827901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:16:15.449497Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.449497Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:ad6cf2865ab3afb64871afb844e0278833926a591388548678bb7fe2e7df7716","observation_id":"e1d03a9a-3438-4690-a6a9-9da73d0da9e6","resolution":{"observed_at":"2026-08-07T12:16:15.449497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:16:19.664089Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"980b9af1-45a7-40f8-9521-e33a8bc11a7a","year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.510411Z"},"links":{"citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:e322a2dee50ebd492b7306b2f93aa90843c9310d13306317878a9bed47f3a569","observation_id":"e412d259-4bc0-4a4d-8e91-d339d6ca3b4e","resolution":{"observed_at":"2026-08-07T12:16:19.721585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:16:15.576937Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces.arXiv preprint arXiv:2412.14171 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.576937Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:04b0e896cf63ec05378a20164f02550ea02e694aab36fa5694506e79de73dd6a","observation_id":"eaff1423-9048-4f1f-8ee2-dd20b974265f","resolution":{"observed_at":"2026-08-07T12:16:15.576937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T12:16:15.641523Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision).arXiv: 2309.17421 , 9, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.641523Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2b8993a50aa8443bbb6d5f416fa8ab1b70ccd19d13b8f2e4cef3c1fed2338ae6","observation_id":"239354fb-65f5-4647-9534-f23f80f943f4","resolution":{"observed_at":"2026-08-07T12:16:15.641523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T12:16:15.718768Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:15.718768Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:cde915ee248469a1677268a3a8b1d75b4c0e8c5f09db2722874bdafebd4d1334","observation_id":"8944cc7b-10b1-4c98-b1bf-5159dde0e1f4","resolution":{"observed_at":"2026-08-07T12:16:15.718768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":112},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 112 outbound references and 24 inbound Pith citation observations for arXiv:2506.00123."}