{"as_of":"2026-08-23T15:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdd37f09cc6a5e709594af08eac6579cbf2da76e118af12687a1e0097635e1d0","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T18:18:27.211034Z","state":"measured"},{"denominator":162,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":162,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":133,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:08:58.446528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":14,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T05:51:18.508352Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2403.12945"},"observation_digest":"sha256:6b517c513b9f35578e883f4c53e6768b08c238d19dba35be6a0fe1bb2a691b4e","observation_id":"a41e3deb-0fa0-4796-8413-d4d595ae3519","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:2822409a4d842065644863fc40daa965ae1fc6854d526ed633dfbdecb04c7622","observation_id":"2d975812-61d1-4c09-b249-95e8f1228012","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-12T19:10:14.723298Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10943","last_updated":"2024-11-17T02:44:56Z","snapshot_observed_at":"2026-08-20T12:37:12.500700Z","submitted_at":"2024-11-17T02:44:56Z","title":"Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-12T19:10:14.723298Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2411.10943"},"observation_digest":"sha256:15be393dd5a15665667cf254db9e9fa2f70295a0a70a870f2bf3a7237315476b","observation_id":"d9f196ac-444b-4a81-99da-629611871e77","resolution":{"observed_at":"2026-08-12T19:10:14.723298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-12T12:10:40.564363Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-08-16T10:14:53.516684Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:40.564363Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2411.17465"},"observation_digest":"sha256:a2cfaad7d0c63ed722504882d28f706d16af360ba031b781f3f1996bf9502f5d","observation_id":"9c8a6d4a-033b-4043-b8b2-31194363a28f","resolution":{"observed_at":"2026-08-12T12:10:40.564363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-12T04:35:37.029873Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-19T10:09:56.914941Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.029873Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:c335e84db7a4c0200d3f4b1fbb8ee1526394f25ef7616e7b11546b1e53737a10","observation_id":"83f99ab1-5a8a-4afa-a952-dbb517c0ee36","resolution":{"observed_at":"2026-08-12T04:35:37.029873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:47dcd6b48c19cb00c8d57d91651aac3bd1ad37df042b7162d393d8bf56413e61","observation_id":"5a3c3806-e811-4803-a045-c40be984e3f8","resolution":{"observed_at":"2026-05-17T21:37:50.824010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-10T21:42:16.466796Z","title":"3d-vla: A 3d vision-language-action generative world model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04276","last_updated":"2025-02-19T14:13:51Z","snapshot_observed_at":"2026-08-14T02:40:44.865095Z","submitted_at":"2025-01-08T04:54:28Z","title":"Bridging Adaptivity and Safety: Learning Agile Collision-Free Locomotion Across Varied Physics","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T21:42:16.466796Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.04276"},"observation_digest":"sha256:c28ecfd093f972a7e2088943e136f3c5ffa4a3023b64abc4805342f5c2c6b4ec","observation_id":"4312bfa2-5b9b-490a-921c-217ff4d7ae90","resolution":{"observed_at":"2026-08-10T21:42:16.466796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-21T12:00:56.615813Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T23:09:34.805552Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.07542"},"observation_digest":"sha256:d0573afd5feed4db546071c3f8c01f2614d361f55ef5810892cc376fa507f2da","observation_id":"2d10f1bf-b5df-40ff-abd3-8cefb998b810","resolution":{"observed_at":"2026-05-16T23:09:34.870777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-10T20:11:32.501631Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09307","last_updated":"2025-03-10T08:46:11Z","snapshot_observed_at":"2026-08-18T03:36:00.646566Z","submitted_at":"2025-01-16T05:40:37Z","title":"RoboReflect: A Robotic Reflective Reasoning Framework for Grasping Ambiguous-Condition Objects","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:11:32.501631Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.09307"},"observation_digest":"sha256:0915f926d3db3cf41ef49319bddb1fdba9b6501a2ad80078f1a45326aa29369e","observation_id":"ff6da187-d1c0-4359-9aea-5a10f721b7dd","resolution":{"observed_at":"2026-08-10T20:11:32.501631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-08-21T05:15:36.931588Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b41f7f55fddcd9435d587691a6e2f81050fe695a43ac8b4d41e82805ad426ea2","observation_id":"74032957-6ba3-4cf5-b1ba-8fb2cc4d88bd","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-10T19:47:36.637748Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-15T10:36:09.653529Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T19:47:36.637748Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.09783"},"observation_digest":"sha256:1bd68757f9461b9d2563347b3f85c6c9429c959fd3626afbb357a2d2f3206777","observation_id":"3999e930-803c-42fe-ae4e-cee7ca3af88e","resolution":{"observed_at":"2026-08-10T19:47:36.637748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-10T18:53:00.951935Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":244,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.951935Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:53ece8d26d2b402e91a5e9f967382f9811f59936cd9120c81a725342b5f0b6c6","observation_id":"5b9472d6-1d08-4b76-b0b4-0eed4be64b16","resolution":{"observed_at":"2026-08-10T18:53:00.951935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-09T22:13:14.945152Z","title":"3d-vla: A 3d vision-language-action gen- erative world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-14T12:42:36.436107Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.945152Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:79e9bd997ce9f0a7031201d5483ce0fc873cf229baac2aef3268ffc019095519","observation_id":"73dd6cfd-4145-4c5a-acc3-baefae20e169","resolution":{"observed_at":"2026-08-09T22:13:14.945152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:524efa1b865d301b459359513c9121a697b1185e346fad884d41224a38a19d1d","observation_id":"6e311560-b342-4516-8f30-a641bd5605d6","resolution":{"observed_at":"2026-05-14T19:48:48.999906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-08T13:35:17.903956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-18T16:52:11.985587Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.903956Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:545e3a2abb7bf36c9d0dd8fd75ccc6a7af31f41e296b188808d243b63a71ad49","observation_id":"71c95e1a-7b16-4ade-90ca-b0ae8150b446","resolution":{"observed_at":"2026-08-08T13:35:17.903956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:d8e2b5e2d854ac0743b933429fb636c8ea972ee3db01196bc484429e7b34f467","observation_id":"169c83f6-dd58-4877-beda-9487749e1334","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:4ca6ac3b8f1ab24f6917350592131b771d2b2fa18827ff146e179037328badef","observation_id":"c656c790-2eb5-4a55-b911-72ad627b1760","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:231dba19069b5cba6fbd4c07f8062fd94d33bd93ea187f52d142ff5184ab1192","observation_id":"c310e0ce-5b0d-49ce-8724-05321ed2f72e","resolution":{"observed_at":"2026-05-16T05:21:45.165892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:7f89cc2ab079ebfb170c0aea8a0f60ec8c253a984dbebfcc24782d3daa640153","observation_id":"2dba29be-db06-4c0a-8c69-5dff826f3490","resolution":{"observed_at":"2026-05-22T18:05:00.949393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-16T10:08:58.446528Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18945","last_updated":"2025-04-26T15:07:38Z","snapshot_observed_at":"2026-08-18T10:11:38.298160Z","submitted_at":"2025-04-26T15:07:38Z","title":"Generative AI in Embodied Systems: System-Level Analysis of Performance, Efficiency and Scalability","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:08:58.446528Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.18945"},"observation_digest":"sha256:18d7ea54667598cf2c6c0b26e91e5209586b7260aa44f9707ca07b7317bcd831","observation_id":"0a805211-7440-4d80-a92c-34c9e0a3afd7","resolution":{"observed_at":"2026-08-16T10:08:58.446528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-16T05:58:28.463384Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19500","last_updated":"2025-04-28T05:43:14Z","snapshot_observed_at":"2026-08-16T22:31:26.233204Z","submitted_at":"2025-04-28T05:43:14Z","title":"Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T05:58:28.463384Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.19500"},"observation_digest":"sha256:d4c1d524e7bd75517289de27c69441b52015780c91128656ce776305600217bb","observation_id":"159917a2-244a-47dc-afd8-8c86931c3136","resolution":{"observed_at":"2026-08-16T05:58:28.463384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-16T05:18:56.748799Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-19T20:36:18.684533Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T05:18:56.748799Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.20995"},"observation_digest":"sha256:aa1b8f39ff3b589fe3a70aaddcba0fce57b891ed2e27e80d6440bc6300a4626a","observation_id":"39e33cb3-5677-4d04-a67a-8035344bc37b","resolution":{"observed_at":"2026-08-16T05:18:56.748799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-16T04:40:34.175869Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00693","last_updated":"2025-07-27T09:58:24Z","snapshot_observed_at":"2026-08-18T11:59:01.579843Z","submitted_at":"2025-05-01T17:55:05Z","title":"Robotic Visual Instruction","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:34.175869Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.00693"},"observation_digest":"sha256:d7ea2b42589249cfa14d4113a393df5b2af3b938a3ede04cadd398f4febb5747","observation_id":"745f23fe-ccc6-4bb1-bd3a-9a7f00823540","resolution":{"observed_at":"2026-08-16T04:40:34.175869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-17T09:50:38.119234Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:fab7bd80055c3a33a1654d3a03045982ff88f310b1a0e8f31383d699e62f8d46","observation_id":"5972453f-af9c-4f0e-8a91-c0ec38829814","resolution":{"observed_at":"2026-05-17T20:55:52.314853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2505.03500","last_updated":"2026-05-01T03:34:16Z","snapshot_observed_at":"2026-08-13T09:19:23.018615Z","submitted_at":"2025-05-06T13:05:04Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T16:46:05.993833Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.03500"},"observation_digest":"sha256:b2544b4fb3e246202c508ffab4016f690b42060ea4e83ccbcbff8169220da083","observation_id":"a857750e-8bfe-40c8-b84b-249362800f93","resolution":{"observed_at":"2026-05-22T16:46:47.455578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T23:22:11.023031Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04965","last_updated":"2025-05-08T05:49:06Z","snapshot_observed_at":"2026-08-20T12:03:40.448986Z","submitted_at":"2025-05-08T05:49:06Z","title":"DenseGrounding: Improving Dense Language-Vision Semantics for Ego-Centric 3D Visual Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:22:11.023031Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.04965"},"observation_digest":"sha256:4553fa4471e6bd22d4f94e26dc58aacad2c14da8d65c41582e5c16424a33bbd3","observation_id":"e7086f8d-467e-4228-b22c-bc9786ff61fd","resolution":{"observed_at":"2026-08-15T23:22:11.023031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T22:06:24.167765Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08194","last_updated":"2025-05-13T03:02:36Z","snapshot_observed_at":"2026-08-15T21:58:54.721464Z","submitted_at":"2025-05-13T03:02:36Z","title":"CLTP: Contrastive Language-Tactile Pre-training for 3D Contact Geometry Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:06:24.167765Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.08194"},"observation_digest":"sha256:8f6f3dd81bcc8bbabf302752aad3b04d5b83a6fd3842762267a9f85ec5f97708","observation_id":"5095a52b-d1a3-4946-b666-ab2ad5062b46","resolution":{"observed_at":"2026-08-15T22:06:24.167765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T22:04:36.375870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-18T01:42:20.495799Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:04:36.375870Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.08243"},"observation_digest":"sha256:79151c47ae09233d2e35340660b61bb9cef7aa78a031a054d59dbea695f1d6be","observation_id":"30055d34-7ab0-4b3e-9974-361af1ee686c","resolution":{"observed_at":"2026-08-15T22:04:36.375870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T21:33:01.955606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09577","last_updated":"2025-05-14T17:29:35Z","snapshot_observed_at":"2026-08-16T01:02:50.753208Z","submitted_at":"2025-05-14T17:29:35Z","title":"VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:33:01.955606Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.09577"},"observation_digest":"sha256:91e88414cc0d6cf8691a565a38f20fb2d1f48b6b332b6f87d4dcc015438e3d03","observation_id":"8cff7998-77ee-4db3-8159-e59f5b25357d","resolution":{"observed_at":"2026-08-15T21:33:01.955606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T21:34:17.026537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09603","last_updated":"2026-06-19T22:39:39Z","snapshot_observed_at":"2026-08-19T08:29:21.575301Z","submitted_at":"2025-05-14T17:55:10Z","title":"DataMIL: Selecting Data for Robot Imitation Learning with Datamodels","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:34:17.026537Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.09603"},"observation_digest":"sha256:d78c1f32139f410d63d0818da7b1e3b07187fa05eded1d73da3305a2a28a99e8","observation_id":"eebb4f1c-5abf-4e3f-9713-304fc97b826c","resolution":{"observed_at":"2026-08-15T21:34:17.026537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T20:33:12.777054Z","title":"put on\" task,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12744","last_updated":"2025-05-19T06:00:14Z","snapshot_observed_at":"2026-08-17T20:30:55.214558Z","submitted_at":"2025-05-19T06:00:14Z","title":"Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:12.777054Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.12744"},"observation_digest":"sha256:457ce734803a62c9daf4259c832b8d08ee622cd7c85adbfbc57fb9ad7bb4cefe","observation_id":"a3ad2b89-8e9e-4b9e-9570-0e14eb8bb404","resolution":{"observed_at":"2026-08-15T20:33:12.777054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-08-15T18:20:46.934326Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:c1d0103cd074ee1ebe7b6523a0c85f8e475e7ece801e2f2a8fb04ef8a9cd603c","observation_id":"6d2c2cdd-fcc1-4865-ab40-e0e70f9af25c","resolution":{"observed_at":"2026-05-17T15:59:08.880467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T14:23:17.804686Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-13T23:10:23.707893Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.804686Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:a60ec796c3d1f99ba343494aeca9ad8f33b4582f2cfdb6e60f2117497bc602a4","observation_id":"058a3be1-e52f-4b8d-b071-11be389466cb","resolution":{"observed_at":"2026-08-07T14:23:17.804686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T12:45:25.445765Z","title":"3d-vla: 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-19T18:45:15.073189Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:25.445765Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.23705"},"observation_digest":"sha256:1b3e7907b73f7c24fff62f3c924fb04c003d0b0686681fe6e59a2cd5ff3feeb5","observation_id":"ae070d1c-4485-46b8-ab14-35feabada817","resolution":{"observed_at":"2026-08-07T12:45:25.445765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T10:26:51.760825Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05217","last_updated":"2025-06-05T16:33:32Z","snapshot_observed_at":"2026-08-12T12:12:30.564086Z","submitted_at":"2025-06-05T16:33:32Z","title":"DSG-World: Learning a 3D Gaussian World Model from Dual State Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:51.760825Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.05217"},"observation_digest":"sha256:56f70407be2c42c4b372846a0f37cc4a4fa6365f670aaf93ac917dca34f36e43","observation_id":"38e1098c-acb6-48fe-a4e1-8b5bb8bb162a","resolution":{"observed_at":"2026-08-07T10:26:51.760825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:7653b0c105421935feb54f8fff932a0acfc3ddfa5037541539ad0b7e66fe4552","observation_id":"2f26de07-ff57-449c-b422-21cc47b85286","resolution":{"observed_at":"2026-05-15T14:18:51.738931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T00:57:29.901136Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-16T05:58:22.870564Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:29.901136Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:016b42bf16da449ef571de9b7e6ae4314ed56834a6b614b21d123c9b20005d9a","observation_id":"7601f167-343c-4e52-a9cd-4ace54fb07e0","resolution":{"observed_at":"2026-08-07T00:57:29.901136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T20:03:56.657488Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13725","last_updated":"2025-06-16T17:31:16Z","snapshot_observed_at":"2026-08-19T13:28:32.874669Z","submitted_at":"2025-06-16T17:31:16Z","title":"CEED-VLA: Consistency Vision-Language-Action Model with Early-Exit Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:03:56.657488Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.13725"},"observation_digest":"sha256:b5b12927b9c2c42ef4c9f72c03bd5bfd85675e438571c269b9a82f6fd1bea98d","observation_id":"28d62628-12bb-4d40-bd52-e4a219ccefa7","resolution":{"observed_at":"2026-08-15T20:03:56.657488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2506.14135","last_updated":"2026-05-22T16:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T02:55:20Z","title":"GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-25T07:48:33.832017Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.14135"},"observation_digest":"sha256:93f1612d4e09380d6d54dd93638be451836b6eec6d4fbff2f4b14e41349aed42","observation_id":"064c76d7-2151-4ef2-b5fb-b740272f4835","resolution":{"observed_at":"2026-05-25T07:50:29.186539Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T19:48:11.784305Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15096","last_updated":"2025-06-18T03:06:01Z","snapshot_observed_at":"2026-08-18T16:23:13.707856Z","submitted_at":"2025-06-18T03:06:01Z","title":"DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:48:11.784305Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.15096"},"observation_digest":"sha256:a3af54fee146fe4f242c7d5b87ccda53a86cd01d6afad875122c7acdc7122048","observation_id":"598224b6-42f0-4c7a-81d7-4efecd310df9","resolution":{"observed_at":"2026-08-15T19:48:11.784305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2506.17697","last_updated":"2026-04-06T20:47:33Z","snapshot_observed_at":"2026-08-14T16:43:55.465781Z","submitted_at":"2025-06-21T12:08:19Z","title":"Beyond Syntax: Action Semantics Learning for App Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T07:31:33.690689Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.17697"},"observation_digest":"sha256:c6ab6f9f952508c36c0825f1c76494784d645117d406b3c9eee55f1408eca307","observation_id":"336692a1-eda4-4520-9bc3-b1f0b07728e7","resolution":{"observed_at":"2026-05-19T07:32:08.750282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:6b16238cc91d6ce6e328ae28d3f22e67d7b0528b4575f1fead00075d75a80bb5","observation_id":"b7875404-7e74-441d-8324-22f30dab737a","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T21:31:04.898771Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24044","last_updated":"2025-06-30T16:50:02Z","snapshot_observed_at":"2026-08-19T22:31:35.698906Z","submitted_at":"2025-06-30T16:50:02Z","title":"A Survey on Vision-Language-Action Models for Autonomous Driving","version":1},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-08-06T21:31:04.898771Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2506.24044"},"observation_digest":"sha256:17c19dbffff48dd8956c9cf4cad8ffb7471e2a301f3a59ecca9d8ecb8e563101","observation_id":"dc0d5e19-50a6-4363-b5c3-eef93dbdf956","resolution":{"observed_at":"2026-08-06T21:31:04.898771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T21:08:53.614836Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00917","last_updated":"2025-09-03T01:44:58Z","snapshot_observed_at":"2026-08-21T12:00:56.123898Z","submitted_at":"2025-07-01T16:23:00Z","title":"A Survey: Learning Embodied Intelligence from Physical Simulators and World Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:08:53.614836Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.00917"},"observation_digest":"sha256:1843d878fc46c66264a40c1740415d5a04482b4db0573e17fef249fe2a15b980","observation_id":"21d4acac-a0e5-447a-8c71-a4e49754acb8","resolution":{"observed_at":"2026-08-06T21:08:53.614836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T21:07:25.998032Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01016","last_updated":"2025-07-01T17:59:44Z","snapshot_observed_at":"2026-08-18T02:44:29.412804Z","submitted_at":"2025-07-01T17:59:44Z","title":"VQ-VLA: Improving Vision-Language-Action Models via Scaling Vector-Quantized Action Tokenizers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:25.998032Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.01016"},"observation_digest":"sha256:5ac149f4ce9231b23ed46e047163340a3ad10ba202c1636876b1076ea5db75a0","observation_id":"50648549-db24-47ed-9cd1-4360a95c363b","resolution":{"observed_at":"2026-08-06T21:07:25.998032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-14T21:19:44.144633Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.02546"},"observation_digest":"sha256:ef22545bf4f73e7d2b80399c39649d4a6a172a5afa1021af89a451d379b79a8e","observation_id":"f6560375-45a2-4982-b1a7-492b871e2c5a","resolution":{"observed_at":"2026-05-14T21:19:44.253040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T20:02:33.187976Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04047","last_updated":"2025-07-30T11:32:33Z","snapshot_observed_at":"2026-08-17T19:51:59.978205Z","submitted_at":"2025-07-05T14:15:52Z","title":"Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:33.187976Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.04047"},"observation_digest":"sha256:edd761a565e947e7341c29360e314fbea1d9b15e59c37d06c9d6a33b2181e195","observation_id":"c0dbc718-15b3-4fef-ba94-993a9eaf9604","resolution":{"observed_at":"2026-08-06T20:02:33.187976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:5b14437a756b73dae99e5f7d3e2db9a962f003f9024d851a2bacb3868e6dc315","observation_id":"2c3c555a-d500-47c1-aa25-5d7a32955703","resolution":{"observed_at":"2026-05-16T15:42:41.496742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T13:02:28.459549Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21045","last_updated":"2025-08-03T14:18:19Z","snapshot_observed_at":"2026-08-17T13:16:00.067864Z","submitted_at":"2025-07-28T17:59:02Z","title":"Reconstructing 4D Spatial Intelligence: A Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:02:28.459549Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.21045"},"observation_digest":"sha256:87a2c88a61bedfbfa4cee7f1d3c07c0c2df16f4ee74eefe649debc42ecf2fdbc","observation_id":"cbe25985-f876-4a60-ab34-47c1b18f445c","resolution":{"observed_at":"2026-08-06T13:02:28.459549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T12:39:42.254644Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-15T02:37:54.127209Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:42.254644Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:bf0f324ed309c4d0f0e951ca9bdf366014097e574d5f21c5f130fb6d27359d2d","observation_id":"fae05599-aee1-4385-b567-8459311861d5","resolution":{"observed_at":"2026-08-06T12:39:42.254644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-06T10:48:19.186087Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23523","last_updated":"2025-08-01T06:30:43Z","snapshot_observed_at":"2026-08-14T01:02:55.742291Z","submitted_at":"2025-07-31T13:06:59Z","title":"H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T10:48:19.186087Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2507.23523"},"observation_digest":"sha256:1c67140f19e46be7ef97612c9015da43a40851f6957d92fede95421ee5ccec4f","observation_id":"72328781-969b-4e9c-89dc-4916df0347ee","resolution":{"observed_at":"2026-08-06T10:48:19.186087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T23:53:54.204000Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04681","last_updated":"2025-08-06T17:46:23Z","snapshot_observed_at":"2026-08-13T00:47:19.377686Z","submitted_at":"2025-08-06T17:46:23Z","title":"Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-05T23:53:54.204000Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.04681"},"observation_digest":"sha256:193ccdb52b9b8d56533f31b6f11fe73c2ad8bd423c950437828110c754a70293","observation_id":"072f4e33-2712-412c-9145-b74cca030574","resolution":{"observed_at":"2026-08-05T23:53:54.204000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T21:16:50.647280Z","title":"3d-vla: A 3d vision-language-action generative world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T16:52:12.636532Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:50.647280Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.09071"},"observation_digest":"sha256:f977707035e84b2254d20b1bd433f764db3d39258bda57d7884e03d997830c92","observation_id":"cc1f00d7-649d-4957-920c-df764718e823","resolution":{"observed_at":"2026-08-05T21:16:50.647280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T20:35:48.488263Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-09T19:01:56.593721Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:48.488263Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:5b8553ef9682adf8fda349b0c33fe5dd422552955e9bbebc0327d276d08559cd","observation_id":"6b6ffc71-a3ec-4fc6-a7d2-f446f491920b","resolution":{"observed_at":"2026-08-05T20:35:48.488263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T20:38:46.276434Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-15T15:50:24.676875Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:46.276434Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:0f572cdc50f445393e14631632798dfbf3d43af78f7269b4b9f963f2f77c58af","observation_id":"2cbb195e-7fb0-4695-8fa5-abad61c589d2","resolution":{"observed_at":"2026-08-05T20:38:46.276434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T20:31:56.709921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-17T18:39:16.964832Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:56.709921Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:d9a97c522a3dc9c068c438599f32d79b5b7f407312e3eb4eb82873f45cb94b6e","observation_id":"71c88cdc-4890-4d1d-9fb9-ab781a9d3a60","resolution":{"observed_at":"2026-08-05T20:31:56.709921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T17:20:58.824487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13103","last_updated":"2025-08-18T17:10:45Z","snapshot_observed_at":"2026-08-17T17:22:31.530726Z","submitted_at":"2025-08-18T17:10:45Z","title":"Grounding Actions in Camera Space: Observation-Centric Vision-Language-Action Policy","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:20:58.824487Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2508.13103"},"observation_digest":"sha256:b64d9aa491208d2adce98e6bbcbb918073502fae0156da90d3f3b6c22a5270d1","observation_id":"8bc92a44-f2b0-4e57-97a0-8e62412361e2","resolution":{"observed_at":"2026-08-15T17:20:58.824487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T11:54:15.963740Z","title":"arXiv preprint arXiv:2403.09631","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02163","last_updated":"2025-09-02T10:14:28Z","snapshot_observed_at":"2026-08-08T04:57:38.586683Z","submitted_at":"2025-09-02T10:14:28Z","title":"Enhancing Reliability in LLM-Integrated Robotic Systems: A Unified Approach to Security and Safety","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T11:54:15.963740Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2509.02163"},"observation_digest":"sha256:095722a02cc1638b003932e5b09ff769e48347d041cd34657d2332a82dc66dc7","observation_id":"7b8aa446-dc3f-4c22-bed2-46c7a8f76ea9","resolution":{"observed_at":"2026-08-05T11:54:15.963740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-15T16:42:27.860682Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02530","last_updated":"2025-09-02T17:29:38Z","snapshot_observed_at":"2026-08-18T02:00:01.203447Z","submitted_at":"2025-09-02T17:29:38Z","title":"Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:42:27.860682Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2509.02530"},"observation_digest":"sha256:144329778fcc7d1b01e5493d4aa3f67236e2ef605b451a69d6b24ac9845e13a9","observation_id":"09dbc511-d9ba-488f-bf02-af7993566b9b","resolution":{"observed_at":"2026-08-15T16:42:27.860682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-04T19:39:24.137294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09154","last_updated":"2025-09-11T05:23:22Z","snapshot_observed_at":"2026-08-06T15:36:44.934159Z","submitted_at":"2025-09-11T05:23:22Z","title":"Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective","version":1},"reference_index":228,"source":"pdf_text","source_observed_at":"2026-08-04T19:39:24.137294Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2509.09154"},"observation_digest":"sha256:5a5486b51d5c46bbe11af2fddfc46794a26108634b37236e476465fbd42f0f86","observation_id":"0bbaa614-04ae-4443-bada-3041e9009be2","resolution":{"observed_at":"2026-08-04T19:39:24.137294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-04T09:34:49.182561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-15T23:50:04.432268Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:49.182561Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:80745bbeaf2a19cfa18ae6bb0c90aa6ed800b834f7febecf139a3a44f9d7960c","observation_id":"55e265b9-81e5-4d9d-a14f-a7bbc814150a","resolution":{"observed_at":"2026-08-04T09:34:49.182561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2511.12676","last_updated":"2026-04-20T15:58:25Z","snapshot_observed_at":"2026-08-03T08:02:06.363721Z","submitted_at":"2025-11-16T16:30:38Z","title":"BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T21:40:51.426489Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2511.12676"},"observation_digest":"sha256:486d4ad6e0bef175bc95083029ed8ce1815c00dc54b38030bff240e418a2f1c7","observation_id":"fe397185-f5b2-41a5-9be7-3b448b93b77c","resolution":{"observed_at":"2026-05-17T21:42:07.535660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T19:22:04.165316Z","title":"3D- VLA: A 3D Vision-Language-Action Generative World Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.01008","last_updated":"2026-07-29T12:56:09Z","snapshot_observed_at":"2026-08-19T10:15:29.433948Z","submitted_at":"2025-11-30T18:02:14Z","title":"LISA-3D: Lifting Language-Image Segmentation to 3D via Multi-View Consistency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:04.165316Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.01008"},"observation_digest":"sha256:5b1053a17566aa8e145612769a7bb8419ed2767db0be9ba203948ade1f4e39b7","observation_id":"91e3baa7-afcb-44f5-84ed-f9500e5b0f16","resolution":{"observed_at":"2026-08-03T19:22:04.165316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T17:38:20.829550Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-21T05:58:33.150546Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.829550Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:1899f15c1bc3799ca211cd815159d13f8b4f08871753bb255ee6da06ec69e267","observation_id":"bea9803e-44d8-4f44-8903-8701d55a4814","resolution":{"observed_at":"2026-08-03T17:38:20.829550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-03T14:00:20.759135Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-14T13:48:47.458940Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.759135Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:29a725a0c00cd8c8b4d2a2ad04c4accd6f30c593726ca0f78a3a97b9e30cdad5","observation_id":"662f0ae5-f798-498d-9708-7c14a6018916","resolution":{"observed_at":"2026-08-03T14:00:20.759135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2512.23180","last_updated":"2026-05-16T07:53:20Z","snapshot_observed_at":"2026-08-21T15:34:48.572805Z","submitted_at":"2025-12-29T03:40:05Z","title":"GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T17:06:34.398973Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2512.23180"},"observation_digest":"sha256:3c48feeef5457caa2f5903936719120ba66371ff741f743f5b2932133a86b998","observation_id":"c0db86ef-5a47-47d0-8270-c69c21a01831","resolution":{"observed_at":"2026-05-21T17:10:25.157527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:2ecb9ec7951a7471b386250d83c7ddf6332a00e34f8c90d73edf1720420d9e40","observation_id":"96d4c22e-17a2-424f-9628-7540bcd9a511","resolution":{"observed_at":"2026-05-16T15:08:02.111684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-08-11T15:16:51.530916Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T06:01:30.803128Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2602.10698"},"observation_digest":"sha256:e2a788073ca82155e0269e6be04ceb929b1eaabeff4b18bbc952321e4d654d7a","observation_id":"eed17cf9-dad7-460c-a9ee-fb795ffe05e1","resolution":{"observed_at":"2026-05-16T06:02:24.967630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2602.12978","last_updated":"2026-05-17T13:09:20Z","snapshot_observed_at":"2026-08-18T10:19:01.743570Z","submitted_at":"2026-02-13T14:56:06Z","title":"Learning Native Continuation for Action Chunking Flow Policies","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T12:38:26.522838Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2602.12978"},"observation_digest":"sha256:305e7ed14af1fd5e5383df3c5d1c887c9d9bf1f248c3f8db33061d66674dc201","observation_id":"68c16829-e20e-4cf0-b57a-7cc02c56c00c","resolution":{"observed_at":"2026-05-21T12:40:08.665758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-08-15T02:14:17.838458Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:620fc0966584b2f2f023a0e4668ed96de0c61da0d08389dbb9785d52ba762a5b","observation_id":"b2b36cf2-8633-4e4f-916f-cd52925ae079","resolution":{"observed_at":"2026-05-15T20:20:17.659399Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-02T21:12:11.164921Z","title":"3d-vla: A 3d vision-language-action generative world model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21013","last_updated":"2026-05-29T17:02:38Z","snapshot_observed_at":"2026-08-16T20:48:20.969722Z","submitted_at":"2026-02-24T15:30:55Z","title":"Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:11.164921Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2602.21013"},"observation_digest":"sha256:40cd29e76cf91f197accbd9e2a6c1921bceb130e7335ed69112fd96abdc6f1c6","observation_id":"d1a4d5aa-079b-4c3b-bb8a-141773ed4568","resolution":{"observed_at":"2026-08-02T21:12:11.164921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-02T21:06:10.804392Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21445","last_updated":"2026-06-20T22:55:52Z","snapshot_observed_at":"2026-08-20T13:46:45.158384Z","submitted_at":"2026-02-24T23:48:48Z","title":"VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:06:10.804392Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2602.21445"},"observation_digest":"sha256:65b1068e5fa6887fedc6f2fca1645fd5b33f2ebc6bf4ee6b7f7595d87e33c782","observation_id":"110a41a6-daaa-4e9d-af88-49196de51f9d","resolution":{"observed_at":"2026-08-02T21:06:10.804392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2403.09631 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-15T10:30:17.445130Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:00a678beca9132cb085ce66ded454c388b0dff62c3d95fd79f1aff2c117daa03","observation_id":"bcdc9a41-8ff9-429c-8b92-e08d87448d9d","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2603.25044","last_updated":"2026-03-30T07:44:33Z","snapshot_observed_at":"2026-08-02T12:22:24.189474Z","submitted_at":"2026-03-26T05:26:56Z","title":"ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T00:46:03.360770Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2603.25044"},"observation_digest":"sha256:0b02ed75424b316a704f9061d91f994790e8ed42de197ce3c52cdc4d18d0371d","observation_id":"3d9a6d77-5115-48e0-9b8a-a9e383dea878","resolution":{"observed_at":"2026-05-15T00:48:24.816800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.03066","last_updated":"2026-04-03T14:40:24Z","snapshot_observed_at":"2026-08-13T08:31:03.937753Z","submitted_at":"2026-04-03T14:40:24Z","title":"Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-13T19:21:34.849729Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.03066"},"observation_digest":"sha256:6319e296d27f57ff002a26a84d34a28b28d4db11189133963f588782b4a9a526","observation_id":"5ba0b4dc-7668-4075-93d2-5be0d3cfad58","resolution":{"observed_at":"2026-05-13T19:23:09.512252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.05484","last_updated":"2026-04-07T06:24:41Z","snapshot_observed_at":"2026-08-15T21:44:54.370701Z","submitted_at":"2026-04-07T06:24:41Z","title":"CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:12.286456Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.05484"},"observation_digest":"sha256:41736159e32caffe9c90058273825086be65860edecd038e67baa97e3632ef54","observation_id":"85c95fa6-d8a6-4794-bd6b-08754ebac289","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.06168","last_updated":"2026-04-15T01:21:52Z","snapshot_observed_at":"2026-08-11T00:13:32.050236Z","submitted_at":"2026-04-07T17:59:30Z","title":"Action Images: End-to-End Policy Learning via Multiview Video Generation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:05.206602Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.06168"},"observation_digest":"sha256:c9d786063805967b70637c68c16cc1d087a7fa9c05bda5f69e06ea1c3ba57fd7","observation_id":"4922074b-c631-45c4-a225-c19cc523f6e9","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.15281","last_updated":"2026-04-16T17:50:37Z","snapshot_observed_at":"2026-08-02T21:20:28.291912Z","submitted_at":"2026-04-16T17:50:37Z","title":"R3D: Revisiting 3D Policy Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T10:57:54.273960Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.15281"},"observation_digest":"sha256:f846616576a29da88e0d82c4c2fd4d8771011f4eb0999eeb2086c8728dab5493","observation_id":"b9ec0899-39dd-410d-a5d3-1e1a2e9d8bf1","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:fa0bf05397879eafe714f8fa4ceb50e6f91134d5fe6a85927451bce9811ad976","observation_id":"fcbf9ec7-030e-40b3-bb66-c11208c6e426","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.17800","last_updated":"2026-04-20T04:46:20Z","snapshot_observed_at":"2026-08-13T00:43:49.688771Z","submitted_at":"2026-04-20T04:46:20Z","title":"ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:06:38.517652Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.17800"},"observation_digest":"sha256:d6d1da499970341685f88c5d2ab9601cdfeb8060ec3631cd3e578628fcaf618c","observation_id":"705b8e60-503a-4d9c-a00a-3b90167ef080","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.17880","last_updated":"2026-04-20T06:48:47Z","snapshot_observed_at":"2026-08-01T03:28:42.182562Z","submitted_at":"2026-04-20T06:48:47Z","title":"ST-$\\pi$: Structured SpatioTemporal VLA for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:21.784769Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.17880"},"observation_digest":"sha256:c2da59331f0318c393099833665a856a7739de1bc8bbecfa66f158703c84a4ee","observation_id":"3606e2d6-207c-4c55-a974-c29958e5db91","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-08-07T19:37:35.121381Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:18.081248Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.22152"},"observation_digest":"sha256:5ee6f14cb4bb934aff5bf268d547c3c550420011a846ae43b6fef2223dd6b3e8","observation_id":"dcd18759-44dd-4e78-8fd1-56c7538958a7","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.23001","last_updated":"2026-04-24T20:41:59Z","snapshot_observed_at":"2026-08-15T10:33:36.535404Z","submitted_at":"2026-04-24T20:41:59Z","title":"Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T11:30:49.414976Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.23001"},"observation_digest":"sha256:c74d8d0538c73cb78234a91b2951d27676dc763a89672bf1ab42036f76353c8c","observation_id":"d9edb622-9300-427f-b3b8-ba68b530cf62","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:12074a137f4c2f310271e66ba921e53c1d84958efb2a2e26f4710a02633932db","observation_id":"07d746d4-9c3f-4554-baa2-9b13bd8a0739","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:bbe43a22a77f7c25924c3e22bf1bbb3c81a5b3f9205cfef92e5123aa56ae3338","observation_id":"2dd1db0e-1f53-4ca7-b3c5-3ca150d7c0ec","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.00663","last_updated":"2026-05-08T08:29:03Z","snapshot_observed_at":"2026-08-16T19:28:17.863797Z","submitted_at":"2026-05-01T13:45:16Z","title":"Affordance Agent Harness: Verification-Gated Skill Orchestration","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-09T18:40:53.380512Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.00663"},"observation_digest":"sha256:2a5b7e8830a56647dee84380b07a447d2e82d45879248fde696fc478ee1b2c18","observation_id":"890f35fa-c7d8-4d09-8233-f94583bb73b1","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.00663","last_updated":"2026-05-08T08:29:03Z","snapshot_observed_at":"2026-08-16T19:28:17.863797Z","submitted_at":"2026-05-01T13:45:16Z","title":"Affordance Agent Harness: Verification-Gated Skill Orchestration","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:07.248106Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.00663"},"observation_digest":"sha256:ac9bbc1e368da2a2dca94b97943a98600c08ef4bcade36ef611b2cdb325fee0c","observation_id":"d61860be-bb22-407c-9489-0dda0ebb58fd","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-08-16T04:21:26.485869Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:2361acf27953ab14c8b957dcbcf26bdc08dd72f8fa65287b86f0c0401f85632d","observation_id":"b9f682cb-cc59-4279-872f-df65e9dd9ae5","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T03:39:41.090350Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:804b24671208989c73c684c8763e16609c5cd96d701deeeab55df7de2305c781","observation_id":"5f242772-84dc-4baa-9c5c-4cfbb9bd33d0","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T02:53:54.608425Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:ac8423758e8dc170b6a4261fb378aa148082a7730616406e2605f36a05c0f20c","observation_id":"9a95271f-d267-452b-90a4-e6e7f090c6eb","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T06:16:48.180290Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:b1ea0df76b35022791083667ee6648afad39450feb88fb3d5e28baa568a329bc","observation_id":"717ff208-ad5a-4ddf-9604-cf969d7289fb","resolution":{"observed_at":"2026-05-15T06:19:49.789881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.10485","last_updated":"2026-05-11T12:44:26Z","snapshot_observed_at":"2026-08-14T14:42:59.902025Z","submitted_at":"2026-05-11T12:44:26Z","title":"VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T05:09:21.028373Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.10485"},"observation_digest":"sha256:46b174db18dd60ffdb8ec92b55e89816eff20fc5f1a26fe5ff836826f40f7000","observation_id":"d462be3f-9b37-4448-b91f-275895efa924","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-14T19:14:48.559990Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:b119670f3c26aa2786bcd4b0168b1c36739500e5f5251b400be7334a2faa5cd9","observation_id":"821e4050-6e8b-45fb-aaeb-19d9b37ac222","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-02T14:19:52.756668Z","title":"3d-vla: 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-14T19:14:48.559990Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:52.756668Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:dacc744f0f82548013f204cc32f0db24eda900b834da5154a8ac13e79131f6f5","observation_id":"11ba71ca-a685-4913-9c87-de0bb4496f54","resolution":{"observed_at":"2026-08-02T14:19:52.756668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":270,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:4eeb23434dfc81799427a0bb8062422d27570d8d5f404962bcb007fcafb33c67","observation_id":"31f76f2d-395f-4460-b1b8-0475b3c65bcb","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.13925","last_updated":"2026-05-13T15:23:17Z","snapshot_observed_at":"2026-08-11T06:10:13.835449Z","submitted_at":"2026-05-13T15:23:17Z","title":"Towards Robotic Dexterous Hand Intelligence: A Survey","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-15T05:44:23.945064Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.13925"},"observation_digest":"sha256:b094259e792cc606e761404b1dfc44de85519bddfb66480ae17523278337bed4","observation_id":"d652e784-ca52-4d06-9e2c-d8711ced4f10","resolution":{"observed_at":"2026-05-15T05:45:05.971120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.14950","last_updated":"2026-05-14T15:21:36Z","snapshot_observed_at":"2026-08-20T08:09:50.523612Z","submitted_at":"2026-05-14T15:21:36Z","title":"Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T21:39:15.662180Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.14950"},"observation_digest":"sha256:9a0dc05b67ad51064a6d70bb7afce1ae592aee439369a26575c9b305a8372f0a","observation_id":"ce8d7db6-c8d6-40a3-960d-686f48c24b00","resolution":{"observed_at":"2026-07-01T14:25:46.235324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-08-15T18:22:20.754813Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:cdb22ef6c12f82fa2991c60e274faba24eef424335d0ed93468595ac32768cec","observation_id":"cdc1cc04-548e-49d3-950a-9ed717e5c448","resolution":{"observed_at":"2026-05-20T12:43:17.308845Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.17580","last_updated":"2026-05-17T18:14:07Z","snapshot_observed_at":"2026-08-16T00:06:57.887209Z","submitted_at":"2026-05-17T18:14:07Z","title":"ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T12:21:16.284834Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.17580"},"observation_digest":"sha256:87dc660478060b65043d4abcefe8ea8e7ad5f24537bb391c218f9edeaddef1d2","observation_id":"0cfabf81-4168-472c-ae58-194d1fa6af2f","resolution":{"observed_at":"2026-05-20T12:23:16.862717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2605.20752","last_updated":"2026-05-28T12:25:46Z","snapshot_observed_at":"2026-08-16T02:30:02.995174Z","submitted_at":"2026-05-20T05:51:30Z","title":"GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T05:02:54.167808Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2605.20752"},"observation_digest":"sha256:91d0f254de0ee7eb759227a877eba2db7f202170bcc74c69f9aaab2fd876efaa","observation_id":"404c8e18-f088-4e1a-9456-61cb54ff6eb9","resolution":{"observed_at":"2026-05-21T05:03:57.849949Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2403.09631/citation-record","integrity":"/paper/2403.09631/integrity","json":"/paper/2403.09631/citation-record.json","paper":"/paper/2403.09631"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"8b5c09cb-7aa2-46b3-b62f-8f9b1a63df1a","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a8776315b488221434f0ec1f516854deadf34b60851cb98098fdee3c913f0268","observation_id":"97c26ff7-2daf-42b0-9f32-c61a0597ce06","resolution":{"observed_at":"2026-05-13T18:18:27.315022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":"2302.12288","doi":"10.48550/arxiv.2302.12288","metadata_source":"pith","pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","venue":"cs.CV","work_id":"c902e427-c54a-4fc4-8aef-d0243f90ea39","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:71cc119d916370c13dfa8fcb76512fd826feb65c824f91a7db4d64241733daf2","observation_id":"54c519dd-d490-47a3-84ab-5477256c9f96","resolution":{"observed_at":"2026-05-14T22:12:47.371512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models","venue":null,"work_id":"7955fbb1-e5f4-4902-903c-a9032cfa1993","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:40014836ef60b04883eec00245d93ed9a366aef2054167a714751f90b99595c3","observation_id":"ecbe30c9-510a-4a0b-91f1-8e058c01ba94","resolution":{"observed_at":"2026-05-13T18:18:27.326993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:c97d488fee3cbd10717d4b751183a8a3a430d57438a052539a19d9342d32eb7b","observation_id":"26525cfe-1dc5-4f41-9bed-18f1fcf5a0e2","resolution":{"observed_at":"2026-05-13T18:18:27.262017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:43c794b4c2fdaf893ee9b1c9a2bdd07175c44dfc2e40afdcd9c78de50e5e5a5c","observation_id":"fb41528e-1b26-46b0-ae0e-888efea28365","resolution":{"observed_at":"2026-05-13T18:18:27.264601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c38976bb-e020-4b5a-8071-496b2fdb33c4","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a267dad33cb8dc8a3903c1402b4e22de653cfcc20e8b34387d57b9331c258b28","observation_id":"0f4e72b5-d1fc-4267-b9e7-f2ecc317f2b0","resolution":{"observed_at":"2026-05-13T18:18:27.328615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Playfusion: Skill acquisition via diffusion from language-annotated play","venue":null,"work_id":"3c74b8ea-626e-4d9e-a960-4d8fe0f5a16f","year":2012},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:8c9f88f55d3e8acf807146970727225926170c85ccdd23ec6978766858e736cd","observation_id":"f82a101a-3f98-4ca4-9c88-9ec18aa98a34","resolution":{"observed_at":"2026-05-13T18:18:27.330344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning, 2023 b","venue":null,"work_id":"a17e392f-6800-47b8-bd30-96aab7a58438","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:2d9506d831ebe27c03df49b6013cc04598effa591bb18ebc0ba1ef1554f8a73b","observation_id":"94c34a7a-f505-4621-a41e-235d45706b52","resolution":{"observed_at":"2026-05-13T18:18:27.332108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X., Savva, M., Halber, M., Funkhouser, T., and Nießner, M","venue":null,"work_id":"f92ab43f-f83b-4f98-9a91-00c7da660796","year":2017},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:7acee92e0be62d0fc6d0ecd70e33405b0b826ae91a42c89ec0e25d206accd2a0","observation_id":"4ec0708d-5dad-472e-beaf-36a3579bf0aa","resolution":{"observed_at":"2026-05-13T18:18:27.333726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M., Fidler, S., Furnari, A., Kazakos, E., Moltisanti, D., Munro, J., Perrett, T., Price, W., et al","venue":null,"work_id":"37ab51b1-97a9-46e9-97dd-b001425cc0a1","year":2018},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:0fd77304fd021530b3201c67c9820f2a20ce940e639458158e14d690c0a48cc3","observation_id":"2acc2055-fb9e-4b7f-8f8e-6bdad4863da6","resolution":{"observed_at":"2026-05-13T18:18:27.335712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"789c4661-4f50-4fe1-80d5-72ecaaab693f","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a8105c424f4c929207cc41eba7ba67b98753161d250fb39d16f2d398d3573029","observation_id":"e56ab7a1-7359-4dc6-ad3d-3cb9d452bd56","resolution":{"observed_at":"2026-05-13T18:18:27.337529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"0570614d-ba6a-473b-99e1-a3ed4e15f5d4","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:11e3485feb479f6179a1607f19a2911aae4d9e0c977d6fe902b3b7619e164179","observation_id":"9696f091-f581-41ee-ac2f-5be77b0e1e27","resolution":{"observed_at":"2026-05-13T18:18:27.339047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-20T05:11:46.926766Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":"arXiv (Cornell University)","work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:517bf75f3a0937306bbe762507904a42a8dc43bf02159c8dcf85ee78eda6af9d","observation_id":"b84cd66f-e925-47e8-99c8-681c07eb4b41","resolution":{"observed_at":"2026-05-13T18:18:27.239045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:819e50ef143d1b63a4b7ca362d618e2befa9a4c622caa35dde315ee144e62266","observation_id":"79465bc0-9128-4873-b79b-f6626afb40a9","resolution":{"observed_at":"2026-05-13T18:18:27.245035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b083b03e-640f-4247-90de-70d07ff48158","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:be11b1d36b277bb1fc799018309079acbc38c5b1a873eb3dc8f7b738d9b954fe","observation_id":"28a5589f-a5a9-4c7a-870c-92474b4b305c","resolution":{"observed_at":"2026-05-13T18:18:27.340489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"ac27df5a-15dc-4bee-9450-fa53e0cdc886","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:b86b5b5953899228fc1c811f539fadaef9936868b3415885a78bda5d10a7fa9e","observation_id":"a1e5f78b-b147-426a-a44b-18ff132741de","resolution":{"observed_at":"2026-05-13T18:18:27.342207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00595","last_updated":"2023-09-26T10:47:35Z","snapshot_observed_at":"2026-08-17T23:49:22.371557Z","submitted_at":"2023-07-02T15:33:31Z","title":"RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot","version":2},"cited_work":{"arxiv_id":"2307.00595","doi":"10.48550/arxiv.2307.00595","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.00595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RH20T: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":"arXiv (Cornell University)","work_id":"d0404087-2d28-482f-8b50-8400d35d315e","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2307.00595","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:8ce9f11aa1db1814781441ebc43661ac08efd11f35bc00c24a145eaf0d415957","observation_id":"2ebb3c51-960b-47df-8712-0be93cd09567","resolution":{"observed_at":"2026-05-13T18:18:27.269979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16029","last_updated":"2023-10-24T17:46:12Z","snapshot_observed_at":"2026-08-19T21:58:32.963827Z","submitted_at":"2023-10-24T17:46:12Z","title":"Finetuning Offline World Models in the Real World","version":1},"cited_work":{"arxiv_id":"2310.16029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16029","snapshot_observed_at":"2026-07-04T00:09:14.966091Z","title":"Finetuning offline world models in the real world","venue":null,"work_id":"d8f13072-9879-413c-b9bb-441459a54db5","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2310.16029","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:094feef5c393f318cba8788bf971a42d225f8a7a8b68ea316d1700295ec43f25","observation_id":"9372c22d-f714-43ae-b152-3b0be8d7a963","resolution":{"observed_at":"2026-05-13T18:18:27.283738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"0fe37a7a-75f0-4870-ad92-6c068171a5fd","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:40ec9e94f26cfe27c0070b64cb26736c085b081b9a88525e2a0e7ed28c6ee513","observation_id":"daef5360-dc86-4303-9daf-02ee05aec76d","resolution":{"observed_at":"2026-05-13T18:18:27.343881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-16T15:13:41.464423Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":"2307.12981","doi":"10.48550/arxiv.2307.12981","metadata_source":"pith","pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":"cs.CV","work_id":"f5b30bc7-d8e1-451f-b67a-43775baddd50","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:6a1c4b3329941aa90ba40248bda57021d9a776ce42d92712c0dcd2554b5c2dac","observation_id":"6c53d0dd-a18c-4c88-9f4c-840e83f7097a","resolution":{"observed_at":"2026-05-13T18:18:27.295052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.375059+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.375059+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08577","last_updated":"2024-01-16T18:59:45Z","snapshot_observed_at":"2026-08-16T14:27:01.101805Z","submitted_at":"2024-01-16T18:59:45Z","title":"MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World","version":1},"cited_work":{"arxiv_id":"2401.08577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08577","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiply: A multisensory object-centric embodied large language model in 3d world","venue":null,"work_id":"3ec80891-5b9b-4df0-898b-d3920418bf27","year":2024},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2401.08577","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:4cda0892ba731cff07ca2c8c46cc8980ce26561cdee1465e75bc3bd584e70379","observation_id":"91595000-032b-4048-ab83-af3e71f081f2","resolution":{"observed_at":"2026-05-13T18:18:27.304794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Montani, I","venue":null,"work_id":"ebfe4bde-a3f0-4914-ba0c-29f7436b3424","year":2017},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:15b8589bd08449f557a75332d6f6f4eed5437d0dee16b8d1eff4b221f6087470","observation_id":"6bb457c2-2154-4c7a-be26-4f239908b6ec","resolution":{"observed_at":"2026-05-13T18:18:27.345448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a3b76159a46c0c7135ac2c5c44090c64d0f25393f48a89251896ab70a6681516","observation_id":"713f92ed-29cc-46f3-af21-25a6bee88c14","resolution":{"observed_at":"2026-05-13T18:18:27.241928Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers, 2023 a","venue":null,"work_id":"e629f071-fe66-48d6-a537-165f8fa6090b","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:2c28379ed9950ea4418a3b8c68ad6640f5e12a0e7d7cd70a861f3e1648f3f50d","observation_id":"3468c4cc-5af2-4be1-aead-87c78eb6d5ef","resolution":{"observed_at":"2026-05-13T18:18:27.347029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":"2311.12871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-07-08T02:44:27.664173Z","title":"An Embodied Generalist Agent in 3D World","venue":"cs.CV","work_id":"2c1392ae-d82d-4f8f-aef7-75a5ff0e5d2e","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:8da0300805c1ea170ac07abd53d61653fb925d159f8f121c0b8f6b0aec729973","observation_id":"fe44a321-56a2-416f-8c0e-a8cbd7e22ba0","resolution":{"observed_at":"2026-05-17T14:22:18.773673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-21T21:14:46.636998Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":"2302.14045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-04T19:20:06.296460Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","venue":"cs.CL","work_id":"2a1e0563-79f5-4521-8293-b8b1aebf7cee","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:ce20172487c1c92bfc5bda7ea771b9d44c02185ddd3d8b895468c8c8720c67be","observation_id":"413872a8-85d0-4228-b6ab-d2a98e89f293","resolution":{"observed_at":"2026-05-15T18:32:23.026112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., and Davison, A","venue":null,"work_id":"ebc7a356-db9d-48bd-8ae8-be7274070335","year":2020},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:9e5738dd28506dd4a744a2d4fa8bccb65e37668c4c4889f0044f21e38801da60","observation_id":"6dd03766-d22d-41dc-b1cf-64b51615841e","resolution":{"observed_at":"2026-05-13T18:18:27.349135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"e10ebb99-ccfd-44b5-b788-fb58de3ed0fb","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:38fb66dc67a76f7397cbfd63d6b18408fcb5adb51689ba7526d6a920f2ad2775","observation_id":"628055ba-4871-4010-9d8b-5a332ecff3d7","resolution":{"observed_at":"2026-05-13T18:18:27.350802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a5e749582d30fdbd509f72f58f1920ab2ae299b4d118004d6cde31525cf73fb3","observation_id":"a379add8-27ec-4f8e-89cb-b7ef2806394d","resolution":{"observed_at":"2026-05-13T18:18:27.267199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"316f7b8e-df3d-4616-ae89-c37d0f127ea3","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:b097df84963eadfa39d277840fe5e75ada1ef2cc1ce1bef456e01bc83e748a50","observation_id":"715ce97a-70ca-4f6f-9b17-991f49e24ccb","resolution":{"observed_at":"2026-05-13T18:18:27.352405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03354","last_updated":"2023-11-06T18:59:44Z","snapshot_observed_at":"2026-08-16T14:45:33.725152Z","submitted_at":"2023-11-06T18:59:44Z","title":"CoVLM: Composing Visual Entities and Relationships in Large Language Models Via Communicative Decoding","version":1},"cited_work":{"arxiv_id":"2311.03354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03354","snapshot_observed_at":"2026-07-04T15:09:55.091209Z","title":"Covlm: Composing visual entities and relationships in large language models via communicative decoding","venue":null,"work_id":"baa125ef-825e-4ef1-8135-0341fe8d9dc5","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2311.03354","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:076de1dd548b40267de87f9a2eb80d2f7eeebd7014367bb7cea1bb5d76fc79b3","observation_id":"ab28b99f-416d-4fc3-9526-e3528ecc82bd","resolution":{"observed_at":"2026-05-13T18:18:27.278672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:911cd481276746022dcf3a6e0c595a000bb7b83647b35021526751e154f324a8","observation_id":"5981af40-678c-4683-9992-f97fd2844b89","resolution":{"observed_at":"2026-05-13T18:18:27.281074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding","venue":null,"work_id":"b1d72567-7c7c-47ef-be9b-6fd3b96a947c","year":2024},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:4b672059355b00f8b8ec728db8f7d669fc5da99a7d87c40a962eb93bfecda17f","observation_id":"3b80b2e0-cc5a-429b-b8a9-1f735fda131a","resolution":{"observed_at":"2026-05-13T18:18:27.353994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:8aac581413a4e8b53b216669e8ce1ec78f151c0956dfac0c06e25329f21824e1","observation_id":"78a9492e-e41a-4cf4-bb1c-368f1dfb832c","resolution":{"observed_at":"2026-05-13T18:18:27.286127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":"eba14a71-ac00-48c3-9538-67564a760c42","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:3acc24141753ce8f784afe2cf7cf1c4492383806815aa220cff69b470b205e99","observation_id":"13a4c3ac-e92d-4788-b118-19e30c4b12ca","resolution":{"observed_at":"2026-05-13T18:18:27.355723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UNIFIED - IO : A unified model for vision, language, and multi-modal tasks","venue":null,"work_id":"40b1107a-2e02-4007-8c78-932c228eb161","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a4af6c179ac8330c830b2980f41e4a1c8d16d23e1d150fc216671e573971a0b8","observation_id":"9e6ad27d-fc14-4499-8d7f-3e24c337c29a","resolution":{"observed_at":"2026-05-13T18:18:27.357528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-17T17:21:25.156248Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":"2005.07648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-07-03T04:57:38.593923Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":"3b4e2803-5a69-4c23-a3b7-86047624e46e","year":2005},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:12d57b9e53909e1edd04d5f39b65e278f2587af61e1ae3b3577bef7f74647c13","observation_id":"1ce1ef94-0f93-4ec5-99a0-c2f9185fd7b6","resolution":{"observed_at":"2026-05-13T18:18:27.298710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive language: Talking to robots in real time","venue":null,"work_id":"4e8e435d-5491-4113-ab99-09104f42960f","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:69dcbbd5e295be90d0abe8592e63842dc60eb1ae237c8466a629a59c646055ae","observation_id":"0f286e5d-f3ce-4600-92a8-f1d175c6dac4","resolution":{"observed_at":"2026-05-13T18:18:27.359197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling robot supervision to hundreds of hours with roboturk: Robotic manipulation dataset through human reasoning and dexterity","venue":null,"work_id":"8bc97ef7-652c-4ca6-87a5-35495bc04417","year":2019},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:78ab3b9cad7ccac438abe513c86e3fc5b5508bf2c7aaf894e0013eab06d0e3e6","observation_id":"07e492e3-b632-43ce-a334-cc76f3f9dce7","resolution":{"observed_at":"2026-05-13T18:18:27.361251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"mitpress/9780262","doi":"10.7551/mitpress/9780262016315.001.0001","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Chater, Nick , year =","venue":"The MIT Press eBooks","work_id":"f90bc3f0-7c2b-44f6-a8aa-1420c3a84682","year":2016},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:3b904b7d5654c15205543e7f794139e73bcf09d7bb68ad48eba35c930835a069","observation_id":"215447fc-f02c-40bf-a3e2-2f7d50dffe5a","resolution":{"observed_at":"2026-05-13T18:18:27.235951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":"6e262ee2-ecd2-4a81-bc75-cbde827b317e","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:4f57ef50c74cb0945b4f0eaa7936ad4b408d1dfc40c064aca0f4024f66ce073b","observation_id":"83e2b69b-3d7c-46e1-807e-2d6ab947a696","resolution":{"observed_at":"2026-05-13T18:18:27.363121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding language with visual affordances over unstructured data","venue":null,"work_id":"be45128c-5b91-4b12-bef8-8459a55bbd42","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:6eae183520133d00494d219f54a6f81bb1504c662f817085bea336004a9061d7","observation_id":"a72ae54b-0011-465a-8eab-dfc30cf77d7a","resolution":{"observed_at":"2026-05-13T18:18:27.364872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08751","last_updated":"2022-12-16T23:22:59Z","snapshot_observed_at":"2026-08-17T05:04:12.370590Z","submitted_at":"2022-12-16T23:22:59Z","title":"Point-E: A System for Generating 3D Point Clouds from Complex Prompts","version":1},"cited_work":{"arxiv_id":"2212.08751","doi":"10.48550/arxiv.2212.08751","metadata_source":"pith","pith_arxiv_id":"2212.08751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Point-E: A System for Generating 3D Point Clouds from Complex Prompts","venue":"cs.CV","work_id":"9d7f0b29-b9ca-457f-9518-4a1506b43369","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2212.08751","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:34d09c3a3c6cd422df3e479f78c3c723c40b7bc74f8b7f1a59f089ed103bb987","observation_id":"702edcdb-dfc9-4d5e-be54-6c7d9ccab732","resolution":{"observed_at":"2026-05-14T20:51:35.400576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:0635f846a924ad428096756ebefe5930cf0f4f6bbf6cf8e7cda3b39e57f75a51","observation_id":"13af462d-d4de-422b-95f2-4a6e7a6c5680","resolution":{"observed_at":"2026-05-13T18:18:27.250764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effects of contextual scenes on the identification of objects","venue":null,"work_id":"c07bb382-b578-45bb-9a4e-1fb983d2df3d","year":1975},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a26df2cb4439270e09c16870114f8e59ea7a806dd6df8b7ec5fb490c55bc323d","observation_id":"1bef82e3-21cf-4661-a399-b3e06604126e","resolution":{"observed_at":"2026-05-13T18:18:27.366560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:cb226185921309d02e8712a5fbe5b0a184347157b85c252a6a517757ff3ec33a","observation_id":"1016d80c-7344-4cfd-8dec-c1e3aa05f3c2","resolution":{"observed_at":"2026-05-13T18:18:27.256407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7551/mitpress/6137.001.0001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seeing and Visualizing: It's Not What You Think","venue":"The MIT Press eBooks","work_id":"40aeb4a5-7bc7-4491-acc1-9928aca3e877","year":2003},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:cfa359296b03632c416b4daa6603ea18875bab691a0659aab34bf1029d5e322f","observation_id":"e6884e3c-673a-4d5c-bda9-b7a6d21dbcaf","resolution":{"observed_at":"2026-05-13T18:18:27.232263Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"c534372e-0772-4385-a753-46bcb8cc239a","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:1877b1be9c585528b99b596ba03226b1678897fce86d085f15b8685b9f5ae721","observation_id":"1d1f9053-699f-49f2-88c8-43a5177d1300","resolution":{"observed_at":"2026-05-13T18:18:27.368322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., Gokaslan, A., Wijmans, E., Maksymets, O., Clegg, A., Turner, J., Undersander, E., Galuba, W., Westbury, A., Chang, A","venue":null,"work_id":"33bbab94-10c3-4ddf-89a7-a783b1cd3b41","year":2021},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:0bb749bf986def6c1b740a9214b0eb44b804e4ed5a8bc3728fcf6ae2fa806d47","observation_id":"09d79b3b-787a-4f41-89fa-4a843446cb97","resolution":{"observed_at":"2026-05-13T18:18:27.306947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":"d303021b-2565-47de-b9d6-df0b9a1ab87e","year":2024},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:e46f17f908780f9ca2bfd5209e3e51a700733aadb411715dff612c71d8efef99","observation_id":"f35d3ee3-8890-43dd-adcc-e608f402d12f","resolution":{"observed_at":"2026-05-13T18:18:27.309039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"338200fd-95e0-46f1-8f62-e8359722f889","year":2022},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:91183700492dbfddc5d06f6a3c238a6ba6dab40f35a341ab904bce7a9432141d","observation_id":"a039cc22-5a82-4cec-a9a6-7697428d927b","resolution":{"observed_at":"2026-05-13T18:18:27.311213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Playing with food: Learning food item representations through interactive exploration","venue":null,"work_id":"50f3c08b-b420-4f6e-9b5a-d60e3ceefd92","year":2021},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:c520d4790442e7eb3d2fac68334bf1321c4fa3f1a5c9bee1cdf349d75950c9a2","observation_id":"25e1f738-1cce-4d0f-a042-dce8a4a66f31","resolution":{"observed_at":"2026-05-13T18:18:27.312967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00899","last_updated":"2023-11-01T23:40:07Z","snapshot_observed_at":"2026-08-16T14:46:42.725649Z","submitted_at":"2023-11-01T23:40:07Z","title":"RoboVQA: Multimodal Long-Horizon Reasoning for Robotics","version":1},"cited_work":{"arxiv_id":"2311.00899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00899","snapshot_observed_at":"2026-07-05T11:41:02.660093Z","title":"In","venue":"cs.RO","work_id":"e9b50329-dbe8-4561-baf4-9128c5cef20c","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2311.00899","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:8cc6404a2d00d07b838780d71c2d14c3dbee3f9ed15e9875d87b85c98387b509","observation_id":"f18b2b71-bf5c-46c7-bd02-07188b7f11e6","resolution":{"observed_at":"2026-05-13T18:18:27.272725Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-08-19T02:20:11.693473Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":"2311.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-07-02T13:46:59.337867Z","title":"On bringing robots home","venue":null,"work_id":"6e3fdf89-a927-4640-9775-66c9b9d3a55b","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:1cbaa6f78bdb362cefe7d4204599d8d1326e4b9d12e13ba8e1e0025e0f8bb6e1","observation_id":"bf507b6f-0f39-4043-8a16-6330bdf8de9b","resolution":{"observed_at":"2026-05-13T18:18:27.275641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MUTEX : Learning unified policies from multimodal task specifications","venue":null,"work_id":"8e2e4ed9-7692-45c5-8b17-d6d4fcffa579","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:c5b3dd4a80769b9696ad8abfa089171bb05439d89b4b04e751ebe8876c268ab2","observation_id":"b80b00c1-fc0c-404e-b5b0-488b7d0b8e56","resolution":{"observed_at":"2026-05-13T18:18:27.325265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lancon-learn: Learning with language to enable generalization in multi-task manipulation","venue":null,"work_id":"6b24e296-ec19-4d3a-85f2-f733c34e0807","year":2021},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:6d1c5ccbe4cb2cf72f182af9c2bcc99b222889677db6d943284c251d194de4c2","observation_id":"a66d1196-1bd7-4435-aafe-0978d513753d","resolution":{"observed_at":"2026-05-13T18:18:27.316902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Deng, J","venue":null,"work_id":"817f547e-afdc-41b7-aced-cba892e50dd7","year":2020},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:b0d72427852c6b7b0dc421bd33ea95660295bbec1520c48fb87ea34d346695e0","observation_id":"4664baef-2491-44d6-8a1d-9ab5f4c7e00d","resolution":{"observed_at":"2026-05-13T18:18:27.318514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Black, K., Zhao, T","venue":null,"work_id":"81273422-3b6d-4324-be01-c57d8289c967","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:a7d3a770d9c6a9d493105a8c56c627ae7f89dd6330b35db9c646e32f31250cc6","observation_id":"5b8db1bf-1f28-4e29-b7c2-40499e9029e1","resolution":{"observed_at":"2026-05-13T18:18:27.320098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-17T09:50:53.260956Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2309.05519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-07-04T01:19:20.350619Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"6a6c38ce-96cf-48b1-9f3d-a69746e904ff","year":2024},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:5369feb031192f408e05abb2de654725ecd6ebf903444b2acf2149a314d91a64","observation_id":"db948bda-a4a1-4bf3-85e3-84dacd27d500","resolution":{"observed_at":"2026-05-13T18:18:27.288689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"6f5e595c-69e7-4978-bf2b-32cc5a51f40e","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:cae2a1a4b293f21ac41bbc4a050392b13262e96e0d6e74fbe280e1e0c7dc8b07","observation_id":"f6750f1f-752a-4b20-9c80-744927bceddd","resolution":{"observed_at":"2026-05-13T18:18:27.321705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":"fe5cb64b-9096-4b39-8c55-11eb066405b3","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:16e5db77ee7405d88c91344226b9e1807d7a2eb2ff8e9bf281e0f277524dc313","observation_id":"9859893a-4dce-486d-b210-b2128a11b2df","resolution":{"observed_at":"2026-05-13T18:18:27.323374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:1f0c2224d5211b75a4f2a72387b47de385878499bda2a839d8cab3684cd047e4","observation_id":"650d54a1-714d-4bd0-a627-b48d4a576c78","resolution":{"observed_at":"2026-05-13T18:18:27.301610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T21:29:26.419599Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":3,"verified_exact":21,"verified_fuzzy":33},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 100 inbound Pith citation observations for arXiv:2403.09631."}