{"as_of":"2026-08-12T04:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c3573cd55c329d080749c814cebd475b80a3247d0868c4b22ac9fa28afd4a58","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T21:44:27.562453Z","state":"measured"},{"denominator":117,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":117,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":92,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:22:28.270135Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-05T11:41:02.629883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:009de8969ecc7c2d7c498c0ccbb1469a960582a03615d2e5620d0943bd3da2c0","observation_id":"cfc1417d-b307-4bef-8db1-9221044fe4ca","resolution":{"observed_at":"2026-05-18T14:25:59.328882Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T22:00:04.812281Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2402.10885"},"observation_digest":"sha256:3a23fab92cc71f6b639f27a073962890a324e8fb7d104a44bfda277069660a60","observation_id":"1050991e-bc6c-437c-8c5a-6284f60016c6","resolution":{"observed_at":"2026-05-17T22:00:04.959480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-12T04:00:31.932219Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:bb325153d8fb3efe079a9855911971e669b59452c06f649ec0946595a51952f2","observation_id":"b23c365e-ba9c-43f8-a8d5-e0e29b49fb2d","resolution":{"observed_at":"2026-05-18T04:55:20.466880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:d08fcbf3236bd223260081a93f981effecf4a4050b351273b6d1b8959c8335d8","observation_id":"8f2515bb-e095-434d-b654-653a3a14d2a5","resolution":{"observed_at":"2026-05-24T01:25:54.448890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:8d2a6d081964a0a085300c979acc8dc598320cef64c602e8b314ba3fc67f60f5","observation_id":"8b8992ab-39f2-4bd9-9008-25defdb0c618","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:2b4e94ca4afad118bc2c2bd86a9dcbb50b4904bc86276c7a6789543674a7134c","observation_id":"826d4c58-8d89-4f86-a768-72cedeec22af","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:8c960f406796abbab5dd9bf30759210fa669b0ae7e56eb5ddb60b77c4571aea9","observation_id":"0350bb56-cf30-4593-a6f5-ce0ff128479c","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-11T19:22:28.270135Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06782","last_updated":"2025-08-10T06:09:58Z","snapshot_observed_at":"2026-08-11T19:16:18.190366Z","submitted_at":"2024-12-09T18:59:18Z","title":"CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:28.270135Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.06782"},"observation_digest":"sha256:8b1a2a78c3b73f819de8518043c12fa5bcbe1411d8e67eb2a48127d34de82c97","observation_id":"7486c90b-204f-4f2b-8b9e-e26d128809bb","resolution":{"observed_at":"2026-08-11T19:22:28.270135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-11T17:55:13.405881Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08442","last_updated":"2024-12-11T15:06:25Z","snapshot_observed_at":"2026-08-11T17:46:57.888519Z","submitted_at":"2024-12-11T15:06:25Z","title":"From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:55:13.405881Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.08442"},"observation_digest":"sha256:73a74937a5c72ff8d5b0633d474a06c51adda953fcbff53481c90bf6d34b3611","observation_id":"14ecc731-396f-4840-86c5-745e17fe6df1","resolution":{"observed_at":"2026-08-11T17:55:13.405881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:bc0e8666e3e6f599fb4aa0b0338fe2c7e951d561cd488a92c1952cb705e846f7","observation_id":"3a307198-f89e-4159-b195-7ec5d128335b","resolution":{"observed_at":"2026-05-17T21:37:50.726848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:3b5da7333a72834fa87655d75651e15600ff0b02d259b7bc9afb90fd884517a4","observation_id":"97f2b47b-c758-4e7a-8a9f-0696a40473f4","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-11T11:22:41.393711Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15576","last_updated":"2025-05-27T07:05:44Z","snapshot_observed_at":"2026-08-11T11:15:58.806897Z","submitted_at":"2024-12-20T05:17:06Z","title":"QUART-Online: Latency-Free Large Multimodal Language Model for Quadruped Robot Learning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:22:41.393711Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.15576"},"observation_digest":"sha256:ee388466b88852d391b3d9f90fc28ae45373f68dc384580f6a9ccae4871b5fe5","observation_id":"b620cb81-1c65-4201-ac9c-6e1e5feead9c","resolution":{"observed_at":"2026-08-11T11:22:41.393711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T23:26:37.398060Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-11T00:17:57.086947Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:37.398060Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2412.20451"},"observation_digest":"sha256:885e24b1c31442a598187156018470c75b6de0789c0031df744c165b3480eecd","observation_id":"a64c9f9a-58c5-41cf-967c-ebc2d33f5a63","resolution":{"observed_at":"2026-08-10T23:26:37.398060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T21:50:41.217206Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03841","last_updated":"2025-01-07T14:50:33Z","snapshot_observed_at":"2026-08-12T02:52:50.132814Z","submitted_at":"2025-01-07T14:50:33Z","title":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:50:41.217206Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.03841"},"observation_digest":"sha256:ccbb2ca3379c2992e00742b89816bebaf963852be5c2dbc75342dd819fca1924","observation_id":"9a1560bc-e52e-4e33-bd79-dae0622a990d","resolution":{"observed_at":"2026-08-10T21:50:41.217206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T20:39:43.834162Z","title":"Vision-Language Foundation Models as Effective Robot Imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07802","last_updated":"2025-01-14T03:03:37Z","snapshot_observed_at":"2026-08-10T22:06:30.400320Z","submitted_at":"2025-01-14T03:03:37Z","title":"Visual Language Models as Operator Agents in the Space Domain","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:43.834162Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.07802"},"observation_digest":"sha256:0852fefa11d0b505d6690b6f40651a459c6c1095594191fcfe9367d86c684a42","observation_id":"2bba8958-450f-46b2-93ec-4f1f13e1f4df","resolution":{"observed_at":"2026-08-10T20:39:43.834162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T20:11:32.505646Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09307","last_updated":"2025-03-10T08:46:11Z","snapshot_observed_at":"2026-08-11T23:06:24.072239Z","submitted_at":"2025-01-16T05:40:37Z","title":"RoboReflect: A Robotic Reflective Reasoning Framework for Grasping Ambiguous-Condition Objects","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:11:32.505646Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.09307"},"observation_digest":"sha256:b73c12e784da109138bb6d27f6c1feffacc04dc2501687176118107b94da0bc5","observation_id":"134239e5-fb44-436c-a382-b566955b0ca3","resolution":{"observed_at":"2026-08-10T20:11:32.505646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T19:47:36.507541Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-11T00:17:56.399606Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T19:47:36.507541Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.09783"},"observation_digest":"sha256:a80adfc0771ef159ee318aad66a0817f386278ee0ab61e95517e6e272f2e1057","observation_id":"f5e07be3-73be-4491-8298-d82fb1aca33c","resolution":{"observed_at":"2026-08-10T19:47:36.507541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-10T11:39:56.058905Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-10T11:32:59.879407Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:39:56.058905Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.16664"},"observation_digest":"sha256:727811e5ae92e611c9808a6c4577c3c8b0ebe84a06244b93e141c3259ec3639e","observation_id":"ac41728e-41a9-47c1-bddc-354ccd085d3e","resolution":{"observed_at":"2026-08-10T11:39:56.058905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-09T22:13:14.916949Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-08-10T05:37:18.597432Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T22:13:14.916949Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2501.18867"},"observation_digest":"sha256:814d3deed46d13f7bb55de09d8649e190ff0b1b6cc3acbe7cbf47275aa4b66a3","observation_id":"55ed24c6-9829-42df-af65-7ad72d392227","resolution":{"observed_at":"2026-08-09T22:13:14.916949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-08T13:35:17.882033Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07837","last_updated":"2025-05-01T08:09:58Z","snapshot_observed_at":"2026-08-10T09:13:42.731986Z","submitted_at":"2025-02-11T02:16:59Z","title":"RoboBERT: An End-to-end Multimodal Robotic Manipulation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T13:35:17.882033Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.07837"},"observation_digest":"sha256:187e401e917f7e868f31e64329aef99d0f94f4abc05d81931c71f11d76055f84","observation_id":"a5a5dec7-0536-402e-b65b-24890623dc09","resolution":{"observed_at":"2026-08-08T13:35:17.882033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-08T00:05:05.719831Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08645","last_updated":"2025-02-16T12:14:53Z","snapshot_observed_at":"2026-08-07T23:54:52.248553Z","submitted_at":"2025-02-12T18:59:04Z","title":"Re$^3$Sim: Generating High-Fidelity Simulation Data via 3D-Photorealistic Real-to-Sim for Robotic Manipulation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:05:05.719831Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.08645"},"observation_digest":"sha256:8abb93f6e3287ef9def99db02e6d7ea6251f27fd8cc768138da0a153176f177c","observation_id":"f51fffb1-90e2-4b88-aa30-54da0b47c14d","resolution":{"observed_at":"2026-08-08T00:05:05.719831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T23:21:24.768834Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.768834Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:95bf076289dc757c2ff8d7f0a93cf18f49aee3da474adf0494dffd6ea1712ec8","observation_id":"5dac971e-7165-498f-bab5-2a201487cda7","resolution":{"observed_at":"2026-08-07T23:21:24.768834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T22:10:13.376171Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09268","last_updated":"2025-02-14T01:51:57Z","snapshot_observed_at":"2026-08-10T19:42:29.359480Z","submitted_at":"2025-02-13T12:29:50Z","title":"GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T22:10:13.376171Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.09268"},"observation_digest":"sha256:3d337f373a38f73f78292170292d1e3a57ba4dd5d310d87309d3a18b8bc7eeb9","observation_id":"70c4fcec-1f1e-4baa-af95-4b606682321e","resolution":{"observed_at":"2026-08-07T22:10:13.376171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:4133c54219872ef132cc1d0e7c3c274b8f0588653c6a2ab9bdb6a13940c347e3","observation_id":"ffd48dfc-9335-4f6a-9b3b-2c2d7b535ee2","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:2bbc01bf283d948848053eb0ff2bda6cd74d4f9db467e3dc27e5db40fa2a9b05","observation_id":"80991980-ebd8-45ff-9f24-8ebd1953dba0","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:08327175b5111874f8c7840b7b1ab80778210efe0352f3d06353453b13859b4c","observation_id":"fd9bba19-1692-4008-bfa8-67a6719c60d6","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2505.03500","last_updated":"2026-05-01T03:34:16Z","snapshot_observed_at":"2026-08-02T10:57:11.334123Z","submitted_at":"2025-05-06T13:05:04Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T16:46:05.993833Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.03500"},"observation_digest":"sha256:ca5bed02ab037f47d8379be718ce1b2c2378a9ac48c03c583a06729fd551b930","observation_id":"00183152-6ce8-4b2f-b379-b4eff41b1f29","resolution":{"observed_at":"2026-05-22T16:46:47.468917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-08-10T09:12:51.490663Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:63159fd7d19ec9e65bf7df7ba3c9ae3a7beb6bf92d0b012dbb918e787246e07d","observation_id":"c52d2050-4d24-444c-86b3-ef4f2f636ada","resolution":{"observed_at":"2026-05-17T15:59:09.007087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T15:02:23.808381Z","title":"11 Li Junnan, Li Dongxu, Savarese Silvio, Hoi Steven","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16517","last_updated":"2025-05-24T10:44:27Z","snapshot_observed_at":"2026-08-10T17:47:19.876194Z","submitted_at":"2025-05-22T10:57:07Z","title":"ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:23.808381Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.16517"},"observation_digest":"sha256:e4a3b35877f35b03c257b2295550616c77cf35ee7dc3f4ebcdd6ef3a21814310","observation_id":"f249808f-6129-4452-aa95-f196ffe61df3","resolution":{"observed_at":"2026-08-07T15:02:23.808381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T15:03:59.182171Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16640","last_updated":"2025-05-22T13:12:46Z","snapshot_observed_at":"2026-08-09T16:43:24.024535Z","submitted_at":"2025-05-22T13:12:46Z","title":"BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:59.182171Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.16640"},"observation_digest":"sha256:ec962fea84ccdaa677cc74afaaa325460325e2d1a85d1ec1dfbe6e2f7fcb0347","observation_id":"1b16272f-66ac-4e50-a783-e906c8945fd4","resolution":{"observed_at":"2026-08-07T15:03:59.182171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T13:43:01.760587Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21200","last_updated":"2025-05-27T13:47:18Z","snapshot_observed_at":"2026-08-08T00:46:30.376951Z","submitted_at":"2025-05-27T13:47:18Z","title":"Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:43:01.760587Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.21200"},"observation_digest":"sha256:7ce8fb90d33783680e9c367a0d23985a945103670205efe2ac84abd1351e6180","observation_id":"a517b294-5f40-42d8-90fe-a0e1c789012c","resolution":{"observed_at":"2026-08-07T13:43:01.760587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T13:25:58.804742Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-07T13:17:24.769477Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:25:58.804742Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:a657ffedcc8fd1580528b2cf7ec714b6eabc9f8f6d0737faeee782193abb4607","observation_id":"7b8e407a-0420-49b2-a79f-b764eee9cfff","resolution":{"observed_at":"2026-08-07T13:25:58.804742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T11:34:17.665412Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01953","last_updated":"2025-06-02T17:59:51Z","snapshot_observed_at":"2026-08-07T11:28:25.217327Z","submitted_at":"2025-06-02T17:59:51Z","title":"Fast-in-Slow: A Dual-System Foundation Model Unifying Fast Manipulation within Slow Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:34:17.665412Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.01953"},"observation_digest":"sha256:0ae0a35306e3800d02e6c9f7f7df401c2c3c8ae15d31bcdeddb8bfd4db8dcf24","observation_id":"c774c3c4-96de-4b34-b385-85d1e4b2264a","resolution":{"observed_at":"2026-08-07T11:34:17.665412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T11:05:38.999918Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03574","last_updated":"2025-06-04T04:45:24Z","snapshot_observed_at":"2026-08-10T01:28:05.565563Z","submitted_at":"2025-06-04T04:45:24Z","title":"SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:38.999918Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.03574"},"observation_digest":"sha256:9d55528cc75007cce48edeabac8e3fdd7c54ab59e980147e0bc3db8042aefcea","observation_id":"95a71858-8c5c-4c83-9ddb-8808717a9a11","resolution":{"observed_at":"2026-08-07T11:05:38.999918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:55:20.313536Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09343","last_updated":"2025-06-11T02:50:48Z","snapshot_observed_at":"2026-08-11T21:14:39.509427Z","submitted_at":"2025-06-11T02:50:48Z","title":"CheckManual: A New Challenge and Benchmark for Manual-based Appliance Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:20.313536Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.09343"},"observation_digest":"sha256:1b4e608e9f12df1faffd1342802553c665e26d050b6a41f46072bafa1e4bed2b","observation_id":"8ca80984-43d2-4b6f-9dd9-e4f89fb2afb8","resolution":{"observed_at":"2026-08-07T04:55:20.313536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:42:22.448483Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10100","last_updated":"2025-06-11T18:34:57Z","snapshot_observed_at":"2026-08-08T23:31:58.329673Z","submitted_at":"2025-06-11T18:34:57Z","title":"EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:22.448483Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.10100"},"observation_digest":"sha256:f0d84e75ac1369809b713862bd4e74c5da29a6ef524a591d6dfc1fa35ab4eaf0","observation_id":"b6f21b8b-0c64-4036-950b-5921283d297f","resolution":{"observed_at":"2026-08-07T04:42:22.448483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:17:09.575868Z","title":"Vision-language foun- dation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10966","last_updated":"2025-06-12T17:59:04Z","snapshot_observed_at":"2026-08-07T13:44:57.666142Z","submitted_at":"2025-06-12T17:59:04Z","title":"GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:09.575868Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.10966"},"observation_digest":"sha256:7d7b1186d6dfc164fcd518e18e2eb3d292d4bc5e962f7be72d904e1638ee055b","observation_id":"ebc8f8a7-6d31-4b44-b8b3-bbad4f0e1b1b","resolution":{"observed_at":"2026-08-07T04:17:09.575868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T04:17:12.492546Z","title":"Vision- language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11394","last_updated":"2025-06-13T01:27:45Z","snapshot_observed_at":"2026-08-09T18:19:35.604377Z","submitted_at":"2025-06-13T01:27:45Z","title":"Dynamic Double Space Tower","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:12.492546Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.11394"},"observation_digest":"sha256:2ebc2d98ed1c1bbf64c42f29ff799ec9d0346219cca48158e1469b3fc7bc4612","observation_id":"b8d93450-37ea-40c6-8ed9-3283ec429749","resolution":{"observed_at":"2026-08-07T04:17:12.492546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T00:31:31.758456Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-10T08:31:14.780196Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:31.758456Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.13679"},"observation_digest":"sha256:935fcf81865be90783b46ee67737eb524d7ff75d39f367cf5540391ac16a71a0","observation_id":"7b4db716-9f2c-4606-9d99-6282f0170e54","resolution":{"observed_at":"2026-08-07T00:31:31.758456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-06T23:12:05.276267Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19498","last_updated":"2025-06-24T10:36:15Z","snapshot_observed_at":"2026-08-10T09:21:15.394582Z","submitted_at":"2025-06-24T10:36:15Z","title":"T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:05.276267Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.19498"},"observation_digest":"sha256:91169afd4d9b02146d3b0d45e22e3a9988ba09ebdb6f97f6a59940eb6527c9fa","observation_id":"0019b4a4-5b4e-4be1-a351-23cdb4da1fd4","resolution":{"observed_at":"2026-08-06T23:12:05.276267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-10T07:22:51.573401Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:2841a236ac19d67991ee88fd07c55f1df614d379e74576436a41a7d4ee5604d7","observation_id":"16e31991-7784-4d6d-aad9-0f1592599885","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-06T20:45:30.058020Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01961","last_updated":"2025-07-05T04:00:38Z","snapshot_observed_at":"2026-08-10T01:55:43.777323Z","submitted_at":"2025-07-02T17:59:54Z","title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:30.058020Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2507.01961"},"observation_digest":"sha256:26add0d83187da5e4a8ab610ac726949a042440490e21d8aa7897b12c76149b7","observation_id":"ccb96fcb-72d1-4808-86e8-e17c38e1c6c1","resolution":{"observed_at":"2026-08-06T20:45:30.058020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:261367a202a549db7717f6c5bfc6852f0df7d70e5525239944ebe67b658aa85d","observation_id":"94a21d8c-9bb6-4cc0-b235-b45d901d2b1d","resolution":{"observed_at":"2026-05-17T08:04:12.691874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-05T20:31:45.149931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-10T16:57:45.636309Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.149931Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:627709b85f0123d8f04a20dda0020c599ea60bc8025ffa9a27ca634449117110","observation_id":"bb2bda5c-3247-4b2b-a1a6-d06443aac02e","resolution":{"observed_at":"2026-08-05T20:31:45.149931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-05T17:34:00.544575Z","title":"Vision- language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16089","last_updated":"2025-08-22T04:59:08Z","snapshot_observed_at":"2026-08-09T06:44:04.445337Z","submitted_at":"2025-08-22T04:59:08Z","title":"Two-flow Feedback Multi-scale Progressive Generative Adversarial Network","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:34:00.544575Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2508.16089"},"observation_digest":"sha256:e1ef473ea772d783444b73f5930f2ded0e9c5260d271e360f089de3ea5c4a4df","observation_id":"35f40323-ed57-40d4-b829-b4e32bb89201","resolution":{"observed_at":"2026-08-05T17:34:00.544575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-05T12:15:01.429344Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01819","last_updated":"2025-09-01T22:50:55Z","snapshot_observed_at":"2026-08-07T15:27:39.199135Z","submitted_at":"2025-09-01T22:50:55Z","title":"ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:15:01.429344Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2509.01819"},"observation_digest":"sha256:0c38ea8839cb22aa79c615e35a525b77019656c089f6cb2d0545bf5bdac97f59","observation_id":"77e40e6f-bbe4-4281-b24c-86264bed0b64","resolution":{"observed_at":"2026-08-05T12:15:01.429344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-05T05:48:48.088373Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:48.088373Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:9acd31b9089130d2386381b847da7642e873f12127bb46830f753c474b62ae90","observation_id":"dce0a682-6ed5-4854-914e-3d1a0ef91947","resolution":{"observed_at":"2026-08-05T05:48:48.088373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T22:55:29.929977Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-09T23:18:17.128552Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.929977Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:47fd7257aa6cbcd882ef09dd8fcdc288a1748c3c7e57d2090b0ca5f12353e9b1","observation_id":"1a5b98ee-3931-467c-b4b6-6d209502f48d","resolution":{"observed_at":"2026-08-04T22:55:29.929977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T21:29:09.018713Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:09.018713Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:a306445fa3808a796c12f2afc2b5117d0e9620a81f27de5b4dec14a171f28e3a","observation_id":"b022643b-7b10-4474-b2e0-7bb1e4370340","resolution":{"observed_at":"2026-08-04T21:29:09.018713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T07:00:46.400140Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T07:00:46.400140Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2510.27607"},"observation_digest":"sha256:a14daa3e7742e2d03090d0235e42dd9e837e92b4a4e37922a3bf00edc5d7890c","observation_id":"6b2874ea-6c8b-49ce-8efa-7104d79a790e","resolution":{"observed_at":"2026-08-04T07:00:46.400140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2511.15279","last_updated":"2026-04-03T06:36:12Z","snapshot_observed_at":"2026-08-11T12:40:01.543236Z","submitted_at":"2025-11-19T09:42:08Z","title":"Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T21:03:28.341042Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2511.15279"},"observation_digest":"sha256:053a9bc39599e19cf906230c0cd7f742a92d0a3ef3284fd43809ce0cdd735fbc","observation_id":"2672b566-8f58-4b39-a5f8-0b221330dcda","resolution":{"observed_at":"2026-05-17T21:05:15.679521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-03T21:13:57.062334Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16449","last_updated":"2026-05-26T14:15:17Z","snapshot_observed_at":"2026-08-03T21:13:51.571516Z","submitted_at":"2025-11-20T15:16:09Z","title":"Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T21:13:57.062334Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2511.16449"},"observation_digest":"sha256:7853344232130b65b46b3bc96e17c113fb328b4fc74b5e33ceca655f04037f73","observation_id":"7816679a-32e7-4762-ba51-ee9b28fac194","resolution":{"observed_at":"2026-08-03T21:13:57.062334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-08-11T06:04:17.319434Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:32.048309Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2512.15840"},"observation_digest":"sha256:eea6804203ff5c2eced10bbe767ab673f374edb0a53c41ff31c9621997ddf9e5","observation_id":"b49db4d9-ec83-487b-8134-59b8054e7b2f","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-03T12:30:33.815895Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.815895Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:389ed0d83ef1c619d5d5e9cb319ffe70290f902abe3a5e25a5923f73e1234cee","observation_id":"3cd072e4-9009-4ed1-9522-9bc9dcc93d22","resolution":{"observed_at":"2026-08-03T12:30:33.815895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:3665850372d5f4dad5bbd72bac61e61e3df95c5ad7690303a2c90e913cc0f96c","observation_id":"109a6f98-431f-40d0-be5d-ec143c757832","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-03T03:56:05.024414Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-11T00:18:26.922381Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.024414Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:7f80675b23dc5df4f03f790abc9400b2769deddc2956c4e1dea4f5dbeeaf1376","observation_id":"2fca8ba7-75e2-492c-90b4-926308054eb2","resolution":{"observed_at":"2026-08-03T03:56:05.024414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T22:14:27.691000Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-11T12:44:14.562608Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:27.691000Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:5fab64f121fa4600abf4a4b53abfcfebc7347963b85811ee4510445de9f54e0e","observation_id":"0156e3b7-b707-4466-aee0-8f412012e693","resolution":{"observed_at":"2026-08-02T22:14:27.691000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:a245ad71cb507872288717e7fc7540e08ad19ba198411a23c269c30011fac6e2","observation_id":"3248ea7c-a93b-453a-b155-b54935d2e0af","resolution":{"observed_at":"2026-05-21T13:24:11.195439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:7287f0aa1d1eb7a98d9c194d43d5aed375d62a0bb36dc9c36e2ef52e1e15e9eb","observation_id":"1b5d37b1-f4c6-48f6-beab-1444b650778f","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T21:12:11.244767Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21013","last_updated":"2026-05-29T17:02:38Z","snapshot_observed_at":"2026-08-07T08:52:59.799145Z","submitted_at":"2026-02-24T15:30:55Z","title":"Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:11.244767Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.21013"},"observation_digest":"sha256:21ca316a26bf71c631a34b57dfede58898cc203a1d43b2807bcaf59164231871","observation_id":"acf4a9f8-ca4f-4cc7-a719-92cd552dba1c","resolution":{"observed_at":"2026-08-02T21:12:11.244767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2604.05484","last_updated":"2026-04-07T06:24:41Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:24:41Z","title":"CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:12.286456Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2604.05484"},"observation_digest":"sha256:9206ca011fdf6ec7b57fd3f3bc097316a88cda6de7bd41423dd2393e39006ef8","observation_id":"c9976df8-3e13-467b-b346-626101002b82","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2604.15281","last_updated":"2026-04-16T17:50:37Z","snapshot_observed_at":"2026-08-02T21:20:28.291912Z","submitted_at":"2026-04-16T17:50:37Z","title":"R3D: Revisiting 3D Policy Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T10:57:54.273960Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2604.15281"},"observation_digest":"sha256:6dcb8727dda7c657b476ec799489d49683866ad0a80f86650bf11f1b8bb9e524","observation_id":"f223ed7b-05f6-4852-b60d-e27e6b6246b4","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2604.18483","last_updated":"2026-07-01T12:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:35:57Z","title":"Steadily moving semi-infinite fracture in plane poroelasticity","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-05T11:39:05.686584Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2604.18483"},"observation_digest":"sha256:f0bf0f6c54c06838f689383bba391c20857ed3a6295591fcbe58b285cb3d1af2","observation_id":"2457dd32-3bd9-4ea0-b750-6b37fd5912d1","resolution":{"observed_at":"2026-07-05T11:41:02.631612Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2604.18484","last_updated":"2026-04-20T16:37:16Z","snapshot_observed_at":"2026-08-10T23:34:51.220731Z","submitted_at":"2026-04-20T16:37:16Z","title":"XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T05:46:36.865150Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2604.18484"},"observation_digest":"sha256:d4200b55d4ee2393168fd2f6a85d78d396192e57f8fe47a712d0ede20db0ee17","observation_id":"d989c838-42b4-4de4-9e6c-bce3fb67cb03","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2604.20472","last_updated":"2026-04-22T11:58:05Z","snapshot_observed_at":"2026-08-08T13:33:22.125079Z","submitted_at":"2026-04-22T11:58:05Z","title":"Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T23:59:32.295839Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2604.20472"},"observation_digest":"sha256:2500c232d3c5064e3d70319fae472e173a8bfecc8a0e5607bb48929d1042ebc2","observation_id":"3cae46c5-e933-4d17-ade1-e02b383aab9c","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T03:39:41.090350Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:64a95487674f621b68c7c3a46f5c4194a336775599ff2404d8964e7b6f0e57ce","observation_id":"ed14748f-ba53-4b04-8253-407f2af5c6fd","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T02:53:54.608425Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:6387579d68babceba25c9f113bf8b61df5f7c1f3232289333f79687e21c28811","observation_id":"eda8b2af-9ba1-4373-9ccc-ee5dc093d9a6","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T06:16:48.180290Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.07931"},"observation_digest":"sha256:a3741ef5ba5572f75cc0915ed622162f47662d129a7f8fc7e07f8472b9157339","observation_id":"99a02836-19fc-4e0d-8fdf-06d50d8168b6","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-11T12:48:32.106224Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T01:05:44.188530Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:64df29bb8e45071d567e79ffc85f594cf09c620cf12d2de3df4284768e52f2f6","observation_id":"63d57f8c-ef74-40da-b75e-15824cdc024f","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T14:19:52.451085Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.11665","last_updated":"2026-07-28T11:54:22Z","snapshot_observed_at":"2026-08-11T12:48:32.106224Z","submitted_at":"2026-05-12T07:26:39Z","title":"Nautilus: From One Prompt to Plug-and-Play Robot Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:52.451085Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.11665"},"observation_digest":"sha256:068c5cc0751dd3cf23d87e8674eb7ce6d81de0db9d56cdd162c33eafaa4883da","observation_id":"c4c0af91-7269-4c83-b653-1933350d8d1e","resolution":{"observed_at":"2026-08-02T14:19:52.451085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":266,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:21607a7488c1ea1b73ca39e95ec1d34f7ca89ea945b856f16ca0b849d2ce8b8b","observation_id":"0f162522-895d-4f9f-9e24-27ed585a84e7","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.16241","last_updated":"2026-05-15T17:48:25Z","snapshot_observed_at":"2026-08-01T14:57:19.382384Z","submitted_at":"2026-05-15T17:48:25Z","title":"Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T18:41:12.533556Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.16241"},"observation_digest":"sha256:48083fcec01faf66cb3a2b5e08dce3c215b5eccda8136ca85883380f21069087","observation_id":"7c181494-535f-451a-9f0a-6c9783ba3979","resolution":{"observed_at":"2026-05-20T18:43:38.654786Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:5d190da42c397502a76bfce5af2fda06e98678b70e5aab541b8955238fe4729a","observation_id":"89061257-a158-4bfc-b6c6-86b99145f0db","resolution":{"observed_at":"2026-05-20T12:43:16.959685Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.20856","last_updated":"2026-05-20T07:45:50Z","snapshot_observed_at":"2026-08-02T12:40:40.235987Z","submitted_at":"2026-05-20T07:45:50Z","title":"DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:58:46.675822Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.20856"},"observation_digest":"sha256:efbf5082ae75717107d42782b3ea85e1e099228842f2e0fde9287e1cb9607776","observation_id":"514e7fa4-60ff-4164-b8a9-058e32ba8694","resolution":{"observed_at":"2026-05-21T04:59:36.280986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.28231","last_updated":"2026-05-27T09:44:46Z","snapshot_observed_at":"2026-08-08T02:28:40.494991Z","submitted_at":"2026-05-27T09:44:46Z","title":"ProgVLA: Progress-Aware Robot Manipulation Skill Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T11:51:42.029338Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.28231"},"observation_digest":"sha256:dc911bbd3ab9d4b424a50bd02d158a9ed3e15f986a0e5f5951738607ac5e98dc","observation_id":"976c9f63-34ef-4bcd-bdcd-c1bb6d6532a9","resolution":{"observed_at":"2026-06-29T11:53:23.407726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.28548","last_updated":"2026-05-27T14:39:42Z","snapshot_observed_at":"2026-08-05T18:31:00.706002Z","submitted_at":"2026-05-27T14:39:42Z","title":"GEM: Generative Supervision Helps Embodied Intelligence","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T13:38:27.263726Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.28548"},"observation_digest":"sha256:6b92374b7d2b91668c4de15fe10c0e0209725db4ca0c2233c133673f3e033cb0","observation_id":"32c9a440-5ccd-4b66-8b71-731a5e88279d","resolution":{"observed_at":"2026-06-29T13:43:28.884284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.28634","last_updated":"2026-07-18T09:11:07Z","snapshot_observed_at":"2026-08-02T12:57:53.343771Z","submitted_at":"2026-05-27T15:41:18Z","title":"PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T11:46:14.257386Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.28634"},"observation_digest":"sha256:4b46b0664cd3c85ea519d526c7cd771fdb355f3acb4941eca4cfd270111cfe75","observation_id":"23cdc0b3-ffa8-4502-b64e-1d0fdd5b567b","resolution":{"observed_at":"2026-06-29T11:53:24.289208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T12:57:54.300162Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28634","last_updated":"2026-07-18T09:11:07Z","snapshot_observed_at":"2026-08-02T12:57:53.343771Z","submitted_at":"2026-05-27T15:41:18Z","title":"PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:57:54.300162Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.28634"},"observation_digest":"sha256:4e8f00b8620e0bbd8ed29e5a9a38c1350632cd5a087bc72abf61ffe087e74064","observation_id":"69a65c01-7b88-4177-8bbb-e1f733ce53ad","resolution":{"observed_at":"2026-08-02T12:57:54.300162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:ad35719672977f71a9e27825d12075f850715bee1a442205cb8b718ce3dabc08","observation_id":"41f5cdd1-553a-4629-8013-e5488a2c66e4","resolution":{"observed_at":"2026-07-01T19:26:00.546630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:18ef29f41eab97fed8fbdf36b5f2d80e918b02b20a41d873e248a6633faafcd0","observation_id":"b3cd827f-3772-4f8b-b639-290db411c575","resolution":{"observed_at":"2026-06-29T13:33:27.797624Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:cf737e1d4235ff010a329337671ebf4623b6210bea1cefa59912a69655e74326","observation_id":"1b5bfa74-4664-4ff1-beb6-78e8eea08836","resolution":{"observed_at":"2026-07-02T13:16:59.183095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2606.21188","last_updated":"2026-06-19T07:56:58Z","snapshot_observed_at":"2026-08-02T21:26:36.430535Z","submitted_at":"2026-06-19T07:56:58Z","title":"Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T14:21:46.672591Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2606.21188"},"observation_digest":"sha256:2c87f4991d522d3a5ea23834f8eaa04493adc2384b2fe94478339a5174833cbb","observation_id":"0f594631-394e-41eb-9553-f68c7f431a11","resolution":{"observed_at":"2026-07-04T06:39:37.140664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2606.23589","last_updated":"2026-06-22T16:57:43Z","snapshot_observed_at":"2026-08-02T13:49:45.435338Z","submitted_at":"2026-06-22T16:57:43Z","title":"KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T08:22:29.894757Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2606.23589"},"observation_digest":"sha256:be9a12e6870e51370aa45fc9142ac54b1bb28b175ac8ae79e02e71e1f874091a","observation_id":"b83e0735-4bf9-4e9c-923d-8f30147b996d","resolution":{"observed_at":"2026-07-04T10:59:45.680478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2607.01804","last_updated":"2026-07-02T07:18:53Z","snapshot_observed_at":"2026-08-07T01:24:57.162223Z","submitted_at":"2026-07-02T07:18:53Z","title":"VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T12:20:11.540651Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.01804"},"observation_digest":"sha256:b4e06f85e803fcb4b277f4dd8e0fddb726136aacd33164485d3c80a17e30a392","observation_id":"b32f87a6-b19b-4c5c-9c5f-99324bec936d","resolution":{"observed_at":"2026-07-03T12:28:07.296016Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vision-language foun- dation models as effective robot imitators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-07-16T23:18:02.667998Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:de15bcb0713a45888f102c0836dfb043f344cf1ddd72248a7bbc4eb54052a184","observation_id":"da9a171c-ec69-422b-b275-2573ef587e77","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-14T05:40:47.306935Z","title":"Vision-language foun- dation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11427","last_updated":"2026-07-13T11:31:53Z","snapshot_observed_at":"2026-08-07T09:19:25.836681Z","submitted_at":"2026-07-13T11:31:53Z","title":"EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T05:40:47.306935Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.11427"},"observation_digest":"sha256:4db15f9f97293dbadbfbd9d8af5625ced0ac32adc4e48aeb052336f31068e14d","observation_id":"178ff601-9fc6-4c5b-8cfa-38572c73e082","resolution":{"observed_at":"2026-07-14T05:40:47.306935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T05:16:38.875488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-07T12:37:37.871440Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.875488Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e739567814104cadccb6db053a66bfed3372565fb3065f79c71c6c2a1bc28519","observation_id":"54fea40b-07c2-4328-bae1-71a7d0e0786e","resolution":{"observed_at":"2026-08-02T05:16:38.875488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-01T14:39:52.334279Z","title":"arXiv preprint arXiv:2311.01378 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-08T18:57:26.098275Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.334279Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:032fcc7f093fc500cd3df43b42897c5279a61e8724483bdd300616c1d2db321d","observation_id":"0e991754-2032-4230-9537-a18f423502a0","resolution":{"observed_at":"2026-08-01T14:39:52.334279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-31T22:36:29.282379Z","title":"Vision-language foundation models as effective robot imitators.arXiv preprint arXiv:2311.01378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24148","last_updated":"2026-07-27T08:29:05Z","snapshot_observed_at":"2026-08-07T04:57:17.871783Z","submitted_at":"2026-07-27T08:29:05Z","title":"A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T22:36:29.282379Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.24148"},"observation_digest":"sha256:95726321cabdf042ca965d52de8e00dbd15d2a75d4979e76e5eff8190f5f3e6e","observation_id":"c5fb9ad4-a1da-4803-aea9-f43f45530565","resolution":{"observed_at":"2026-07-31T22:36:29.282379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-01T02:21:25.275883Z","title":"The Twelfth International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25487","last_updated":"2026-07-28T09:24:17Z","snapshot_observed_at":"2026-08-10T23:06:58.735363Z","submitted_at":"2026-07-28T09:24:17Z","title":"CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T02:21:25.275883Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.25487"},"observation_digest":"sha256:5ec98826e5f9599379c8534f2e28d38fcac4a0aa38e207e571babc9de8038a00","observation_id":"8da74966-0b46-4aee-a303-caf09a14c868","resolution":{"observed_at":"2026-08-01T02:21:25.275883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T19:45:34.913478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:34.913478Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:8337cbcd570b554547609f7ca0d0dbde87475b521d9ce54dbafd4e112a1a5d52","observation_id":"70d692ef-3573-4fbe-9135-d9fe257aecc2","resolution":{"observed_at":"2026-08-04T19:45:34.913478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-04T06:10:32.906456Z","title":"Vision-language foundation models as effective robot imitators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02497","last_updated":"2026-08-03T17:02:04Z","snapshot_observed_at":"2026-08-10T03:03:42.557157Z","submitted_at":"2026-08-03T17:02:04Z","title":"Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:10:32.906456Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2608.02497"},"observation_digest":"sha256:dc11c446ca4f12283c5591eb9958a330df80a5f49e6e066479ce4c830a9f26c8","observation_id":"901f4227-b934-4ab4-95f0-eac1b048c079","resolution":{"observed_at":"2026-08-04T06:10:32.906456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.01378/citation-record","integrity":"/paper/2311.01378/integrity","json":"/paper/2311.01378/citation-record.json","paper":"/paper/2311.01378"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:1f2f491d904051302cc4da7099047687c2d30e360e0146557c614339ff631dce","observation_id":"1cbe03ef-32ab-43bd-960c-956b0c11ab89","resolution":{"observed_at":"2026-05-16T21:44:27.586835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:78dfc14fc4a8f37a109338202c33a14f2abb1133e12070b2c79e5195b722ab89","observation_id":"ae782965-892a-4f8c-8340-0a8814ea5859","resolution":{"observed_at":"2026-05-16T21:44:27.594224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":"2204.06745","doi":"10.48550/arxiv.2204.06745","metadata_source":"pith","pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","venue":"cs.CL","work_id":"168a55d5-675d-49cf-be47-a17ee8cd742e","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:9a7ab3b22d186772e3a1d9e5d312a4e15f3cbbd7a088ba5ea6d290f890eca654","observation_id":"b76ed509-3bc4-4db6-8bce-c1d6b97074d4","resolution":{"observed_at":"2026-05-16T21:44:27.599526Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:7a60380b31552fc0b0be27846a6cd25a6ebfe6c444772befab67d00596337f7b","observation_id":"21e3ab03-a12d-4689-9be7-9794c12146e1","resolution":{"observed_at":"2026-05-16T21:44:27.605460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"677093e0-2019-45af-8c52-d9b33dec7e3d","year":1901},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:821a8875148b2d3a43c672b7700f447e03f95410d9e67c441d262dd8f78ab3ed","observation_id":"16fb9d8a-ec60-4dba-9f3f-d33c6e9f8f4e","resolution":{"observed_at":"2026-05-16T21:44:27.684676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11175","last_updated":"2018-04-12T17:03:44Z","snapshot_observed_at":"2026-07-06T06:30:55.970076Z","submitted_at":"2018-03-29T17:43:03Z","title":"Universal Sentence Encoder","version":2},"cited_work":{"arxiv_id":"1803.11175","doi":"10.48550/arxiv.1803.11175","metadata_source":"pith","pith_arxiv_id":"1803.11175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal Sentence Encoder","venue":"cs.CL","work_id":"50757662-45a8-4e4f-a34b-35de8c783c56","year":2018},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/1803.11175","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:fe8d9c9bf3769f4883a7f72374f1928e3e20ac6630e2f80beffea839b6bed102","observation_id":"cc775273-3999-4bae-a26f-35f8c8eb9903","resolution":{"observed_at":"2026-05-16T21:44:27.640258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":"2305.18565","doi":"10.48550/arxiv.2305.18565","metadata_source":"pith","pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","venue":"cs.CV","work_id":"b3f6141d-1fd1-42f9-8834-ff27d4a60d5f","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:552800646890aa3ee0e34ce0aa0bd9d552ef83eafb0503382841d6bae5333342","observation_id":"013ea9a7-7e86-44fc-b6ae-ba413f602e8e","resolution":{"observed_at":"2026-05-17T14:36:10.299419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:319fe7223fc9349b9686a07b786f25f093b1581125105eebbf0515de7ed74cf1","observation_id":"c4b870d8-c583-4d48-959f-e5c60d8f7618","resolution":{"observed_at":"2026-05-16T21:44:27.650262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:fca0315fa0a56b6ef283f0976624db1243c9951adcd4eee1855d99214ca8e7b9","observation_id":"0fde5446-ce46-40d3-8080-6026e75ffaf5","resolution":{"observed_at":"2026-05-16T21:44:27.655058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-09T00:25:43.898202Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":"2302.12766","doi":"10.48550/arxiv.2302.12766","metadata_source":"pith","pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Karamcheti, S","venue":"cs.RO","work_id":"5bd4457e-dc56-4b1e-ac07-f14764ba597e","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:51a0991157efc464bbffcae975f1ff2b64d0b6c0be7d5114475571eec54bbf16","observation_id":"a2ed258a-4c73-4e87-a83d-d994d9cfca3e","resolution":{"observed_at":"2026-05-16T21:44:27.661155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04387","last_updated":"2023-06-08T13:44:24Z","snapshot_observed_at":"2026-08-10T20:41:01.172916Z","submitted_at":"2023-06-07T12:35:37Z","title":"M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2306.04387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04387","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3it: A large-scale dataset towards multi-modal multilingual instruction tun- ing","venue":null,"work_id":"c402e58a-ad70-4eb6-8031-d70d3835ceab","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2306.04387","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:7abc965b6bdac7b5752b8b5d02ea583cb513485c4c332ecc3a71eb85b7aa32d6","observation_id":"149dc577-de54-4a50-a79e-d9dd3eb604de","resolution":{"observed_at":"2026-05-16T21:44:27.666644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotic indoor scene captioning from streaming video","venue":null,"work_id":"c95711ce-dc6a-4901-b110-34da0529eb20","year":2021},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:afad03dab71cb654b597f7b993126cdbe2f9e42c5e5099e38ca75190d2528016","observation_id":"1f06a7a9-cea8-49fb-ad6c-4f29bc989509","resolution":{"observed_at":"2026-05-16T21:44:27.690836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09395","last_updated":"2021-04-15T04:30:35Z","snapshot_observed_at":"2026-08-03T16:16:13.326473Z","submitted_at":"2020-04-20T15:49:35Z","title":"Energy-Based Imitation Learning","version":4},"cited_work":{"arxiv_id":"2004.09395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.09395","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy-based imitation learning","venue":null,"work_id":"4d47bef8-ab2d-46d2-846b-e5e48e16d148","year":2004},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2004.09395","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:483ada17b9b3eef03f37577295e96ca0ca865c4995ace19bb70a4234eaf4f24b","observation_id":"e5fa4bbc-eb12-4e2d-9344-5bebd5c1a737","resolution":{"observed_at":"2026-05-16T21:44:27.671932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-08-09T20:13:54.024607Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":"2201.08299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-07-08T03:24:28.836511Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":"cs.AI","work_id":"49912572-a2f0-40c7-a997-487d1ad01cb7","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:459f9d0aa0fed8814f9d7e553c84f0e27f78a5ac3646334ff785da54e457418a","observation_id":"b9f768c3-f6c6-4e19-8ced-8946163901b7","resolution":{"observed_at":"2026-05-16T21:44:27.676683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters in language conditioned robotic imitation learning over unstructured data","venue":null,"work_id":"e31643b9-8c9c-49cc-810b-7f3064db9f1d","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:6f72a8f6d4c81d724547202e211be8fd0169235516373740c950ab1ec663eeda","observation_id":"7323d1d8-b846-4324-822a-759850c23c31","resolution":{"observed_at":"2026-05-16T21:44:27.699498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-11T08:36:53.636356Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:bb6162543d76571471a43a6a4a80954658accb543be9c668627d538fa1ca7e89","observation_id":"68418dd1-9afa-4db1-a4de-4e00b7713817","resolution":{"observed_at":"2026-05-16T21:44:27.681200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-11T05:34:32.208314Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:021828afd6b85ed187d3880434c14b363a42f1b10b42e5af3fe39dc47b22ab5d","observation_id":"df1f8824-7038-47c7-af60-9fcdbb989026","resolution":{"observed_at":"2026-05-16T21:44:27.610048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":"2304.03277","doi":"10.48550/arxiv.2304.03277","metadata_source":"pith","pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction Tuning with GPT-4","venue":"cs.CL","work_id":"fd515477-f9f1-48aa-9feb-a3308e7656bb","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:8c7b3a9d45e7147cec13a94b672d60d23bd8c973242349bb26d49e1beb7d2736","observation_id":"612f1bec-e0ef-481d-b834-23a4ac1ca143","resolution":{"observed_at":"2026-05-16T21:44:27.614501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:ed30691601c7e62d26040acb6e56b041729b736c8503e5e56e9bb890089178f4","observation_id":"f3b40001-ab12-4ff5-b376-dde687899770","resolution":{"observed_at":"2026-05-16T21:44:27.619248Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:80b462de562626ec98563ef60416c1ec13b375bad3c8e435eb423679a0abd3a6","observation_id":"0f5d8f62-1dab-4419-8d7b-df71be54d9e7","resolution":{"observed_at":"2026-05-16T21:44:27.623676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07795","last_updated":"2022-10-14T13:26:41Z","snapshot_observed_at":"2026-08-11T15:35:03.609194Z","submitted_at":"2022-10-14T13:26:41Z","title":"EfficientVLM: Fast and Accurate Vision-Language Models via Knowledge Distillation and Modal-adaptive Pruning","version":1},"cited_work":{"arxiv_id":"2210.07795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.07795","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xinlong Wang, Wen Wang, Yue Cao, Chunhua Shen, and Tiejun Huang","venue":null,"work_id":"c942259f-ca51-431b-8c86-d14ac44befcc","year":2024},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2210.07795","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:f76bb8644debd32d5e2dca4ae79526380154f1ebfa0f63942d79003ed13593d9","observation_id":"7ba2036a-28ce-4fb5-9b14-2f9c48d94575","resolution":{"observed_at":"2026-05-16T21:44:27.628753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12402","last_updated":"2023-07-30T13:20:13Z","snapshot_observed_at":"2026-08-08T05:02:29.486711Z","submitted_at":"2022-11-22T16:48:01Z","title":"X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2211.12402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.12402","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2211.12402","venue":null,"work_id":"801133a4-b76c-4228-b7a9-7293a9fa90cb","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2211.12402","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:e8fbe62a523d4299894ad034d534538389f1ce435e09e8f5996698bce62edd50","observation_id":"78aefb08-78d4-476d-a35f-ae965cd083a0","resolution":{"observed_at":"2026-05-16T21:44:27.636185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoperation","venue":null,"work_id":"323ecad7-5f4b-47dd-ad24-9858c2401b14","year":2018},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:20f46eed7e431481803b1dfc1b47afd2aba5d3c0663352f5d35593f7b40d0f9d","observation_id":"78db5617-2162-4a2f-a754-1bfd92eb2af7","resolution":{"observed_at":"2026-05-16T21:44:27.693786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We loaded the pre-train 14 Preprint Table 5: Comparison of co-trained models and fine-tuned models on the CALVIN benchmark","venue":null,"work_id":"4a9e9568-905e-4396-85f0-c07aaa86b7c8","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:dc6e2f282bfd47d1efbdf50428ab1b1e50aefcb4e62087e1e290990ddf5684dc","observation_id":"73934fbc-1691-4f82-9cbc-9d7fc1677cc1","resolution":{"observed_at":"2026-05-16T21:44:27.696647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As for V oltron, we also include a version that fine- tunes the representation layers","venue":null,"work_id":"9dac9795-b199-4c2f-ab6d-839f72b03b33","year":2022},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:5d7aebe2d9ba06665fed1e72c3ac2adbaadf5788925142a2a3367fa755fff621","observation_id":"2861e5a5-e962-4179-9624-2a09f20465a4","resolution":{"observed_at":"2026-05-16T21:44:27.687783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":6},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 92 inbound Pith citation observations for arXiv:2311.01378."}