{"as_of":"2026-08-19T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b85bac09c3709884ccbc9cdd907d408f96cfd3715b514e7428034bba6c3c3fa4","coverage":[{"denominator":119,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:10:12.234233Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:00:31.953138Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T20:16:29.417538Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-08-12T22:06:44.986785Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:25.672157Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2604.19734"},"observation_digest":"sha256:e67a9b8f6f82ca6609bd1c276f9d24e852902cd05db1d9ffc25ad77a13626411","observation_id":"917c4e4a-4397-44a5-b114-89a12a9de230","resolution":{"observed_at":"2026-05-15T02:43:08.181865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-08-11T13:33:40.884997Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:ff1a75935c52427176db8f601b158055fb2df9715426c943be216221befa98c8","observation_id":"f3a3171d-600d-4eab-99b5-c195e1c9bc09","resolution":{"observed_at":"2026-05-15T02:43:08.181865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2605.20811","last_updated":"2026-05-20T07:05:49Z","snapshot_observed_at":"2026-08-16T19:04:34.974539Z","submitted_at":"2026-05-20T07:05:49Z","title":"Demo-JEPA: Joint-Embedding Predictive Architecture for One-shot Cross-Embodiment Imitation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T04:45:47.109272Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2605.20811"},"observation_digest":"sha256:0b75f47721c373be5a8f8a3840292ab821aba89807e7d8efcd7242a84f99495a","observation_id":"8244850d-5b03-4c4e-8aed-2bc4a374edd2","resolution":{"observed_at":"2026-05-21T04:49:35.628764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2605.25044","last_updated":"2026-05-24T12:41:34Z","snapshot_observed_at":"2026-08-15T10:46:13.558273Z","submitted_at":"2026-05-24T12:41:34Z","title":"X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T00:18:33.150920Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2605.25044"},"observation_digest":"sha256:8a6f0f3bf34f81a7fd66a6b39700b62679028e952c68b6dfd5d5bda0cb8e219a","observation_id":"d20ff8bd-83b4-46dd-aad2-b09b0ff8d722","resolution":{"observed_at":"2026-06-30T00:24:04.228645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2606.28133","last_updated":"2026-06-26T14:34:04Z","snapshot_observed_at":"2026-08-05T12:02:21.397136Z","submitted_at":"2026-06-26T14:34:04Z","title":"Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T04:23:04.622902Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2606.28133"},"observation_digest":"sha256:4892f1a3d96efc7f7f0cb0beeeff301c9f8525399c69c5ed5c259f27898b5392","observation_id":"caea0d14-8334-4eaa-b796-099b79db7b7b","resolution":{"observed_at":"2026-07-01T16:55:51.384865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":"2511.02776","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-07-09T20:16:29.417538Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","venue":"cs.RO","work_id":"616f0c80-e5b7-4136-a207-affd8a1e934f","year":2025},"citing_paper":{"arxiv_id":"2607.07101","last_updated":"2026-07-08T07:37:27Z","snapshot_observed_at":"2026-08-14T19:14:49.444744Z","submitted_at":"2026-07-08T07:37:27Z","title":"GeoProp: Grounding Robot State in Vision for Generalist Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T20:12:59.778086Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2607.07101"},"observation_digest":"sha256:c1d6ede0ffbfc07640c6316ed53f8ce034f2b66ba33c09836ff4a428631657c1","observation_id":"1e9949d2-8952-42b1-9ab0-353e7516db53","resolution":{"observed_at":"2026-07-09T20:16:29.418832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-08-02T06:36:26.185245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:26.185245Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:4f8d2388fab67169ae58902aada42d27481c19b5f1adb9d800914ea3fd27a5f4","observation_id":"b92120f6-af3b-4f60-816f-d59befd8112a","resolution":{"observed_at":"2026-08-02T06:36:26.185245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02776","snapshot_observed_at":"2026-08-10T17:00:31.953138Z","title":"Xr-1: Towards versatile vision-language-action models via learning unified vision-motion representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06994","last_updated":"2026-08-07T09:12:15Z","snapshot_observed_at":"2026-08-19T06:02:17.667459Z","submitted_at":"2026-08-07T09:12:15Z","title":"Decoupling Intention from Trajectory: A Representational Deduction Framework for World Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:00:31.953138Z"},"links":{"cited_paper":"/paper/2511.02776","citing_paper":"/paper/2608.06994"},"observation_digest":"sha256:29c55d099b354ec55fd7ffcf60f173ffaeb83209b815b51994ec86f81e127491","observation_id":"ab5949a4-a94d-45ae-b240-7ad55ab83bd6","resolution":{"observed_at":"2026-08-10T17:00:31.953138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.02776/citation-record","integrity":"/paper/2511.02776/integrity","json":"/paper/2511.02776/citation-record.json","paper":"/paper/2511.02776"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:00.646911Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.646911Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:d2809c9aeff64d7a09411494394412ae601217ecd3cff3b4824a4d6058be80c1","observation_id":"144983e2-5702-4ad3-9f44-d0b030581aea","resolution":{"observed_at":"2026-08-04T00:10:00.646911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:00.716220Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.716220Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:5b926f37c2fb73572eaa10b2456dc122ab7ecbc43269c6f2c47aca5bd921d2b4","observation_id":"753c30c1-7de9-45b7-8203-a5ac1cd3c7e2","resolution":{"observed_at":"2026-08-04T00:10:00.716220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T00:10:00.794099Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.794099Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:b244d2931007eaca8fc24d8fae016a84764d0352113ac33d6e5f3e8b6c225c49","observation_id":"c1e0108b-eac3-4dce-a6ff-c55ff0822cd8","resolution":{"observed_at":"2026-08-04T00:10:00.794099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:00.857864Z","title":"Katzschmann","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.857864Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:658f32084f5b2913409cd314741bf8cbc36d12f76887b27e70773dc9810bfe88","observation_id":"db6b1c64-be79-4b63-ab4d-746cf9ae12a4","resolution":{"observed_at":"2026-08-04T00:10:00.857864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:00.861375Z","title":"Hydra: Hybrid robot actions for imitation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.861375Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:f92ed49352007297e70f890df8333929fdb5e933a95581fae172d141aaa389fc","observation_id":"0f600b06-495e-491c-b9d0-1d75ee74a2ea","resolution":{"observed_at":"2026-08-04T00:10:00.861375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-04T00:10:00.864723Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.864723Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:64f4c7f42263dbcb204bd657a76fc79769692787dc9effdd8dde46f0d5e70c52","observation_id":"6c1cdcd1-0cc2-4e43-b7a6-c89bdcab0a4d","resolution":{"observed_at":"2026-08-04T00:10:00.864723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:00.932701Z","title":"Roboagent: Generalization and efficiency in robot manipulation via semantic augmentations and action chunking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:00.932701Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:abc1b69067f7adc14e215582d36dc0212d6b7768da3d2c685d8402485a9598ff","observation_id":"26fd93ac-1f47-4625-8b33-eb70083efd76","resolution":{"observed_at":"2026-08-04T00:10:00.932701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-04T00:10:01.100730Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.100730Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:07c19bc91b4fb77f9b8253fc03f266c6a6c76e0d355b4968646069d7a9c32805","observation_id":"8106047e-be79-48de-a858-39188c005d9e","resolution":{"observed_at":"2026-08-04T00:10:01.100730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T00:10:01.206655Z","title":"_0 : A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.206655Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c5f6dc7089cd7d34fc4b6d2aadedfe067ee035f78f909d9a8e46c58996b85955","observation_id":"47e9125e-3d14-4979-8d4d-8be679c1491a","resolution":{"observed_at":"2026-08-04T00:10:01.206655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-04T00:10:01.371161Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.371161Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:8ef45c1b69b488662fb0043fdd280e26f997d3b831605de487e90c461c1da940","observation_id":"fb75da38-b5ec-46c3-851c-5fb5339c0625","resolution":{"observed_at":"2026-08-04T00:10:01.371161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-04T00:10:01.535943Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.535943Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:9053542123a7d90e0fd105195f480888356bb24b2d8fbf776b1b0fb1cdad6b58","observation_id":"04eef429-2e54-47c7-aecf-29342af00b36","resolution":{"observed_at":"2026-08-04T00:10:01.535943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:01.704216Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.704216Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:db3301237b05ce31713a6a9c46cfaa0fbe7edc2e5e162e0ade8b996ebc82bc9b","observation_id":"9e71e394-ce41-4de4-b331-7baf1e0a7a8e","resolution":{"observed_at":"2026-08-04T00:10:01.704216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:01.871844Z","title":"Mamba policy: Towards efficient 3d diffusion policy with hybrid selective state models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:01.871844Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:ae85e5c92ccecd9eb4d6f9c7a6f7332cae3a8e48aa9cdd890ad86ae0ef15b097","observation_id":"2c65b97c-59eb-4af6-a08d-e90cd4a2cb25","resolution":{"observed_at":"2026-08-04T00:10:01.871844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T00:10:02.038513Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.038513Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6fa32d0b70983162544b4f52fb3110c16f715be75ee089ffe048d0b2719e891b","observation_id":"a6b38cc4-616c-4007-9599-7213a9cbc1d7","resolution":{"observed_at":"2026-08-04T00:10:02.038513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-04T00:10:02.202806Z","title":"Gr-3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.202806Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:1b31d35dba398b20e4de8b3092fcb156128a140db4962289c5b4fb5fd6a65e77","observation_id":"e9f6a94b-1b35-437b-a9df-a8932f1fe9cf","resolution":{"observed_at":"2026-08-04T00:10:02.202806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:02.371084Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.371084Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:e8d520ecdb42d2211988f3c2f1ef02d7bc9504c9148e374e61a429b4268c20b9","observation_id":"9567883d-a4c2-482c-9c37-5382cb4a54d1","resolution":{"observed_at":"2026-08-04T00:10:02.371084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:02.544842Z","title":"Playfusion: Skill acquisition via diffusion from language-annotated play","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.544842Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:89b0c6dde2dc227782a825ab5d2eb3c7bd7fa528c51c2da8b520e1bb40394c66","observation_id":"3295f24a-8ad5-454f-b11f-46c65c8e7369","resolution":{"observed_at":"2026-08-04T00:10:02.544842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:02.698063Z","title":"Moto: Latent motion token as the bridging language for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.698063Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:aac976acf4c5f95ec1868246e620859df6137df6c8f8822692439490c4f051d3","observation_id":"3bd6deab-5954-4d80-82e8-6a53268f3591","resolution":{"observed_at":"2026-08-04T00:10:02.698063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:02.806309Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.806309Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c9f03dc80796646f3d9c08e58a1f6f4ada3c28f222457aa3c1f2e66b348294e7","observation_id":"3f72c60d-595c-498c-a80e-14b4ad91529a","resolution":{"observed_at":"2026-08-04T00:10:02.806309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:02.978234Z","title":"From play to policy: Conditional behavior generation from uncurated robot data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:02.978234Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6c2756922a4b967cf2be9181f840a14b861400838a3f0e41a0a705101fe6784c","observation_id":"79630e2c-e1e6-44b3-8fde-3bb04aaaa097","resolution":{"observed_at":"2026-08-04T00:10:02.978234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.136948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.136948Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:741affc89969a3dc436773e0c724ecf8e3383039b1ebaa15be5f560204871a7d","observation_id":"2f4da7b4-5811-4065-8228-8b03bfa745b8","resolution":{"observed_at":"2026-08-04T00:10:03.136948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.258438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.258438Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:9c97eb3425832989f697c61c08c0e3af972cdfb217d68d2574e1c9008478e750","observation_id":"bdad1294-955c-4333-8c04-114a23788008","resolution":{"observed_at":"2026-08-04T00:10:03.258438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.386238Z","title":"Learning universal policies via text-guided video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.386238Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:46bdd52e12ba2960e7647a2381909ec504e3261f5389b559a8a2eae574fb34e2","observation_id":"04134676-4123-45f0-9d52-4d832ba0a1f8","resolution":{"observed_at":"2026-08-04T00:10:03.386238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.513094Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.513094Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:1545b4cede2c575cc6c2898f237b959f661551d0f2958fa15437d3640fb914a6","observation_id":"85cfa95a-1cb6-4a1c-82ba-b6d547c63b9e","resolution":{"observed_at":"2026-08-04T00:10:03.513094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.628278Z","title":"Diffusion trajectory-guided policy for long-horizon robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.628278Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:679155ab656ba220c8c29bf8733002f6dddba5665bdb591188c308e92e048c26","observation_id":"51c0c563-8e68-481c-b63b-738e13460692","resolution":{"observed_at":"2026-08-04T00:10:03.628278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.748331Z","title":"Finetuning offline world models in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.748331Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:35eee9cec6028334fa47b109b39f4956ad3d5d731fd5d4c16ef4f10275114ed4","observation_id":"33b15971-601d-4791-9baa-676298fb8784","resolution":{"observed_at":"2026-08-04T00:10:03.748331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.869335Z","title":"Mobile aloha: Learning bimanual mobile manipulation with low-cost whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.869335Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:cea17396a10499f9d82525194ed8ee64b83d7ae55a7898ef3cde2ba3ea8fea6b","observation_id":"b45a439b-ccd7-4c09-9838-b8abd4724564","resolution":{"observed_at":"2026-08-04T00:10:03.869335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:03.986449Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:03.986449Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:5d34e592bec14ce0f927953e3aebe58db04aa8d7da307ad24a1d7d2d7c746296","observation_id":"ad50cffe-bb10-4229-9558-b830b5be44ae","resolution":{"observed_at":"2026-08-04T00:10:03.986449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.106057Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.106057Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c4192bec73b08cd3540bfae5e137bcdcc3eb3e67f8e29b6eb70f138db68e0691","observation_id":"9f04a714-c3e4-4b15-9d6d-0826cfa7699e","resolution":{"observed_at":"2026-08-04T00:10:04.106057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.226810Z","title":"Watch and match: Supercharging imitation with regularized optimal transport","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.226810Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:64632b6dcfcc4e42eae71eea9352bd8410f4eede0fa546ce15e8b25bf293c230","observation_id":"22d2c949-0b2a-466a-b74b-c3dce749f5cd","resolution":{"observed_at":"2026-08-04T00:10:04.226810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.347887Z","title":"Learning an actionable discrete diffusion policy via large-scale actionless video pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.347887Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:48f4a949cb6113c320797e3c7a81987291f62dd3f788716eea698f4d35ca9e02","observation_id":"02a524c1-1e7c-4f6f-86a5-f1a3281e72aa","resolution":{"observed_at":"2026-08-04T00:10:04.347887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.504436Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.504436Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:74367e16eccc3b07dc74f10f58ad7e3d6fe5394969f21a501dc4aa6fbcccb082","observation_id":"e5204f64-f07c-4c4a-8364-7af94f545343","resolution":{"observed_at":"2026-08-04T00:10:04.504436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.615577Z","title":"Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.615577Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:3d379abf4bdccc9d8b12c88192f8c381e47dfbb7e0c477ff35a3ff22efcac9a0","observation_id":"71a112a8-1baf-4317-a256-a0edf5bfd8a1","resolution":{"observed_at":"2026-08-04T00:10:04.615577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.634366Z","title":"Sacson: Scalable autonomous control for social navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.634366Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c1b6304ffb54f5be7fbe7532a689cccd9868ff8fa4382500338735b6ed54507c","observation_id":"0db34190-8e2f-4bba-a705-4133b6d10262","resolution":{"observed_at":"2026-08-04T00:10:04.634366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-04T00:10:04.640373Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.640373Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:03612c193301a6ee6ced1c3378edc8fd03adfb5b0ddfacf687e9c70a139aa93d","observation_id":"05bd37ec-d88f-446b-8827-8ff991538b51","resolution":{"observed_at":"2026-08-04T00:10:04.640373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T00:10:04.706491Z","title":"_ 0.5 : a vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.706491Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:e5a258443521248ffed8e27a13ad2fa16cf72cb51fef02926a63153e978ea9de","observation_id":"8734c05c-1182-44e2-9a35-0fa48370b3ec","resolution":{"observed_at":"2026-08-04T00:10:04.706491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:04.841290Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.841290Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:5fd6584c51af6b41d1e22f17d0f9914594070bc28efd7afa9d40dea7ce897efa","observation_id":"e9458080-7f50-4add-b098-02cbd520b0e8","resolution":{"observed_at":"2026-08-04T00:10:04.841290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.004982Z","title":"Self-supervised deep reinforcement learning with generalized computation graphs for robot navigation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.004982Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:9bdd2080804ace013c89193f75a0dde843bfc6b375b2f16b73b4e5472befef4f","observation_id":"00ed9004-e513-4d93-b29e-16648d32ab3e","resolution":{"observed_at":"2026-08-04T00:10:05.004982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.127713Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.127713Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:50a44c9972df6159347f08547832eaa761b373cb7542117e3c51880683c913ea","observation_id":"b52e4d07-f359-490a-8300-c46515766fe6","resolution":{"observed_at":"2026-08-04T00:10:05.127713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-04T00:10:05.190823Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.190823Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:e93a9d5792351f9fb0fab5c0354cb48920d47923c40e6ff9126eb3ef900b75ce","observation_id":"9e94f795-4a51-431f-82cf-55bf1fb36c1d","resolution":{"observed_at":"2026-08-04T00:10:05.190823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.253373Z","title":"Pre-and post-contact policy decomposition for non-prehensile manipulation with zero-shot sim-to-real transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.253373Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:b5ca9891aa3e8e82cdcbdfdec301e69e4071b9c3aaa219d49010883e99f6cd00","observation_id":"62f3b0ac-7986-46f0-a73d-bd727356852f","resolution":{"observed_at":"2026-08-04T00:10:05.253373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.339723Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.339723Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:62be49e1d60dfe8b786d2617e0b773a7a58a9a21c20cfa58dfd0a805417ab9c2","observation_id":"6c41af8c-e6fc-443a-b0e9-155dd9149553","resolution":{"observed_at":"2026-08-04T00:10:05.339723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.470578Z","title":"Molmoact: Action reasoning models that can reason in space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.470578Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6fc892a7ca986cbc3ad6db3da19907a929eb73d3914dd3c87b1e753fa751d8b3","observation_id":"ca69b201-2f52-43d8-b5ba-17cc8db19fa2","resolution":{"observed_at":"2026-08-04T00:10:05.470578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.596613Z","title":"Behavior generation with latent actions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.596613Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:1954ed2504d093052ff2e851ba8b03e647f7da8ff62167a4ef1cf9a7457b9675","observation_id":"9140fdce-3540-421c-b45a-f6981d7864ed","resolution":{"observed_at":"2026-08-04T00:10:05.596613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.731876Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.731876Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:b3e9e04c46b56d9b98a82d982c904aae2ebe6e6b0d88dcad25a44e1de7d77758","observation_id":"afe9b4a1-4422-440b-bdb0-dd7bcc82efbc","resolution":{"observed_at":"2026-08-04T00:10:05.731876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03574","last_updated":"2025-06-04T04:45:24Z","snapshot_observed_at":"2026-08-17T19:53:02.416540Z","submitted_at":"2025-06-04T04:45:24Z","title":"SwitchVLA: Execution-Aware Task Switching for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03574","snapshot_observed_at":"2026-08-04T00:10:05.861028Z","title":"Switchvla: Execution-aware task switching for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.861028Z"},"links":{"cited_paper":"/paper/2506.03574","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:4f858cfad428a4ee7abb0b609c49e17666f70c318fb7bae2f382937754879754","observation_id":"5284e8cb-b687-4602-b185-1511a45cc04a","resolution":{"observed_at":"2026-08-04T00:10:05.861028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:05.978753Z","title":"Unified video action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:05.978753Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:bcc6850f6aacf42d6f83ecd79b826b84220c4c6163f530c5aafe57edfcfde723","observation_id":"6230c424-1809-4676-b3b9-9ae333c0935e","resolution":{"observed_at":"2026-08-04T00:10:05.978753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.132423Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.132423Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:ebab00ec5c8f227fb05e3b69506875185a552126ad8023954564bc1b6d6cfe1f","observation_id":"137ebdf4-0baa-4655-8017-cf376523f7cc","resolution":{"observed_at":"2026-08-04T00:10:06.132423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.265230Z","title":"Robot learning on the job: Human-in-the-loop autonomy and learning during deployment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.265230Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:cfa7bd886d0c4ca26a4cf44ddd6d91bb8985e20451162ba1639ffa71b0a4a934","observation_id":"5e597d47-7142-4a7d-94e4-2257f2e5c1d3","resolution":{"observed_at":"2026-08-04T00:10:06.265230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-04T00:10:06.438010Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.438010Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:1e8a831386ba10de809edbabc5f695c89ed8528c71b5e0a9c6a083640887e317","observation_id":"ac21cc6c-f1ec-4bc4-91b7-a4036582c6bc","resolution":{"observed_at":"2026-08-04T00:10:06.438010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.563735Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.563735Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:ce04e2d6c2a47d63f468bcdf593371f6820a4f1487b4228437001b1e626f448f","observation_id":"40decb04-7570-4192-a8eb-534ffa2bed53","resolution":{"observed_at":"2026-08-04T00:10:06.563735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.687191Z","title":"Mla: A multisensory language-action model for multimodal understanding and forecasting in robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.687191Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:70f7ea1dba7d6e0c81c7d30b392e8a36f72fa645efbcb8714a06a1f2f00f4798","observation_id":"e71ea9ee-6d4f-44da-9de7-5d36afc2ef8a","resolution":{"observed_at":"2026-08-04T00:10:06.687191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.855578Z","title":"Multistage cable routing through hierarchical imitation learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.855578Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:71a2f39f18c06fa142616c05c6e02a1cc7e4ace82a5c3c24731d3fbc1becf09a","observation_id":"c80e09eb-6a4c-470c-8664-5da4b8e13c5a","resolution":{"observed_at":"2026-08-04T00:10:06.855578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:06.995250Z","title":"Fmb: a functional manipulation benchmark for generalizable robotic learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:06.995250Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:7f0db75c84ce4d13b11f360ccb54505d819e73c4bf703dbb6d17b76de2faf331","observation_id":"02d60139-4fbd-4752-95f8-0662f9078d03","resolution":{"observed_at":"2026-08-04T00:10:06.995250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.112179Z","title":"Interactive language: Talking to robots in real time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.112179Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:1db366614e0dc8fba2de8f6b49a8307f8ddfdfbccd8c578a668a56424cfe9848","observation_id":"f18ec6b9-1c8c-424b-995e-3b587543e078","resolution":{"observed_at":"2026-08-04T00:10:07.112179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.238888Z","title":"Scaling robot supervision to hundreds of hours with roboturk: Robotic manipulation dataset through human reasoning and dexterity","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.238888Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:66bc04bcfab22822f3b3e42e1877c129803da354a721414d1992f0f1581bab8b","observation_id":"1cb58e84-063f-42dc-8106-37bca937be25","resolution":{"observed_at":"2026-08-04T00:10:07.238888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.363956Z","title":"Weblab xarm dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.363956Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c4733abda6e56ef160500da0380cce68f45faf636e4959e49c9b60e07cc6b659","observation_id":"46874027-59bb-467f-a1b4-8e3a0cee3259","resolution":{"observed_at":"2026-08-04T00:10:07.363956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.555878Z","title":"Grounding language with visual affordances over unstructured data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.555878Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c6e825d0a737d7652025a2ce0264c031798568983baea7a2348f7c43b7e9c6e6","observation_id":"d7c98143-8b0d-4e48-98ea-b5d444e02662","resolution":{"observed_at":"2026-08-04T00:10:07.555878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.671505Z","title":"Structured world models from human videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.671505Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6cdaa5274d2c0c875f4a5e5890a9361387c473fceba06b9e2d2ac3e9057290b2","observation_id":"031cffd1-bd7f-4110-85ed-da9abdbfe50c","resolution":{"observed_at":"2026-08-04T00:10:07.671505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.787613Z","title":"Quest: Self-supervised skill abstractions for learning continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.787613Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:69ac0ea369e6bad5db15a720d7549958330fb295c1b6b58af43e5ca4cb1b527e","observation_id":"1fe710df-da85-4924-ad5e-2f817067b96d","resolution":{"observed_at":"2026-08-04T00:10:07.787613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:07.914373Z","title":"Learning and retrieval from prior data for skill-based imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:07.914373Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:e26444e8e3b74c9b0764e335fde327fd32c23bf632d913339606587d02132346","observation_id":"e75dc6fd-c2ac-4cc1-86d2-a64d4bd57b81","resolution":{"observed_at":"2026-08-04T00:10:07.914373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.045871Z","title":"X-embodiment u-tokyo pr2 datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.045871Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:21809bcd21688f0961a3678deb35b1c737c1824bb2ac7a37864cb9d3ad1a6bc8","observation_id":"446a9553-f112-410e-88ea-df27b967d021","resolution":{"observed_at":"2026-08-04T00:10:08.045871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.209916Z","title":"Motion planning by learning the solution manifold in trajectory optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.209916Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:cfea4bf0e6f352aef5e91d7be4b295d998cb19b9551001624490804661e8bd90","observation_id":"7e547628-86e6-4881-8229-76a0cab33be7","resolution":{"observed_at":"2026-08-04T00:10:08.209916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.344640Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.344640Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:187296cd6d3fc55f6fefbc3f2e74c7b79eb6d51fba4bb4ff897030236b6e33d6","observation_id":"b537d90d-2f9c-4d83-89e1-3e4b24a93e4b","resolution":{"observed_at":"2026-08-04T00:10:08.344640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.533185Z","title":"A guided reinforcement learning approach using shared control templates for learning manipulation skills in the real world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.533185Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:8a1d177bbc0194fcd341ad83c5a4c1c5b548cd071da6ad4410bfa7d9c1d2bea7","observation_id":"721772f7-7d4c-42bb-9ab0-cd457790e4a8","resolution":{"observed_at":"2026-08-04T00:10:08.533185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.678685Z","title":"Guiding reinforcement learning with shared control templates","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.678685Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:7d79fe6f7b840ce81801f6fe9309577d70972241680d0fbe08b346a2f90ef662","observation_id":"26060803-b9b7-42e2-8a50-e309d76e1f15","resolution":{"observed_at":"2026-08-04T00:10:08.678685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:08.813052Z","title":"The surprising effectiveness of representation learning for visual imitation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:08.813052Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:4983b44bec6643ae9c7012de8584968c6ebf467f09e2161fd171e21028a62626","observation_id":"9e03fce4-c705-49dc-b7e1-2cdaee5b4a02","resolution":{"observed_at":"2026-08-04T00:10:08.813052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.024235Z","title":"Supramodal and cross-modal representations of working memory in higher-order cortex","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.024235Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:8f572c2547497a56896c5d90473e8307bd4b99ab16d5e4735fb9daa889a6d0e6","observation_id":"119428c6-2dad-4f44-9c28-c2f66df48c30","resolution":{"observed_at":"2026-08-04T00:10:09.024235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.208385Z","title":"Embodied artificial intelligence: Trends and challenges","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.208385Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:8454cd2a82e81c8e3f9a82898433f9978c6742f6f85e02d544457f4e9fa8b892","observation_id":"ccc4743e-107b-49ed-8f56-38945ae5f088","resolution":{"observed_at":"2026-08-04T00:10:09.208385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.340867Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.340867Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:ea375fac1d3c17f3418f4bd80d9849e2b5a997b23f2acb5793371966fb517e27","observation_id":"e9e23507-f215-4a1e-83d9-44547ac2375d","resolution":{"observed_at":"2026-08-04T00:10:09.340867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.512222Z","title":"Shared control templates for assistive robotics","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.512222Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:2856f5822c91e39bc2da68e2d9d05c8abc16bd3bfd05125a6fc5698b114961b1","observation_id":"32460c80-671d-4a3e-9b6f-32ce07776ea1","resolution":{"observed_at":"2026-08-04T00:10:09.512222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.571767Z","title":"Robot learning with sensorimotor pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.571767Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:86997f6e195ee663f1d43405c502e86bfa7c6fc4956a8cd48fe7fd7ec0a57d04","observation_id":"11d59140-da02-486c-bf2f-76d9bda11b0f","resolution":{"observed_at":"2026-08-04T00:10:09.571767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.673256Z","title":"Real-world robot learning with masked visual pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.673256Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:707633e21de92d8ddc8c1c7b3a29d6acc6a7d3f374cc98d3ee10fc9f0422d0f2","observation_id":"a3cb414f-ae7d-4197-aeaf-8681cc03e89f","resolution":{"observed_at":"2026-08-04T00:10:09.673256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.812719Z","title":"Latent plans for task-agnostic offline reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.812719Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6df92319c97c7a284b1e546213230832eda86ff7ef5da72dcd97aad9802a8aa6","observation_id":"594eeb26-8057-40e5-9503-30ac30c1bb75","resolution":{"observed_at":"2026-08-04T00:10:09.812719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.886517Z","title":"Multi-resolution sensing for real-time control with vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.886517Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:cfc3a0433db154e3548593d3574ac2f244b73597706b46391295aa0d4f316336","observation_id":"9fa28f33-5aa4-444c-9327-e4cda65d4a72","resolution":{"observed_at":"2026-08-04T00:10:09.886517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:09.973268Z","title":"Behavior transformers: Cloning k modes with one stone","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:09.973268Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:288137626a0f68cd2d7e570abdde74539d780c32003a007c5b7e00c42c4c3561","observation_id":"95f86456-c115-4c7d-afb7-54fbf8a6e623","resolution":{"observed_at":"2026-08-04T00:10:09.973268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-08-19T02:20:11.693473Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-08-04T00:10:10.046100Z","title":"On bringing robots home","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.046100Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:a29f53e440410a983c8da873c2b7ec9c06c092c003cca1e072fa18ce26b30cc0","observation_id":"04dc17a6-6f36-47c0-b98f-f66ada632dec","resolution":{"observed_at":"2026-08-04T00:10:10.046100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.105439Z","title":"Rapid exploration for open-world navigation with latent goal models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.105439Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:62896d2f58d449ee6a2381fc42eb8c7222d2ae1493b9542f8972caade809fe6f","observation_id":"a16ff2bf-65c2-4c28-8bdd-711f1dc82224","resolution":{"observed_at":"2026-08-04T00:10:10.105439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.181018Z","title":"Mutex: Learning unified policies from multimodal task specifications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.181018Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:dfa4a2e23a29ced653caa73bac7a9d11b5bd47891aac8e042ddbcf1a5e224809","observation_id":"9fc10689-a07e-48dd-9ad7-15260452aa0b","resolution":{"observed_at":"2026-08-04T00:10:10.181018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.253909Z","title":"Dense policy: Bidirectional autoregressive learning of actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.253909Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:c76c0a28eddb08ddd179e095785f771cc834b29738f1c45c0bc95eefd40c9045","observation_id":"355ce202-6c60-4ac3-931c-265353643d67","resolution":{"observed_at":"2026-08-04T00:10:10.253909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-04T00:10:10.403529Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.403529Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:14901f40b9d09471ca727df51e418222fa72917e43ce61c75f9fb7a4dc39a5fb","observation_id":"fb667ca3-93e9-4f27-a5e8-c68b890692eb","resolution":{"observed_at":"2026-08-04T00:10:10.403529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.493855Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.493855Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:60fd4ff26512d5521b4bcaf7cf26a016cd0b950de55ceea746bb4cc4fa30cf96","observation_id":"a36e2307-7873-4fc9-ae11-84f95fba208a","resolution":{"observed_at":"2026-08-04T00:10:10.493855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-04T00:10:10.557966Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.557966Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:b9abccd015b59fb85c55521a6e55825b01fe247492bb49629a286fc55a89ef3f","observation_id":"1337f9f6-4bcb-46d6-aa06-d2a62a2b153b","resolution":{"observed_at":"2026-08-04T00:10:10.557966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.634298Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.634298Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:2194149e5bcab0cc9cab98c2d9dfcda33eb21dfb857a87aa6d80c45638254e6a","observation_id":"9585b2ab-8201-4936-9b02-bc02407b0284","resolution":{"observed_at":"2026-08-04T00:10:10.634298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.710015Z","title":"o rn Vogel, Annette Hagengruber, Maged Iskandar, Gabriel Quere, Ulrike Leipscher, Samuel Bustamante, Alexander Dietrich, Hannes H \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.710015Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:857638aa9632fa35166dbaf2e5edd456e9e581db22a9105958599afb7dcbe594","observation_id":"8c37cfe8-27a7-4995-a3e1-cea88676ab5a","resolution":{"observed_at":"2026-08-04T00:10:10.710015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.808096Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.808096Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:e93f6174bc9155d60a9a5b903dcd0dddd995b9ab314de120eb0d838779ecede7","observation_id":"8c5c6a59-3c93-430c-8b80-aa370fc9cf32","resolution":{"observed_at":"2026-08-04T00:10:10.808096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:10.909954Z","title":"Scaling proprioceptive-visual learning with heterogeneous pre-trained transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:10.909954Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:89281f557d8b2becd1add994a579e247ac642025bcdee66c60bf547477db0baa","observation_id":"11e48d89-d86b-4fcf-855e-d8e723f98961","resolution":{"observed_at":"2026-08-04T00:10:10.909954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T00:10:11.033236Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.033236Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:92efa6fc955f4b09f775f82891c10fb195d3d5590bc67d032dde9cd6a4cea1b2","observation_id":"218c11ce-91c9-447b-a012-089f35b0b18c","resolution":{"observed_at":"2026-08-04T00:10:11.033236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.139743Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.139743Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:99981c5de038c792f0d9cac11b8dca2c6b5456ddbe01f6605493a05f784db144","observation_id":"95c611ed-4a5f-4560-a3b5-845630f0e112","resolution":{"observed_at":"2026-08-04T00:10:11.139743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.246567Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.246567Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:057a3b416f798317e17b65f1017b0e60df20d1bba1d6db84a08f5dbd17f148e1","observation_id":"6d67c732-7a4a-4e6f-939c-f55d671d6799","resolution":{"observed_at":"2026-08-04T00:10:11.246567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.372607Z","title":"Diffusionvla: Scaling robot foundation models via unified diffusion and autoregression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.372607Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:a8955639bd02460ee5b748813339f2e9e314567261406670afb0eaa805bce1b1","observation_id":"d73ce338-90dd-444f-aff9-77fc37c0a5ad","resolution":{"observed_at":"2026-08-04T00:10:11.372607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.473471Z","title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.473471Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:91dbc0cd2f5154554f6b6ab613b9768ea90d79c9e5b7db86cc9bba4e409747ea","observation_id":"759101fa-7f2b-426a-988d-43d1bcc6909a","resolution":{"observed_at":"2026-08-04T00:10:11.473471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.559465Z","title":"Discrete policy: Learning disentangled action space for multi-task robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.559465Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:07d0576aa44046d8b33c3d24b5573b8770a5077058bf7f89e9021bd96c0c9155","observation_id":"e9fee724-7114-45e7-ae48-644538fc7b9f","resolution":{"observed_at":"2026-08-04T00:10:11.559465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.671428Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.671428Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:5e83b98ae5722ddb11d84dc28f82b54c90db4216267aec120056a37c8b4346ac","observation_id":"dfa98af1-187f-41ee-8774-769f5e8ed77a","resolution":{"observed_at":"2026-08-04T00:10:11.671428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16925","last_updated":"2025-04-23T17:53:34Z","snapshot_observed_at":"2026-08-16T10:50:11.650642Z","submitted_at":"2025-04-23T17:53:34Z","title":"Latent Diffusion Planning for Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16925","snapshot_observed_at":"2026-08-04T00:10:11.746390Z","title":"Latent diffusion planning for imitation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.746390Z"},"links":{"cited_paper":"/paper/2504.16925","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:4c182195b3a67b00187af9807f2f149a6b7f857cd85e72d9c005927ba08c39de","observation_id":"d933d7bb-30bb-49b3-b79c-50967c8e9e05","resolution":{"observed_at":"2026-08-04T00:10:11.746390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.861722Z","title":"ucsd kitchens Dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.861722Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:4504f6213e4c466375975f9e8edd68ba54d0f98b10c7100bbc6bd5a68ead91ba","observation_id":"142850b9-fe0d-4e56-a3cd-16e5ed750074","resolution":{"observed_at":"2026-08-04T00:10:11.861722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:11.924637Z","title":"Instructvla: Vision-language-action instruction tuning from understanding to manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:11.924637Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:6cc07b49c05937b908a3d7985a24fda735f159293fff8f9d8fb0c83872fc19a3","observation_id":"b261577e-4f36-4937-9711-42cb1623578c","resolution":{"observed_at":"2026-08-04T00:10:11.924637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:12.041655Z","title":"Latent action pretraining from videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:12.041655Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:4da6cdff2a04ec3dd101db4ba2d0bbe37d35c8686a21b0e2cf0792933610674c","observation_id":"3ef1a4a8-df81-4eb6-bc88-5266618f1ba3","resolution":{"observed_at":"2026-08-04T00:10:12.041655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08548","last_updated":"2026-04-05T00:57:47Z","snapshot_observed_at":"2026-07-06T21:23:14.666121Z","submitted_at":"2025-05-13T13:20:46Z","title":"From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08548","snapshot_observed_at":"2026-08-04T00:10:12.136184Z","title":"From seeing to doing: Bridging reasoning and decision for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:12.136184Z"},"links":{"cited_paper":"/paper/2505.08548","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:008aaf63a87d3cb445f1a8aefcdf23fa5cf42b845aa41b1c659608206c715cba","observation_id":"7e37b523-ce46-4a6f-ba56-44be7cc1bb49","resolution":{"observed_at":"2026-08-04T00:10:12.136184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:10:12.234233Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:12.234233Z"},"links":{"citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:448018113a770eaab55b3483de3ccecb7f252f7bfb65da3f5dea3e2145cad9f3","observation_id":"5e4fcab4-40d5-4179-98f0-68524b9f79c6","resolution":{"observed_at":"2026-08-04T00:10:12.234233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T19:09:23.113990Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":119},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 119 outbound references and 8 inbound Pith citation observations for arXiv:2511.02776."}