{"as_of":"2026-08-16T07:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c4966c242e6208f94691a50603fbcf0f6863eeb15cc3f990dcd7abc971a54fd","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:04:11.999325Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:17:24.951028Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T14:52:36.313517Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-07-30T12:43:44.703075Z","title":"Xiaomi-Robotics-1: Scaling vision-language-action models with over 100K hours of real-world trajectories","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23782","last_updated":"2026-07-26T17:58:47Z","snapshot_observed_at":"2026-08-15T03:59:39.322668Z","submitted_at":"2026-07-26T17:58:47Z","title":"$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T12:43:44.703075Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2607.23782"},"observation_digest":"sha256:5453334889ece2692509f82ed71ab1372ac9179facf8e3e9ac8869ce968fd916","observation_id":"a0aac408-4465-4ad5-a4a1-9ef4b06df91e","resolution":{"observed_at":"2026-07-30T12:43:44.703075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-07-30T12:42:18.603531Z","title":"Xiaomi-robotics-1: Scaling vision-language-action models with over 100k hours of real-world trajectories","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23783","last_updated":"2026-07-26T17:58:53Z","snapshot_observed_at":"2026-08-13T03:00:00.482734Z","submitted_at":"2026-07-26T17:58:53Z","title":"$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-30T12:42:18.603531Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2607.23783"},"observation_digest":"sha256:03672128bb52fd610dba8a06a2d7481af5864ba6d7ae11f827ee4659952e3f28","observation_id":"4807410a-d1a0-4b83-b8e9-f36242eb9ed9","resolution":{"observed_at":"2026-07-30T12:42:18.603531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-15T15:17:24.951028Z","title":"arXiv preprint arXiv:2607.15330 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01066","last_updated":"2026-08-02T08:06:20Z","snapshot_observed_at":"2026-08-15T17:23:06.415432Z","submitted_at":"2026-08-02T08:06:20Z","title":"OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:17:24.951028Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.01066"},"observation_digest":"sha256:fe7f3bdef0e6429e8fc717c1bf5b27acad0ff9846e7e57d20bd343adf2281ef0","observation_id":"93313b23-be72-440b-899f-91968f484b7d","resolution":{"observed_at":"2026-08-15T15:17:24.951028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":"2607.15330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-05T14:52:36.313517Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","venue":"cs.RO","work_id":"9145c54c-7ea5-4966-aa4f-420966ceffa2","year":2026},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-15T14:45:21.386253Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.371109Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:d17b50c4f73d4f4c493f350111b65dccd8210fd6b948aa7d2bfce1a961de252c","observation_id":"26a539bc-f8cc-403b-84fe-ecb4a2e103a7","resolution":{"observed_at":"2026-08-05T14:52:36.316445Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-15T14:52:22.178974Z","title":"arXiv preprint arXiv:2607.15330 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-15T14:45:21.386253Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:52:22.178974Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:be12b39301754b1abb0891f9293ee82d7718b5346194582556ac56c1246981f7","observation_id":"35032d6b-ae97-4ea2-bd59-3487dbbc969a","resolution":{"observed_at":"2026-08-15T14:52:22.178974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-11T04:54:24.134310Z","title":"Xiaomi-robotics-1: Scaling vision-language- action models with over 100k hours of real-world trajectories,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-15T20:47:23.678604Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:24.134310Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:c6f2c25073c6e799f0742879fe0222d3f9b684bd0ef1f5b9b1aa483c5d4a0a83","observation_id":"ba3a3086-a292-43c5-88be-b9a14fafaf44","resolution":{"observed_at":"2026-08-11T04:54:24.134310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.15330","snapshot_observed_at":"2026-08-14T04:17:47.516551Z","title":"Xiaomi-robotics-1: Scaling vision-language- action models with over 100k hours of real-world trajectories,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-15T20:47:23.678604Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:47.516551Z"},"links":{"cited_paper":"/paper/2607.15330","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:ed06f51f38a9bf3f32fe39b14ad59f70f2eb53dd310388605e0a07fb8e1b73e1","observation_id":"f11a420e-44e5-456c-94a5-f8161ea423b4","resolution":{"observed_at":"2026-08-14T04:17:47.516551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.15330/citation-record","integrity":"/paper/2607.15330/integrity","json":"/paper/2607.15330/citation-record.json","paper":"/paper/2607.15330"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T00:03:59.117791Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.117791Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a723404ca2c20d8b1559e528e0ba4d343657c997872e0d3867978ead7b23a369","observation_id":"11bb3548-07d5-4973-9d2d-123330fe7fc0","resolution":{"observed_at":"2026-08-02T00:03:59.117791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-02T00:03:59.225496Z","title":"Cosmos 3: Omnimodal world models for physical ai.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.225496Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1129e03b08572e7bfc516da14ae1127ba58a42fbd92d418f026a6d0877adb742","observation_id":"605d0126-85e7-43ba-99c7-d5c89b8e032a","resolution":{"observed_at":"2026-08-02T00:03:59.225496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:03:59.355811Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.355811Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:118638258ae8493d8791526558f301f1703a87b20f105cd9eb184342ce511522","observation_id":"7fdce7e2-72af-4e1a-9e39-af8369972acb","resolution":{"observed_at":"2026-08-02T00:03:59.355811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T00:03:59.504446Z","title":"arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.504446Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a335aaef1bbc5cc0bbd775b0340db7209371c80bd1936d16f8a3d1ea49b0a299","observation_id":"9a52982e-ab77-4977-b06b-2cd22399abde","resolution":{"observed_at":"2026-08-02T00:03:59.504446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T00:03:59.709806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.709806Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:11db8671ff1dfd442ef7893ad0d98d0602b45a53226174bbfac947164ad9c746","observation_id":"9a11f851-67fc-4cb7-9c2d-616f550a2ab6","resolution":{"observed_at":"2026-08-02T00:03:59.709806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T00:03:59.879682Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.879682Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1d4c92680abc82d81e0850df8dc39a30d12045d61261d52618dd1e703b112f1b","observation_id":"a06ac054-a993-41e9-8ea8-a60638044087","resolution":{"observed_at":"2026-08-02T00:03:59.879682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:03:59.955958Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:03:59.955958Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bdae1888518b54f92f7bb2758bf039e6eaf738c8fcb0735b0d734b6b7dcb7175","observation_id":"3955dccf-29e0-4ce0-be99-4b7659549687","resolution":{"observed_at":"2026-08-02T00:03:59.955958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:00.063560Z","title":"Xiaomi-robotics-0: An open-sourced vision-language-action model with real-time execution.arXiv preprint arXiv:2602.12684, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.063560Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3a753ead63874cc524fef76c106fc5b34bcf869fefb08e80d509d96a54530cce","observation_id":"94428611-91ed-4eab-9408-eac62345b40c","resolution":{"observed_at":"2026-08-02T00:04:00.063560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-02T00:04:00.143342Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.143342Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:3a6bac00e6b06baade126920d18ad13a72f6f6e44fbece10f2ca9348b13d7cea","observation_id":"de8021b7-cd0e-472e-bb1b-de885e8a0e0b","resolution":{"observed_at":"2026-08-02T00:04:00.143342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-08-02T00:04:00.224041Z","title":"Gr-3 technical report.arXiv preprint arXiv:2507.15493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.224041Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:e275aaa385585f62a6bb5dbb8968b58dce7264adfa7081e36c109d7a5d7a8ac5","observation_id":"5aa6b5db-92b7-4149-8ded-902f997da321","resolution":{"observed_at":"2026-08-02T00:04:00.224041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-08-13T20:16:02.364775Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00678","snapshot_observed_at":"2026-08-02T00:04:00.292824Z","title":"Abot-m0.5: Unified mobility-and-manipulation world action model.arXiv preprint arXiv:2607.00678, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.292824Z"},"links":{"cited_paper":"/paper/2607.00678","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:51a64e6d5e4094b645b17fafcdb5bdb0c965e9afd9e67e464a8907c69013b8c3","observation_id":"01b1a5b9-9e36-45b9-900f-ca28e94475f6","resolution":{"observed_at":"2026-08-02T00:04:00.292824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04434","last_updated":"2026-07-05T17:58:02Z","snapshot_observed_at":"2026-08-13T01:18:42.931884Z","submitted_at":"2026-07-05T17:58:02Z","title":"RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04434","snapshot_observed_at":"2026-08-02T00:04:00.390410Z","title":"Robodojo: A unified sim-and-real benchmark for comprehensive evaluation of generalist robot manipulation policies, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.390410Z"},"links":{"cited_paper":"/paper/2607.04434","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0a572ee7e713a86ab74031bd33a4287d89c11c88403ec558a2c0285c15a12282","observation_id":"a91aa2f1-0c5a-43bc-9af8-de7a746a5b36","resolution":{"observed_at":"2026-08-02T00:04:00.390410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08243","last_updated":"2025-05-17T21:04:22Z","snapshot_observed_at":"2026-08-15T21:57:36.317205Z","submitted_at":"2025-05-13T05:35:00Z","title":"Training Strategies for Efficient Embodied Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08243","snapshot_observed_at":"2026-08-02T00:04:00.468016Z","title":"Training strategies for efficient embodied reasoning.arXiv preprint arXiv:2505.08243, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.468016Z"},"links":{"cited_paper":"/paper/2505.08243","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1f0ca95363b599fcf6c7422cb7ea9d923d42d92eca9c56c383de929e2d59db46","observation_id":"400c7946-e052-4d43-89aa-478c300bdf5e","resolution":{"observed_at":"2026-08-02T00:04:00.468016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-15T00:34:34.553544Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-02T00:04:00.537030Z","title":"Pali: A jointly-scaled multilingual language-image model.arXiv preprint arXiv:2209.06794, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.537030Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:cf6276754af1a207d56fc67f023c46a3a74be6e76994f195f13aa0a212a12848","observation_id":"a71c2dc8-c7fa-425f-ba20-905e005dd208","resolution":{"observed_at":"2026-08-02T00:04:00.537030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22136","last_updated":"2026-06-23T09:28:18Z","snapshot_observed_at":"2026-08-15T20:23:49.425816Z","submitted_at":"2026-06-20T16:31:40Z","title":"Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22136","snapshot_observed_at":"2026-08-02T00:04:00.633844Z","title":"Wh0: Generative world models as scalable sources of egocentric human hand manipulation data.arXiv preprint arXiv:2606.22136, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.633844Z"},"links":{"cited_paper":"/paper/2606.22136","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b94b3bd9ff4b91adf39b43262d8caac2c8aef2882e970bcb7a4e814f33210560","observation_id":"b72ce5ab-7741-470f-975e-0e8edfac7f1c","resolution":{"observed_at":"2026-08-02T00:04:00.633844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:00.778343Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:00.778343Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:81453eb27738670bdafffeba596adcca4ce34fdf54cacda3d48d2901886d9081","observation_id":"d1e7ee89-44c8-4c46-a6e3-27c88216a173","resolution":{"observed_at":"2026-08-02T00:04:00.778343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-08-15T01:06:47.729130Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-02T00:04:01.022781Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots.arXiv preprint arXiv:2402.10329, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.022781Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4d75b536ac55ccea7b819dfcb1a0192517ddf6a9123ab0879ccde7a948a783f5","observation_id":"88f2b9c8-6bb2-4ea0-868c-c7995c5825d6","resolution":{"observed_at":"2026-08-02T00:04:01.022781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:01.112802Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.112802Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6f10dd8db75bea727c9a169673347a42d2506eabd7e4c97f4b373cdc12e37ca9","observation_id":"27d05d05-5854-4299-a7f5-2f22d7fcd3a8","resolution":{"observed_at":"2026-08-02T00:04:01.112802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-08-02T00:04:01.196872Z","title":"Molmoact2: Action reasoning models for real-world deployment.arXiv preprint arXiv:2605.02881, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.196872Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:8f78b9e07ec8654c1ce48ec971e1ff2db4c1ab3777f8dde4ce5509181cb952f1","observation_id":"b0517684-f747-44da-b962-a8232099456e","resolution":{"observed_at":"2026-08-02T00:04:01.196872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:01.316861Z","title":"Galaxea g0.5 technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.316861Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b9ece3772334a6351761f1505f0768a6991b719be8be49effbaa2319782b2801","observation_id":"35698623-2e34-4d0e-9955-6d5a6314550b","resolution":{"observed_at":"2026-08-02T00:04:01.316861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26694","snapshot_observed_at":"2026-08-02T00:04:01.407672Z","title":"Unified 4d world action modeling from video priors with asynchronous denoising.arXiv preprint arXiv:2604.26694, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.407672Z"},"links":{"cited_paper":"/paper/2604.26694","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:13ed31bc7d81732c2a0ff9cb20da78e4b7418bcefaf38e247712d4e4832e5b2d","observation_id":"3e06fcd5-8fcf-4926-83b2-6d7765aa8b22","resolution":{"observed_at":"2026-08-02T00:04:01.407672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T00:04:01.478584Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.478584Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a758245b9cdc555d946b6cdbc959dabeea6a9085e2b4d4b5ab6ec7f61bc26c27","observation_id":"52eb2fbd-0f66-4138-98fb-9e64b0d22fa6","resolution":{"observed_at":"2026-08-02T00:04:01.478584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-02T00:04:01.537382Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.537382Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:218ad130babb0cd1067b0053da7079d4b356ea3f4a96f1a147cae0d2f2eb0c04","observation_id":"7378915d-97d3-498f-b507-32b18b84e27d","resolution":{"observed_at":"2026-08-02T00:04:01.537382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-02T00:04:01.650486Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.650486Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:49e3aef867db6eb8feed662714ba1ce6d5e2111847e19e8e75acac809d1d70b1","observation_id":"58fa531a-0a35-45ce-b0ba-8f1298fe14ec","resolution":{"observed_at":"2026-08-02T00:04:01.650486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T00:04:01.761066Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.761066Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9addf59ac345ea615d22c0889568a68429f9b02a243a1c79a0769a05590620b3","observation_id":"a937599b-d17a-48bd-9544-644636988650","resolution":{"observed_at":"2026-08-02T00:04:01.761066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-14T02:52:34.768729Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-08-02T00:04:01.858008Z","title":"Galaxea open-world dataset and g0 dual-system vla model.arXiv preprint arXiv:2509.00576, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.858008Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4a5c73d88b8a315287b2957eecbd09fb8df22b8d506a8e4804d35447cbf58262","observation_id":"32c109cc-2363-4441-9bc7-5cf88537232a","resolution":{"observed_at":"2026-08-02T00:04:01.858008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T00:04:01.934636Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:01.934636Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:37a45c90f0936ef8049de7fa59b1ae82204e4efd688b08f30632b9c47c9e9614","observation_id":"ce86acd5-91d1-4d46-9ab4-d3612851450b","resolution":{"observed_at":"2026-08-02T00:04:01.934636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-02T00:04:02.006714Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.006714Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:fbb1685326603380f5c4aff9bb57b524e26a5fe64c21867b48a9340812a8c7e0","observation_id":"ec8145c4-eb6d-4480-b9c1-d94e833b9b27","resolution":{"observed_at":"2026-08-02T00:04:02.006714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03269","last_updated":"2026-05-06T14:24:04Z","snapshot_observed_at":"2026-07-06T23:16:10.769968Z","submitted_at":"2026-05-05T01:40:15Z","title":"RLDX-1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03269","snapshot_observed_at":"2026-08-02T00:04:02.063691Z","title":"Rldx-1 technical report.arXiv preprint arXiv:2605.03269, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.063691Z"},"links":{"cited_paper":"/paper/2605.03269","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:68fc60a61b8f35eaa9fa66fedaf7e94ce426b266409d4b42da427e32dbad6d74","observation_id":"81b2b861-086a-422c-af9b-769064d5ff03","resolution":{"observed_at":"2026-08-02T00:04:02.063691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T00:04:02.186263Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.186263Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:063ff8fd951523fccd268e6880531c714c7377e2e4063729ec033cf3bb105a60","observation_id":"4e68fd07-b6ec-4942-850c-7059404b9e2a","resolution":{"observed_at":"2026-08-02T00:04:02.186263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T00:04:02.287670Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.287670Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4c40050c5e93bf09290d25ed5fc1e5876c0ac6a7ca16a2c68725fa117bfcc9f0","observation_id":"af3d625c-3303-4af3-a624-b3297f6c60d1","resolution":{"observed_at":"2026-08-02T00:04:02.287670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-13T22:25:02.123367Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-02T00:04:02.398602Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.398602Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ac2f6c9ec8ef7547027b88c2f1a1517565de7dec568f0815208602c161cf10a3","observation_id":"2464ccfb-0554-4edd-90d8-cd32a7430533","resolution":{"observed_at":"2026-08-02T00:04:02.398602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:02.581358Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.581358Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bff793430d8b3b327e2b6db6c7ac891430e9bc33b0c5a3260d6c008fb006dbd4","observation_id":"85a13f53-493d-4e77-a9b1-3d46e3270576","resolution":{"observed_at":"2026-08-02T00:04:02.581358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T00:04:02.790902Z","title":"Molmoact: Action reasoning models that can reason in space.arXiv preprint arXiv:2508.07917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.790902Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:567333c90c1f9ff42879df6f36d465df3adcf0fc439822c8dab534d79c64bef7","observation_id":"72bd1631-89b2-4849-8c71-2a2b582af427","resolution":{"observed_at":"2026-08-02T00:04:02.790902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:02.943489Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model.arXiv preprint arXiv:2510.12276, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:02.943489Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:eaaa2e5a8961d774df460a5b678952fde16859974c65e0fe1516262d1df34616","observation_id":"d545d019-ecb6-415e-94db-c9ccff4e2e03","resolution":{"observed_at":"2026-08-02T00:04:02.943489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-02T00:04:03.115676Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.115676Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:19678c3de256d848c70dc2a5e02543697cc92bf1a9398dec4f3d413c01bad5a9","observation_id":"3804a4ed-233c-4b10-9cda-bec18a3197da","resolution":{"observed_at":"2026-08-02T00:04:03.115676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.322392Z","title":"Gr-mg: Leveraging partially- annotated data via multi-modal goal-conditioned policy.IEEE Robotics and Automation Letters, 10(2):1912–1919, 2025","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.322392Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f9ee9f5e12aeb3983e7b179488dddfb4065c1cae6ab3fb4797b4e95b1b61a018","observation_id":"c8149403-1b63-49f5-ad55-3c20cf0b6c71","resolution":{"observed_at":"2026-08-02T00:04:03.322392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.480239Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.480239Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:31d68d9bb22d568446eaa5deecd11ef8f187ee3d1a63c6494deaafa918c5c58c","observation_id":"9e33eb75-6072-430c-a5a5-df4184f466bc","resolution":{"observed_at":"2026-08-02T00:04:03.480239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03181","last_updated":"2026-08-13T16:47:10Z","snapshot_observed_at":"2026-08-16T06:11:18.527555Z","submitted_at":"2026-04-03T16:57:06Z","title":"SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03181","snapshot_observed_at":"2026-08-02T00:04:03.686284Z","title":"Multi-view video diffusion policy: A 3d spatio-temporal-aware video action model.arXiv preprint arXiv:2604.03181, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.686284Z"},"links":{"cited_paper":"/paper/2604.03181","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:460000f6114cfc58a0ca291ef560549536cf0d178363c552f87f4031eb775a17","observation_id":"da8e04ef-f768-449a-8b04-c065b67a56a0","resolution":{"observed_at":"2026-08-02T00:04:03.686284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:03.836866Z","title":"Scalable vision-language-action model pretraining for robotic manipulation with real-life human activity videos.arXiv preprint arXiv:2510.21571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.836866Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:66ca60b7457fd49058db9cbe2396b67c1ca820940d4297d3a374f01896700960","observation_id":"c26cbcde-3016-4a5e-85ad-d0bc8ccd912b","resolution":{"observed_at":"2026-08-02T00:04:03.836866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-02T00:04:03.991822Z","title":"Unified video action model.arXiv preprint arXiv:2503.00200, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:03.991822Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:96cd799879143bc74532d1d3677c526735e664b0ac9da61d125bbd14dcb0a09d","observation_id":"9275040c-f375-47c1-bde7-ebf1aaacd914","resolution":{"observed_at":"2026-08-02T00:04:03.991822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-02T00:04:04.138071Z","title":"Towards generalist robot policies: What matters in building vision-language-action models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.138071Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:24135df117a7dd9247b2e19f57c77e7a0e3c4f0dca1fcbdf578170ac1dbb88cf","observation_id":"9dc5e2df-7a63-44a3-9226-42faad756336","resolution":{"observed_at":"2026-08-02T00:04:04.138071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-12T23:35:51.734823Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-08-02T00:04:04.293371Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation.arXiv preprint arXiv:2406.16862, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.293371Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:21ef329e0e021e0ed13eb6f0502b20b56c0d345a1131bc318de95b0461084dbe","observation_id":"88dc05cd-c5fc-4fa2-9d21-a6d5acb375d6","resolution":{"observed_at":"2026-08-02T00:04:04.293371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-02T00:04:04.419047Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models.arXiv preprint arXiv:2411.04996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.419047Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2a607ddf7f70b671788e3c0c56df481cfd0af050b81a492a9c220efdc1c28d9f","observation_id":"27963403-1a86-48a4-9baf-38ec2c91e2b7","resolution":{"observed_at":"2026-08-02T00:04:04.419047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T00:04:04.489716Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.489716Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:14f0852e7451b8bb2686bab6192be8b6f83bbb411969b43354cac77acf45a506","observation_id":"65f7c628-ed11-4a50-ba6c-8172d8fdea8f","resolution":{"observed_at":"2026-08-02T00:04:04.489716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06156","last_updated":"2025-09-01T04:21:32Z","snapshot_observed_at":"2026-08-11T16:33:01.400768Z","submitted_at":"2025-04-08T15:51:18Z","title":"ViTaMIn: Learning Contact-Rich Tasks Through Robot-Free Visuo-Tactile Manipulation Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06156","snapshot_observed_at":"2026-08-02T00:04:04.559029Z","title":"Vitamin: Learning contact-rich tasks through robot-free visuo-tactile manipulation interface.arXiv preprint arXiv:2504.06156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.559029Z"},"links":{"cited_paper":"/paper/2504.06156","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2caad478765e3f88dd0e5006e0b69b9f2b1b83fedf9bbadad661ba852acabd09","observation_id":"d605c88b-0a22-41c2-9d22-5eec95c27e62","resolution":{"observed_at":"2026-08-02T00:04:04.559029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:04.695444Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.695444Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:40a44b87c39eef9de0708d1803c6f3661a9e4983c7514e4a33f2f23bf745779e","observation_id":"ddf314b0-bdca-44ef-99b7-2eac4c1d3ad9","resolution":{"observed_at":"2026-08-02T00:04:04.695444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:04.891865Z","title":"Rdt2: Exploring the scaling limit of umi data towards zero-shot cross-embodiment generalization.arXiv preprint arXiv:2602.03310, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.891865Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6309badede549aaf7dd5b480c50263b65395b759faad33fbb8f16f9a705960a2","observation_id":"d0da9d55-b206-4473-bd3b-509c8dabff88","resolution":{"observed_at":"2026-08-02T00:04:04.891865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-02T00:04:04.963758Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.arXiv preprint arXiv:2209.03003, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:04.963758Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:8e9a87528fc007a638bf7d36b06a983899cd59dfa23572274dd3a7c115dc69b1","observation_id":"2ae21ebe-a60d-4db7-aeda-c7554c421de5","resolution":{"observed_at":"2026-08-02T00:04:04.963758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15597","snapshot_observed_at":"2026-08-02T00:04:05.119524Z","title":"Being-h0: vision-language-action pretraining from large-scale human videos.arXiv preprint arXiv:2507.15597, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.119524Z"},"links":{"cited_paper":"/paper/2507.15597","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:688ac3cddd05f96c818e971a7801bd64adee2c5b5e3d52eda472dfc569c6b795","observation_id":"5efc2714-0f33-4327-81ef-d8033792d4ec","resolution":{"observed_at":"2026-08-02T00:04:05.119524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.287415Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.arXiv preprint arXiv:2603.10448, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.287415Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:e0fe83e52091db537eaba55e9371270e41cfce49ce3fee408e28a2c8439a167f","observation_id":"d9301cf6-8c57-4712-b8bb-df456ef42c4e","resolution":{"observed_at":"2026-08-02T00:04:05.287415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-08-16T06:47:25.140028Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-02T00:04:05.391932Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots.arXiv preprint arXiv:2406.02523, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.391932Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:084d37a4b112d2ac7a9bf43114269f26b67737ce44685b054a6ddca843f808b5","observation_id":"4fbd697c-610d-4dc3-95ea-c91b01898eb0","resolution":{"observed_at":"2026-08-02T00:04:05.391932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.541501Z","title":"Robocasa365: A large-scale simulation framework for training and benchmarking generalist robots.arXiv preprint arXiv:2603.04356, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.541501Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:df51f063d084e7f3b58ec986d2b4769957eb936e8f2153badf495fc332a60352","observation_id":"b1b7906b-00a3-40b6-9ede-df5d6eabe242","resolution":{"observed_at":"2026-08-02T00:04:05.541501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.652775Z","title":"GR00T N1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.652775Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b515f5057ffdea71e7f7ce33dd3ae7db31e616a697c992662eb8e29674d7ce1c","observation_id":"19d1673e-9e66-4725-88a3-376012e51931","resolution":{"observed_at":"2026-08-02T00:04:05.652775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:05.791080Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.791080Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:58c265fa668c1d69bddf838c3cf831d023d32f7bb6c06a3127da9eb4386a1242","observation_id":"4f1eb89b-d28b-4701-bb23-c184692f9990","resolution":{"observed_at":"2026-08-02T00:04:05.791080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-08-02T00:04:05.928505Z","title":"mimic-video: Video-action models for generalizable robot control beyond vlas.arXiv preprint arXiv:2512.15692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:05.928505Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:28150f820c5128cc193c0fd16148198c99f3c8a59736d4129e67d108594c82b3","observation_id":"adfdcd9a-76f3-4940-aaa1-6db85fa6e05b","resolution":{"observed_at":"2026-08-02T00:04:05.928505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:06.037779Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.037779Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:bce2cf46f768c76fe33593e05a0d0465c6246ebb8e3aa95c64eff54dadc19f94","observation_id":"3821579b-4c34-4dcd-b8ec-3a79210a916b","resolution":{"observed_at":"2026-08-02T00:04:06.037779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T00:04:06.230214Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.230214Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:85ce02c9512278c3aef6479091c34fdadc6c36b2a3e36d74fd7a98c955fbbf8b","observation_id":"b5b906f0-94ed-410b-b654-8cbc2c256d97","resolution":{"observed_at":"2026-08-02T00:04:06.230214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:06.351663Z","title":"Coordinated humanoid manipulation with choice policies.arXiv preprint arXiv:2512.25072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.351663Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6c7cbaf9d00d4e8e0fa027bf14162d6523a58bcf5db62682db0847691808fb76","observation_id":"be4dad51-fdcd-4991-89a6-6f2bf3f0efbf","resolution":{"observed_at":"2026-08-02T00:04:06.351663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T00:04:06.479669Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model.arXiv preprint arXiv:2501.15830, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.479669Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:40cd12c79a3c0be4f742bef0efb175a6fa9d67c8e3f5da58245d37d3df2a08ad","observation_id":"c7ec629f-4625-414a-9ba2-4c4780ea2f4a","resolution":{"observed_at":"2026-08-02T00:04:06.479669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03784","last_updated":"2026-06-03T08:29:49Z","snapshot_observed_at":"2026-08-13T10:40:55.654755Z","submitted_at":"2026-06-02T15:37:59Z","title":"Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03784","snapshot_observed_at":"2026-08-02T00:04:06.613967Z","title":"Revisiting embodied chain-of-thought for generalizable robot manipulation.arXiv preprint arXiv:2606.03784, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.613967Z"},"links":{"cited_paper":"/paper/2606.03784","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:0a363a071ecbe31d69420c05a6ccd5595499402403011a4e2b615d44f0bc9618","observation_id":"c3ce2c8f-bff1-4071-9e9f-8baf8f6cca98","resolution":{"observed_at":"2026-08-02T00:04:06.613967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T00:04:06.798973Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.798973Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ed3a5365bc9aad08d4e36ff9acfe5e652513807b78c9deba4df6e077643e167e","observation_id":"526ff66a-1512-4c10-b841-31128f6c2545","resolution":{"observed_at":"2026-08-02T00:04:06.798973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T00:04:06.931913Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:06.931913Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:059ed24b30981eb3927792f681c50acf22a817570cb1977415ebc569de56c86a","observation_id":"73fbf405-d6d4-4024-bcbc-18c48348837f","resolution":{"observed_at":"2026-08-02T00:04:06.931913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T00:04:07.086788Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.086788Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:401bd8fb1f192b798b2f51da0f5a736cbc1fafe45ed7bcda35e8877fd662766c","observation_id":"54d0cacf-9905-4812-9370-8b6541f3ad95","resolution":{"observed_at":"2026-08-02T00:04:07.086788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.181000Z","title":"Gen-0: Embodied foundation models that scale with physical interaction.Generalist AI Blog,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.181000Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:1cc843cd7d81e4f23e9d455f8405d1f7c2c81daeb8781a9864793abf9d5f6167","observation_id":"ea493c74-4e01-414c-85ec-437ffb62a7fa","resolution":{"observed_at":"2026-08-02T00:04:07.181000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.426810Z","title":"Gen-1: Scaling embodied foundation models to mastery.Generalist AI Blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.426810Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:82ee69559326b04995f666cf298f14a5ef5b9733d143b0dbb1e4deb2e0546616","observation_id":"2e7129a0-07f2-4ea4-b51d-240ba3d2c36e","resolution":{"observed_at":"2026-08-02T00:04:07.426810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.591352Z","title":"Gene-26.5: Advancing robotic manipulation to human level.Genesis AI Blog, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.591352Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:29407c009396cf064d637de330ccc844db5863b9e4346194f0367d470c250848","observation_id":"fd335565-bdce-4b16-94cf-dafbcb829c71","resolution":{"observed_at":"2026-08-02T00:04:07.591352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27792","last_updated":"2026-07-15T07:09:44Z","snapshot_observed_at":"2026-08-02T15:15:08.869109Z","submitted_at":"2026-04-30T12:34:44Z","title":"Motubrain: An Advanced World Action Model for Robot Control","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27792","snapshot_observed_at":"2026-08-02T00:04:07.705109Z","title":"Motubrain: An advanced world action model for robot control.arXiv preprint arXiv:2604.27792, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.705109Z"},"links":{"cited_paper":"/paper/2604.27792","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ed519ce2afd591557522a2062ad442d57c148af20054a9b86863841eea23ca3d","observation_id":"6408f5d5-3515-41ab-979e-bda2709f60eb","resolution":{"observed_at":"2026-08-02T00:04:07.705109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T00:04:07.846442Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.846442Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:77e79d76d19c86cc3720a9b36b3af37a6edaf958d017abe7ec9941dab716c153","observation_id":"05a07c5b-9198-4593-b574-79a2746497dd","resolution":{"observed_at":"2026-08-02T00:04:07.846442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.970461Z","title":"Qwen3.5: Accelerating productivity with native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.970461Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2193d9031ce87184897f88c776b8b9a8d80130399b31c7f160a96be920c4210a","observation_id":"3dc7a77b-da8f-4386-9f13-545297db9c9b","resolution":{"observed_at":"2026-08-02T00:04:07.970461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:08.076726Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.076726Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2fc61eb98ddaddf5ddd451ebbd26c568edc88bfe42434915fc19384ba248a53a","observation_id":"37642b6d-bc80-4668-8e71-19881e850fcc","resolution":{"observed_at":"2026-08-02T00:04:08.076726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T00:04:08.222348Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.222348Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9efd3312dac345bd0c058a6bdfff8567f0cd2536394b20e91651c39be4396b99","observation_id":"44c93c5e-71fb-43eb-a527-f39338861437","resolution":{"observed_at":"2026-08-02T00:04:08.222348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10422","last_updated":"2026-05-29T05:31:44Z","snapshot_observed_at":"2026-08-12T06:19:25.323667Z","submitted_at":"2026-03-11T05:11:44Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.10422","snapshot_observed_at":"2026-08-02T00:04:08.361341Z","title":"World2act: Latent action post-training from world model dynamics.arXiv preprint arXiv:2603.10422, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.361341Z"},"links":{"cited_paper":"/paper/2603.10422","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:8cfc37d24247d896a81568c51b14d75ff445bfa2fe36bddf127e395f157db2bd","observation_id":"1cb546a4-854a-4567-80b1-5f9eb81dba9b","resolution":{"observed_at":"2026-08-02T00:04:08.361341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:08.546668Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.546668Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:c0144d46384a0c8a32034607b789fb28c2b725536dfc380804d4ebafac304297","observation_id":"e10fc9c9-56a0-4063-b656-35fbd7d67500","resolution":{"observed_at":"2026-08-02T00:04:08.546668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09985","last_updated":"2024-01-18T14:01:20Z","snapshot_observed_at":"2026-08-15T03:25:48.505394Z","submitted_at":"2024-01-18T14:01:20Z","title":"WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09985","snapshot_observed_at":"2026-08-02T00:04:08.689523Z","title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens.arXiv preprint arXiv:2401.09985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.689523Z"},"links":{"cited_paper":"/paper/2401.09985","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:802af35bd51a234f11890e987f04c8936f72afc4d6b3540bf7e6f134679bd6be","observation_id":"5bbb7262-ef3d-492a-be20-e2d399360cd3","resolution":{"observed_at":"2026-08-02T00:04:08.689523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-11T08:52:29.230329Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-08-02T00:04:08.883631Z","title":"A pragmatic vla foundation model.arXiv preprint arXiv:2601.18692, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:08.883631Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:ac8303e802076eeec03064b8fd83f9f4dacf3d18ef6946cee8881f3b2c7f928a","observation_id":"5ff7846f-3914-4da3-abbe-e85fa1fba95c","resolution":{"observed_at":"2026-08-02T00:04:08.883631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.062173Z","title":"Dexumi: Using human hand as the universal manipulation interface for dexterous manipulation.arXiv preprint arXiv:2505.21864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.062173Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:f7de5820224dad4211640e9242a03fa36b5eeaf82e0907f1286082635a8fad76","observation_id":"8847c4a0-c647-44d2-ba2c-5483b46002be","resolution":{"observed_at":"2026-08-02T00:04:09.062173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-08-15T12:19:03.506493Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20562","snapshot_observed_at":"2026-08-02T00:04:09.236077Z","title":"Memorywam: Efficient world action modeling with persistent memory.arXiv preprint arXiv:2606.20562, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.236077Z"},"links":{"cited_paper":"/paper/2606.20562","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:7b050162dc41b101e4f29e6f9c0ac3e0255e0a966fb0168a00047d58d5e58514","observation_id":"571a8b58-02ec-4e07-8ad5-b643aa9fdfb4","resolution":{"observed_at":"2026-08-02T00:04:09.236077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.365590Z","title":"Gigaworld-policy: An efficient action-centered world-action model.arXiv preprint arXiv:2603.17240, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.365590Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:e90a2ad4dafb7ed02031b1b9835515b34fe99b68482e42225933e72272131451","observation_id":"aeee5494-a31e-4895-9005-01475331ad58","resolution":{"observed_at":"2026-08-02T00:04:09.365590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:09.530949Z","title":"Starvla-α: Reducing complexity in vision-language-action systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.530949Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:e619029381084292340e9d5669b06598f61489a908d6ee5c73ee5685d4b1125c","observation_id":"7419d939-de71-4609-96b3-1baa5e0f54ab","resolution":{"observed_at":"2026-08-02T00:04:09.530949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-02T00:04:09.676504Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.676504Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:538526330eac92490baf19408599de4bd9e84802552ba011f7d44c86a6f5cdc3","observation_id":"88207e1d-9378-44e1-b8a2-f40c32a463f2","resolution":{"observed_at":"2026-08-02T00:04:09.676504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30877","snapshot_observed_at":"2026-08-02T00:04:09.858319Z","title":"Wall-oss-0.5 technical report.arXiv preprint arXiv:2605.30877, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:09.858319Z"},"links":{"cited_paper":"/paper/2605.30877","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9b969fa2c6c8106ad171d6a5ef84fa49500210dc942cccf756a4da8749ec16b2","observation_id":"628babad-8bf5-49a2-b9e3-d20096c08eeb","resolution":{"observed_at":"2026-08-02T00:04:09.858319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-15T14:30:41.084242Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-02T00:04:10.006144Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.006144Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:c71d04f2745e04d8b047798ac0b15bd60b4b4f8e11808c951bbf1f0b7d5f093e","observation_id":"181cbaaa-febe-41b0-b66a-e702b18d0f09","resolution":{"observed_at":"2026-08-02T00:04:10.006144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-02T00:04:10.138148Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.138148Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4bef3665c403d8b90482a51a9fdf5bc708d073f8394fe7afee02d7e0987c65d3","observation_id":"395ff754-9e63-40d0-a1d6-14444ec8c58b","resolution":{"observed_at":"2026-08-02T00:04:10.138148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-13T15:47:21.622736Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-02T00:04:10.301551Z","title":"Hy-embodied-0.5-vla: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.301551Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:cbad140a14bf3a7bf1f7eaa9df3d92900a9a165571b78092b00074563a6b19a1","observation_id":"20e0fc5f-94c4-43fc-ae96-5be679b4161b","resolution":{"observed_at":"2026-08-02T00:04:10.301551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-07T08:07:21.408216Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.08639","snapshot_observed_at":"2026-08-02T00:04:10.493281Z","title":"Native video-action pretraining for generalizable robot control.arXiv preprint arXiv:2607.08639, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.493281Z"},"links":{"cited_paper":"/paper/2607.08639","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b5af9e4e9eced2208bdb6cf6af61c3f04c9a37792f3bb0e13599a64c9db951b9","observation_id":"213f53be-0816-4ac8-8652-76f621b0e5f1","resolution":{"observed_at":"2026-08-02T00:04:10.493281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:10.653923Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.653923Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:fbc49d40bcd14004aadcc0451712e9565c3dab66092af80ddbeb0fa7682c1749","observation_id":"1a1a8114-70f9-4b9a-8a6b-382661e04863","resolution":{"observed_at":"2026-08-02T00:04:10.653923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06559","last_updated":"2026-07-07T17:58:15Z","snapshot_observed_at":"2026-08-16T02:40:56.626765Z","submitted_at":"2026-07-07T17:58:15Z","title":"RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06559","snapshot_observed_at":"2026-08-02T00:04:10.767303Z","title":"Rynnworld-4d: 4d embodied world models for robotic manipulation.arXiv preprint arXiv:2607.06559, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.767303Z"},"links":{"cited_paper":"/paper/2607.06559","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:4f737e978fd67699711d50b920848376141f302da54ee611be5275c077b03325","observation_id":"78a64214-cc8c-46c0-8ab8-8c27ff66a29d","resolution":{"observed_at":"2026-08-02T00:04:10.767303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:10.975158Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.975158Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:edfcdec94f462ae8085b16cf7c2043f63d7740640ac30d9748f439fc9e4d4f56","observation_id":"8662e36b-e228-487d-864a-51bc0c18689b","resolution":{"observed_at":"2026-08-02T00:04:10.975158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.125595Z","title":"Fastumi: A scalable and hardware-independent universal manipulation interface with dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.125595Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2ab93a7cef8189ee15d664e129821c1d270b1c07ce51fa1a699b72c276c27ce0","observation_id":"abd2b7e2-65a0-4fe7-9342-6116df8470fb","resolution":{"observed_at":"2026-08-02T00:04:11.125595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-16T05:11:57.202898Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-02T00:04:11.217040Z","title":"Tesseract: learning 4d embodied world models.arXiv preprint arXiv:2504.20995, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.217040Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:549496a759cf8053a81a3039ae84a3b8297559f46dd68116c16853a405cd226d","observation_id":"7574aabc-55ee-4055-8bc9-af23deb11fc9","resolution":{"observed_at":"2026-08-02T00:04:11.217040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-11T15:30:01.335662Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-02T00:04:11.291258Z","title":"X-vla: Soft-prompted transformer as scalable cross-embodiment vision-language-action model.arXiv preprint arXiv:2510.10274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.291258Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:2189a6739b9ffe052a8aac5b77da87d5b334f25a349fc95c410ab898a35c5e3e","observation_id":"8fe5f4eb-12bf-4b5c-bf0c-183af1e848f3","resolution":{"observed_at":"2026-08-02T00:04:11.291258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.427801Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.427801Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:a13c086cfaf91f398688e08dd3e2c34a2a3c0ae86024fc4d96d77492ec8c2964","observation_id":"b17054e2-dfe6-4555-aa1a-2ee1aaba470b","resolution":{"observed_at":"2026-08-02T00:04:11.427801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.570801Z","title":"Acot-vla: Action chain-of-thought for vision-language-action models.arXiv preprint arXiv:2601.11404, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.570801Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:6580ace6af33166f31d52adb9abe522647cb96ac1704bb2e7664a359cdcede4d","observation_id":"b9a015f2-28a9-445d-9777-5fd99f0a73e9","resolution":{"observed_at":"2026-08-02T00:04:11.570801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-12T22:44:50.325579Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-02T00:04:11.705089Z","title":"Robodreamer: Learning compositional world models for robot imagination.arXiv preprint arXiv:2404.12377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.705089Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:9c276a5e7fd77cbf7f1b820e8b47e21018319168eaf949f72eb40b4aae69fa15","observation_id":"720928f3-040e-4442-b1ad-e10b739fc6e2","resolution":{"observed_at":"2026-08-02T00:04:11.705089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-02T00:04:11.845223Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint arXiv:2504.02792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.845223Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:647dc516b94f6c221bcca2a1140d9c5a0b0b830c1220bfed779f7b5342117feb","observation_id":"6f9c9bc2-b575-4938-a372-d6cf0c9f1af9","resolution":{"observed_at":"2026-08-02T00:04:11.845223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:11.999325Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:11.999325Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:5722c796374dc4041cadd5447d580f7ea95e260de8598dc6163a9943d02f2ab9","observation_id":"9eb94489-b3e8-461a-985b-bc8690f8338e","resolution":{"observed_at":"2026-08-02T00:04:11.999325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:04:07.331395Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:07.331395Z"},"links":{"citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:fde38382f7248baa871f9248669da4046d11b9dc9d4ffb01387fa592455c2895","observation_id":"d79aef79-964d-4da3-96ab-35e32f332ef8","resolution":{"observed_at":"2026-08-02T00:04:07.331395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T18:04:53.379466Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 7 inbound Pith citation observations for arXiv:2607.15330."}