{"as_of":"2026-08-18T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e32db5f67a63b366500b685d5e67d4aac615c1c48ba091ea3dc0fe2908a9c84a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:31:38.052183Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:52:22.168086Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:47.581063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":"2606.14409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-07-21T02:21:39.644745Z","title":"Hy-Embodied-0.5-VLA: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409, 2026","venue":null,"work_id":"d13568de-8ff4-49a3-89d0-eb6959c4fa3d","year":2026},"citing_paper":{"arxiv_id":"2606.17200","last_updated":"2026-06-15T18:40:18Z","snapshot_observed_at":"2026-08-13T20:20:19.832503Z","submitted_at":"2026-06-15T18:40:18Z","title":"ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T03:25:39.450667Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2606.17200"},"observation_digest":"sha256:acd60a12b0a5335dcb1ed12abfad50773bfbdced45a6265948fd7e3177af640f","observation_id":"c3b573c9-d5bf-4023-8be1-018709071031","resolution":{"observed_at":"2026-07-21T02:21:39.644745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-02T03:16:53.174546Z","title":"Hy-embodied-0.5-vla: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14187","last_updated":"2026-07-15T15:45:25Z","snapshot_observed_at":"2026-08-16T14:58:52.819860Z","submitted_at":"2026-07-15T15:45:25Z","title":"RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T03:16:53.174546Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2607.14187"},"observation_digest":"sha256:cf4a2500db3fd0035d3c279144244e591f0ade7e94d0cc1b2e4416ec375f1b58","observation_id":"e6a6cb12-87f5-4a87-933f-14bf1666022c","resolution":{"observed_at":"2026-08-02T03:16:53.174546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-02T00:04:10.301551Z","title":"Hy-embodied-0.5-vla: From vision-language-action models to a real-world robot learning stack.arXiv preprint arXiv:2606.14409, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15330","last_updated":"2026-07-22T11:38:14Z","snapshot_observed_at":"2026-08-17T22:39:36.597563Z","submitted_at":"2026-07-16T16:02:25Z","title":"Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T00:04:10.301551Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2607.15330"},"observation_digest":"sha256:b3884a46731b6b4aa0ac6a38fbc2f7fb23689bb7d262f0fc4d4c5176e04c6275","observation_id":"20e0fc5f-94c4-43fc-ae96-5be679b4161b","resolution":{"observed_at":"2026-08-02T00:04:10.301551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-05T14:52:35.364858Z","title":"arXiv preprint arXiv:2606.14409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-18T20:10:05.035799Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.364858Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:1aa61c2594fde344d34906d3aa2eb65da24f47dfb8b3f6b302361e931744bae7","observation_id":"ff4dac7b-d6b9-4670-925d-1921f7e87ec0","resolution":{"observed_at":"2026-08-05T14:52:35.364858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-15T14:52:22.168086Z","title":"arXiv preprint arXiv:2606.14409 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-14T06:43:08Z","snapshot_observed_at":"2026-08-18T20:10:05.035799Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:52:22.168086Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:4d84f2532eed5f85652f9613a0068d339caf0ace27a1df66a0b67daae6e68443","observation_id":"1b730ff3-fad8-42e1-b214-2063b86cdb27","resolution":{"observed_at":"2026-08-15T14:52:22.168086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-11T04:54:23.735057Z","title":"Hy-embodied-0.5-vla: From vision- language-action models to a real-world robot learning stack,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-16T15:34:10.165022Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:54:23.735057Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:9b1b33e5d34f116252aa128142e56a0c47785b8d985c7dce054a0fb09a9f01c3","observation_id":"d6719aab-bbd0-4091-b0d5-750414dff7df","resolution":{"observed_at":"2026-08-11T04:54:23.735057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14409","snapshot_observed_at":"2026-08-14T04:17:47.263786Z","title":"Hy-embodied-0.5-vla: From vision- language-action models to a real-world robot learning stack,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09892","last_updated":"2026-08-11T17:41:52Z","snapshot_observed_at":"2026-08-16T15:34:10.165022Z","submitted_at":"2026-08-10T17:41:04Z","title":"XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:17:47.263786Z"},"links":{"cited_paper":"/paper/2606.14409","citing_paper":"/paper/2608.09892"},"observation_digest":"sha256:ff334004466f383bb41fa516a01d62277fc8a41a668fc241338718925e6511cf","observation_id":"8fd6cc3c-eaed-4eda-b6e2-8963623518f5","resolution":{"observed_at":"2026-08-14T04:17:47.263786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.14409/citation-record","integrity":"/paper/2606.14409/integrity","json":"/paper/2606.14409/citation-record.json","paper":"/paper/2606.14409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T11:31:33.184029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.184029Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:218c9922ea6aa63d8f3c729de609bee59255b210f5e34b6f2367f6b005903eca","observation_id":"94afc17a-f003-4b04-a8ee-fb99ac0741ac","resolution":{"observed_at":"2026-08-02T11:31:33.184029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T11:31:33.267653Z","title":"π0.5: A VLA with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.267653Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:57d3f95b742d1b92abd5cc4ecdb207d635c77b383b96eb6e3a61a7553a457cea","observation_id":"45c6e1ed-1768-497c-911e-43286859d14b","resolution":{"observed_at":"2026-08-02T11:31:33.267653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T11:31:33.314639Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.314639Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:24acb5c5a8cbcbd50875fa3bc3e38e4688e48321316c95cb5af8616bca3dd895","observation_id":"7874eeb9-fb50-463a-ab99-829a8de419db","resolution":{"observed_at":"2026-08-02T11:31:33.314639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T11:31:33.386529Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.386529Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:36a6e0b9ef0075744235a8ae8297b7d90a48ff5fb84f26d96c69ba97ffdb4ff9","observation_id":"0524bf3f-8e8e-4d1d-b2d8-e09259cf5ef4","resolution":{"observed_at":"2026-08-02T11:31:33.386529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:33.483759Z","title":"Universal pose pretraining for generalizable vision-language-action policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.483759Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:95236773633c29c5470fe29ca28488cf7e8ea0e14bfe1132e6fcbe53f804fd2d","observation_id":"f46377fb-4004-4e91-9070-1c3c90f562f2","resolution":{"observed_at":"2026-08-02T11:31:33.483759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:33.587583Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.587583Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:d2d5bea658b5bb5a421e8271ae6ec7ec022cdc0ad2b89ea46cc919b49b28bd01","observation_id":"fc79ab49-c0f3-432e-84db-1be1c76d50e6","resolution":{"observed_at":"2026-08-02T11:31:33.587583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:33.633171Z","title":"Learningfine-grainedbimanual manipulation with low-cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.633171Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:00ff905c51580c8d468b38c8b8aecc00ec83955c1c64f8200f746a8593dd7a33","observation_id":"6361d3e5-9029-47ca-83ae-b6fa77a0dee4","resolution":{"observed_at":"2026-08-02T11:31:33.633171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-02T11:31:33.729851Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.729851Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:7e41b040009f87d6c712c64f6d5d21846d9e6b482aebc82d39e7a7ff878ad72c","observation_id":"eedd00fd-10fd-4e3c-9bd6-3361a0385231","resolution":{"observed_at":"2026-08-02T11:31:33.729851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-08-15T05:50:31.055425Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12440","snapshot_observed_at":"2026-08-02T11:31:33.814742Z","title":"Egovla: Learning vision-language-action models from egocentric human videos.arXiv preprint arXiv:2507.12440, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.814742Z"},"links":{"cited_paper":"/paper/2507.12440","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:a6497d2695799871073289599dc991464cc13d0a7f105c3a5951186831de8a0a","observation_id":"b0a28147-1a24-4c47-aa17-1de436a5d9a1","resolution":{"observed_at":"2026-08-02T11:31:33.814742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:33.910138Z","title":"Scalable vision-language-action model pretraining for robotic manipulation with real-life human activity videos.arXiv preprint arXiv:2510.21571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.910138Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:1a8dd30224b507acc047a07ba196d138d3a9656519c625bdbc0e5af4f78ee7b7","observation_id":"dfd02d4c-9903-4d68-b27d-b050b2b5d047","resolution":{"observed_at":"2026-08-02T11:31:33.910138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:33.947800Z","title":"Universalmanipulationinterface:In-the-wildrobot teachingwithout in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:33.947800Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:731cb0b6c72a3b78e099815a65b4d93872fe71addfee8404c6eaf70861de601f","observation_id":"7f4a8db4-ee1c-494d-bcfb-9939e13abb43","resolution":{"observed_at":"2026-08-02T11:31:33.947800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:34.025387Z","title":"RT-2:Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.025387Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:a65e60895192894b7a0b482dc3e369746f1718e012f3cfcacca68319745a2d39","observation_id":"95fc349b-3599-4e89-8c9c-958dede8c1f9","resolution":{"observed_at":"2026-08-02T11:31:34.025387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:34.126757Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.126757Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:23fb7a5a51c4b32f4612d7e2b8fb2578dc5d62843800f4b7428bf56e2e9f1d63","observation_id":"50ebb30d-8d3d-4280-918c-7e8035ed9403","resolution":{"observed_at":"2026-08-02T11:31:34.126757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-02T11:31:34.198419Z","title":"π∗ 0.6:AVLAthatlearnsfromexperience.arXivpreprintarXiv:2511.14759, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.198419Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:8d1e62364f0ca27b27c32135246bc36339cd310cd0f9750756401090f859399c","observation_id":"9e0cae91-1e55-4460-a8ef-0c6865aff714","resolution":{"observed_at":"2026-08-02T11:31:34.198419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:34.313415Z","title":"Hy-Embodied-0.5: Embodied foundation models for real-world agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.313415Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:8e5c9ba150832c4fbf0270bd62311cec388e5599d3e7b2521ce0fdc747c1d61a","observation_id":"30bada3c-3e97-493e-9f91-a54c9998d64a","resolution":{"observed_at":"2026-08-02T11:31:34.313415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T11:31:34.367603Z","title":"PaliGemma: A versatile 3B VLM for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.367603Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:6e70277e7867b825231d6f0e313db96f1608b457fd99a89e6a6b391270a48aa9","observation_id":"7b4ab863-bfe2-4ead-8a05-6b3f17ea3036","resolution":{"observed_at":"2026-08-02T11:31:34.367603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T11:31:34.435753Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.435753Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:53db821c2f7d182476b77f1395a6e6bff31f1bb62bd5a6c651015b80c43ba94b","observation_id":"870da128-f1a9-422e-8b50-cac0d040177f","resolution":{"observed_at":"2026-08-02T11:31:34.435753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-02T11:31:34.532750Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.532750Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:9f78bf2c9b670676d91f231321c005a13d2ff6ffbae9b7cb1f57f87a9ad0efae","observation_id":"171f1d79-6b59-477e-a1a0-3e6a776128c1","resolution":{"observed_at":"2026-08-02T11:31:34.532750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05468","last_updated":"2026-06-03T21:47:43Z","snapshot_observed_at":"2026-08-13T16:49:09.990554Z","submitted_at":"2026-06-03T21:47:43Z","title":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05468","snapshot_observed_at":"2026-08-02T11:31:34.620402Z","title":"Flowpro: Reward-free reinforced fine-tuning of flow-matching vlas via proximalized preference optimization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.620402Z"},"links":{"cited_paper":"/paper/2606.05468","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:82148bb21388a0c677bb232a77e76106a257cb83c07dbbd25efe85b62ed01f24","observation_id":"3329dd95-3ae2-4c66-811f-3187e50d2f02","resolution":{"observed_at":"2026-08-02T11:31:34.620402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-02T11:31:34.781921Z","title":"Mixture-of- transformers: A sparse and scalable architecture for multi-modal foundation models.arXiv preprint arXiv:2411.04996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.781921Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:da670e36b06039a88e469a84bd882d858456591a9dd569123e8b64726499d78e","observation_id":"7369cda2-6989-4374-a897-c5b7be7fd152","resolution":{"observed_at":"2026-08-02T11:31:34.781921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:34.854747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.854747Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:c36da94a1aaf410fa6f28c4e50a0448ae93f46e96db74f92c3da44b30327c05d","observation_id":"24cd364b-b6ec-45c8-bb8c-902a7b967cc2","resolution":{"observed_at":"2026-08-02T11:31:34.854747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:34.959150Z","title":"Multi-scale embodied memory for vision-language-action models.arXiv preprint arXiv:2603.03596, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:34.959150Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:3495ce64a6997389ee06bc4c8c8d2e0223348d8567bf876be68ba1c16894a079","observation_id":"2e642bcc-965d-4763-ab88-c6f59406c859","resolution":{"observed_at":"2026-08-02T11:31:34.959150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:35.096860Z","title":"Mode-adaptive neural networks for quadruped motion control.ACM Transactions on Graphics (ToG), 37(4):1–11, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.096860Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:c681f8f7ee15c1187f6d9492643793a15958edf9697d6bfba1c32fd85691f56c","observation_id":"97c95388-0135-4ffe-9298-0db600ef27b8","resolution":{"observed_at":"2026-08-02T11:31:35.096860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-02T11:31:35.216880Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.216880Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:b1b85e745a89f98b984714b471f6ae937cfb08f26ebdfee2b6902da10a97cca9","observation_id":"eec9ecd5-c9cb-47d0-b41a-393c33bba930","resolution":{"observed_at":"2026-08-02T11:31:35.216880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:35.284298Z","title":"Patchn’pack:Navit,avisiontransformerforanyaspectratioandresolution.AdvancesinNeural Information Processing Systems, 36:2252–2274, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.284298Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:61f3f625cc24a0c7fbe5a725840be79e9c1c0b67a0a5b5ab7360636c9a076e23","observation_id":"1e1020fe-9899-4b63-bcf8-dfbf07649fcc","resolution":{"observed_at":"2026-08-02T11:31:35.284298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T11:31:35.333827Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.333827Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:8c5992125750455e40c92196fb21089a7d0d22ee54a528ebb3d30f0f1d20e417","observation_id":"1b4834d9-e0e3-48b2-a26b-8ece65518e48","resolution":{"observed_at":"2026-08-02T11:31:35.333827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-02T11:31:35.396263Z","title":"RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.396263Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:11a08495ada6434f78eec92987b9b06d8179b8e2b42630a34ead779526d919f2","observation_id":"1e28eb41-657e-4f9d-8e96-2ad7cfefdada","resolution":{"observed_at":"2026-08-02T11:31:35.396263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:35.509690Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow.International Conference on Learning Representations (ICLR), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.509690Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:1d191658528356e105f0ec42419b0ead695ea49c64e4530e5f4988460a68ef55","observation_id":"a8382ff1-fa55-4bda-82f6-bdb7c80b0594","resolution":{"observed_at":"2026-08-02T11:31:35.509690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-02T11:31:35.570110Z","title":"Improving video generation with human feedback.arXiv preprint arXiv:2501.13918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.570110Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:1d57cdc0756f3e775a838761264ebc6317c717bb5e651e6bb0bbc098c76e3c94","observation_id":"e8cf599b-b197-4736-824e-a9ece5b996b8","resolution":{"observed_at":"2026-08-02T11:31:35.570110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:35.630346Z","title":"Proximalized preference optimization for diverse feedback types: A decomposed perspective on DPO","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.630346Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:3d32976cfbefcaeedcb257311bca7c5cd07086b85607b484fa18e06294b54ce2","observation_id":"5c1af7cf-3870-4a6b-8459-7321172c371c","resolution":{"observed_at":"2026-08-02T11:31:35.630346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-02T11:31:35.686670Z","title":"ABot-M0:VLAfoundationmodelforroboticmanipulationwithactionmanifold learning.arXiv preprint arXiv:2602.11236, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.686670Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:18f7211c622ff11f92bf139f393cecb6b5ddb754535b0c902bdf5a732947610d","observation_id":"e541f357-c7fc-435d-9000-74da34a65c78","resolution":{"observed_at":"2026-08-02T11:31:35.686670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-18T14:09:54.189121Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-08-02T11:31:35.765477Z","title":"Qwen-vla: Unifying vision-language-action modeling across tasks, environments, and robot embodiments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.765477Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:caf0a88e9da16374c642cb27fd8444b3f268289df1ee7690b91875d9a321567e","observation_id":"575ca4fb-98f2-4422-aa37-07b761179b1d","resolution":{"observed_at":"2026-08-02T11:31:35.765477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-11T08:52:29.230329Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-08-02T11:31:35.827769Z","title":"LingBot-VLA: A pragmatic VLA foundation model.arXiv preprint arXiv:2601.18692, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.827769Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:12067707949f4ed060db46d4ef24aab8e2ddb9b599b60cb9ac2f23420b6ad9a1","observation_id":"9f7fdae9-34af-4925-a43f-829cc07a36eb","resolution":{"observed_at":"2026-08-02T11:31:35.827769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-08-11T13:37:09.952888Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-02T11:31:35.911047Z","title":"starVLA: A lego-like codebase for vision-language-action model developing.arXiv preprint arXiv:2604.05014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.911047Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:0f9c35a56ce30122d9906fc681845c18dd91a9e330549eab7e4ee5365462a803","observation_id":"251a2b84-2d2a-4e4b-80ab-a02fccad2719","resolution":{"observed_at":"2026-08-02T11:31:35.911047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-08-16T22:05:17.066613Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-02T11:31:35.975095Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:35.975095Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:11f17050bff4b28f51dbcd468408197c7571900434d2cfde8c42166dad15ac27","observation_id":"bc205fed-e7eb-4f04-a25d-67c79a1e68a7","resolution":{"observed_at":"2026-08-02T11:31:35.975095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20100","last_updated":"2026-04-23T04:10:40Z","snapshot_observed_at":"2026-08-16T05:48:33.705590Z","submitted_at":"2026-04-22T01:51:48Z","title":"JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20100","snapshot_observed_at":"2026-08-02T11:31:36.042774Z","title":"JoyAI-RA 0.1: A foundation model for robotic autonomy.arXiv preprint arXiv:2604.20100, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.042774Z"},"links":{"cited_paper":"/paper/2604.20100","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:b1afa8feab27a444e92846390f957c553a3f5b43669e78477987155b5a9ab771","observation_id":"4751e36a-1746-448c-be14-77ab8b48efab","resolution":{"observed_at":"2026-08-02T11:31:36.042774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.095780Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.095780Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:fcdf01c248157f1acc10c864f8ad1b0b08554fa7491bb913cf76a3eece4b6230","observation_id":"675391f3-76ab-418c-a189-2137423f2084","resolution":{"observed_at":"2026-08-02T11:31:36.095780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.176565Z","title":"Gordon, and J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.176565Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:4dbecad1f9f56067c88579d825a234daf7098c0eff8e1aeaa5ca08997cfb60bc","observation_id":"da60f461-7009-4121-a428-50317619ac58","resolution":{"observed_at":"2026-08-02T11:31:36.176565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-02T11:31:36.267157Z","title":"Gemini robotics 1.5: Pushing thefrontierofgeneralistrobotswithadvancedembodiedreasoning,thinking,andmotiontransfer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.267157Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:d252875656632510c205a2d047ee3ad4c51122023179b0f26c1d3e7c7130e55d","observation_id":"fe24aed3-eb8c-4c67-bb6e-84c061316485","resolution":{"observed_at":"2026-08-02T11:31:36.267157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T11:31:36.326667Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.326667Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:98a678f764426ce2d58f5698c79c2ff2c276dd63ecd5c18c89532f04b12c1552","observation_id":"cc6265f1-7f8c-428f-a08a-5422de08cea0","resolution":{"observed_at":"2026-08-02T11:31:36.326667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.442501Z","title":"RoboBrain 2.5: Depth insight, time in mind.arXiv preprint arXiv:2601.14352, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.442501Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:a3e747d015b9e014fe56ebda5b57ac123593f5c73122998459c7a14aaf7491e2","observation_id":"f6fc61ea-e098-44a7-9d8c-524dbcc0b40a","resolution":{"observed_at":"2026-08-02T11:31:36.442501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.559624Z","title":"RynnBrain: Open embodied foundation models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.559624Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:2fa69a1caf9973495493d9a882e73824eaafad45d827de024f2204868fcaba2e","observation_id":"60e558cd-9a21-4dd7-9f0f-150bdf34a9b0","resolution":{"observed_at":"2026-08-02T11:31:36.559624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05331","snapshot_observed_at":"2026-08-02T11:31:36.636842Z","title":"A careful examination of large behavior models for multitask robot manipulation.arXiv preprint arXiv:2507.05331, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.636842Z"},"links":{"cited_paper":"/paper/2507.05331","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:1b7643bb46f50f138718a322a2a3cabfab0a130fc256d35ea215982d2bebf889","observation_id":"200ca3cc-582b-4f5d-8c98-d8eab535b457","resolution":{"observed_at":"2026-08-02T11:31:36.636842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.716435Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.716435Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:20333f209e88bd0bac3e0df8484f3e8eee7ed44fe7c60bf7b1efb29d4f2845b6","observation_id":"a542bd3d-a750-48a7-a3b7-b2bd971fb428","resolution":{"observed_at":"2026-08-02T11:31:36.716435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.774413Z","title":"DROID: A large-scale in-the-wild robot manipulation dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.774413Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:8f77d11d32fa758f83ef4b81704855ed6201712e9cde494f2dee3d72329423d7","observation_id":"f6eaf0b9-cd57-4fca-82c0-a6f430cfa052","resolution":{"observed_at":"2026-08-02T11:31:36.774413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:36.946125Z","title":"DexUMI:Usinghumanhandastheuniversalmanipulationinterfacefordexterous manipulation.arXiv preprint arXiv:2505.21864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:36.946125Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:6dbef73ca589e9767beb4295548bf1f87fb0de5a242a96894d249d5773143ef8","observation_id":"91f3249e-27b5-4265-b78b-67c721c1959d","resolution":{"observed_at":"2026-08-02T11:31:36.946125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.108065Z","title":"EgoMI: Learning active vision and whole-body manipulation from egocentric human demonstrations.arXiv preprint arXiv:2511.00153, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.108065Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:8b961e7544b7fb9eece47456dbedd9581b6190eea745752dbbd611380340c256","observation_id":"ca8baf1c-44ef-438c-a8ad-4af8d86f43ef","resolution":{"observed_at":"2026-08-02T11:31:37.108065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.03243","last_updated":"2026-05-14T23:12:06Z","snapshot_observed_at":"2026-08-11T14:31:32.774063Z","submitted_at":"2026-03-03T18:36:49Z","title":"HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.03243","snapshot_observed_at":"2026-08-02T11:31:37.254234Z","title":"HoMMI: Learning whole-body mobile manipulation from human demonstrations.arXiv preprint arXiv:2603.03243, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.254234Z"},"links":{"cited_paper":"/paper/2603.03243","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:34011bde926d88f4fbf5fceb1fbc4ba897d7803f9893e2511a428f30c4a64933","observation_id":"1aeec58f-d749-479b-870d-8993e9bf925b","resolution":{"observed_at":"2026-08-02T11:31:37.254234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.402241Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.402241Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:0aaa420d7f685d72cad49d96f005a3bf0a720107647028f50502609f95e5cbac","observation_id":"556c61e1-7d33-4302-8f83-f9953bbd9ff2","resolution":{"observed_at":"2026-08-02T11:31:37.402241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T11:31:37.441697Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.441697Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:e6179ae9b87134742f059e7cf4c56a2544ef2bd5f2a1684f39f105888bded896","observation_id":"b5524aa9-8e23-4178-82d9-5790001bdf09","resolution":{"observed_at":"2026-08-02T11:31:37.441697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.519446Z","title":"Precise and dexterous robotic manipulationviahuman-in-the-loopreinforcementlearning.ScienceRobotics,10(105):eads5033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.519446Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:d47571c981d3a3e47d26f68f70d159a64e8d5198366b6573aebff69b09ad1601","observation_id":"d17a8458-3dc5-4ad9-b322-4ecc3d3aebd1","resolution":{"observed_at":"2026-08-02T11:31:37.519446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.608062Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.608062Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:86793ec82d220036c5193e17c1d447f908726b1d82e9fb06775f8f1818ccc3be","observation_id":"1b300e0e-48be-42ac-8f33-d35c435141b2","resolution":{"observed_at":"2026-08-02T11:31:37.608062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-08-16T20:04:28.114227Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-02T11:31:37.690666Z","title":"GRAPE: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.690666Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:92730d9080f7ff20a9a8788a917047d42cbdf02608fdb933a6f9c97f06087e8b","observation_id":"f7277805-4317-4e28-9e61-fc005ca76c40","resolution":{"observed_at":"2026-08-02T11:31:37.690666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.762907Z","title":"Real-time action chunking with large models.arXiv preprint arXiv:2503.07206, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.762907Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:d0b0b83437703f3cd87519387066e7eba91415b93b42405a42a7ed4d1fe6af67","observation_id":"3df46ae2-a65b-4b19-a041-b8df0d4e7846","resolution":{"observed_at":"2026-08-02T11:31:37.762907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.806368Z","title":"Training-time real-time chunking: Co-training high-frequency action refinement with policies, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.806368Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:6f8572c162d53af1cf7ae32415f9d262f050b6c343c110bc376fd0f936934f9b","observation_id":"474e296e-5c38-4caa-aa2e-fa97999ce0f8","resolution":{"observed_at":"2026-08-02T11:31:37.806368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01031","last_updated":"2026-07-26T23:00:24Z","snapshot_observed_at":"2026-08-15T09:02:50.731067Z","submitted_at":"2025-11-30T18:59:24Z","title":"VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01031","snapshot_observed_at":"2026-08-02T11:31:37.870540Z","title":"VLASH: Real-time VLAs via future-state-aware asynchronous inference.arXiv preprint arXiv:2512.01031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.870540Z"},"links":{"cited_paper":"/paper/2512.01031","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:18576ce8bb821fd94e877b19d191ea618c62b2a6b1b4bc90c9d5c77f6e8c926f","observation_id":"634cedbd-3fb7-4abf-bb05-de31eb4f9f47","resolution":{"observed_at":"2026-08-02T11:31:37.870540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-02T11:31:37.930748Z","title":"22 Appendix A RoboTwin2.0 Evaluation Details Per-taskresults.Table3reportstheper-tasksuccessratesof HyVLA-0.5onthe 50-taskRoboTwin2.0 suite","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.930748Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:c3deb568dcc7627f525886c8b245492ac69a8be3e8bce37bdc91c8c7ea6b35d3","observation_id":"708b250d-3e07-4dbe-92b1-5cffa60e4259","resolution":{"observed_at":"2026-08-02T11:31:37.930748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:37.991471Z","title":"It assumes that the UMI world frame and the robot chassis frame are related by a pure translation (identical orientation), which holds on Astribot S1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.991471Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:bf7b79257a1aba49d2f30a5f450a3840c08fa390176e8f41f62463b025022583","observation_id":"e5d90056-6070-42ff-b3a1-308ec18a7a1e","resolution":{"observed_at":"2026-08-02T11:31:37.991471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:31:38.052183Z","title":"We document this compatibility for completeness; our AstribotS1 results in §6.2 use the heuristic exclusively","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:38.052183Z"},"links":{"citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:7faa2cfd9d911d23dd954e38e42a6dcdaf73ec6b6e4e0c47f74a000d547e41de","observation_id":"174b1d95-e4b2-4e0b-9bd6-b3185770d12b","resolution":{"observed_at":"2026-08-02T11:31:38.052183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T22:12:17.489099Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2606.14409."}