{"as_of":"2026-08-06T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b13f712fec2b3a11b71ca37fbdd93bb324616768dc1cf4195dd368b17c3f13e","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T22:53:37.120692Z","state":"measured"},{"denominator":128,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":128,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":77,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:50:43.721373Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.655148Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:966eb69852be8e9449fcead5ede538d4411a2900725db4b2c9ab6803fbc19317","observation_id":"50987af3-8267-4e20-8e85-dcb663ef658f","resolution":{"observed_at":"2026-05-23T01:32:22.535668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T12:47:10.146795Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2503.15558"},"observation_digest":"sha256:407d3ddbad0b40441205917164ca4f7faea83d081c17a900490e6f6a6b0619ae","observation_id":"2c161a03-7f64-4220-b7b8-029c50aa2b7c","resolution":{"observed_at":"2026-05-16T12:47:10.259876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5d408c8f209c2acf2a2bf91a6e35e616c54904a649a6530c268dfcd4b19aa88e","observation_id":"4ca952a4-2f8c-4c18-bd64-911acd1d9eb5","resolution":{"observed_at":"2026-05-22T18:05:00.968391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:f26e10d66fbcea7e75a9821bf9c35ce9ac8ffed51d7f766f24da14a3c9d58dca","observation_id":"8a692af5-b525-41ab-82c7-06c243af5102","resolution":{"observed_at":"2026-05-17T14:08:35.042707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:4bdf78f381bde760e2047e11fbeae89725ab923e2e671d45339f80fe57d45736","observation_id":"66ed0c3a-cdc7-4cd9-9d27-6cfaa1ae04ba","resolution":{"observed_at":"2026-05-16T15:42:41.606100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T03:18:14.655384Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2507.16815"},"observation_digest":"sha256:5112df0ae497010d7834a51890f6d281c2047d9dd528b4a7b2e228c103362824","observation_id":"ef797cb4-db67-41e1-95c9-abee9238f569","resolution":{"observed_at":"2026-05-19T03:22:01.079183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T22:50:43.721373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-05T22:50:39.090909Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:43.721373Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:82893d7b7182c2e908e3e36e409f5e3f0663ec1bf10a0b151db6d84a9d1a9438","observation_id":"4bbfa728-b40a-4a14-9c6d-a85282007423","resolution":{"observed_at":"2026-08-05T22:50:43.721373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T22:46:42.219368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-05T22:46:26.310165Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:42.219368Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:038ca44ad4f3ec15c1ff6e3f9c13972f06f2bcc292e1d904c7b6c1cff966e00a","observation_id":"d465dfcb-7f82-4229-9e4c-3822a76b55ea","resolution":{"observed_at":"2026-08-05T22:46:42.219368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T16:55:52.126320Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.126320Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:8ae1c3debd78607c206d4a8d90f48421d3f910be494cd50cecb02a5cab1ffe63","observation_id":"b65a24f0-cafa-4ccb-a942-93d8d69415ba","resolution":{"observed_at":"2026-08-05T16:55:52.126320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T14:42:32.765861Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.765861Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:737e96bd74f07b639b65e7ae1301d99088ddb7018b41b9151a76fe5d1304890a","observation_id":"30ab6450-eb2a-4fa8-9537-1346c02fd10e","resolution":{"observed_at":"2026-08-05T14:42:32.765861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T13:31:09.955938Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.955938Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:e7da7663ed3bd2f6228b12fb2b776c708c220bb7db1f07afad25a47ed9d3fb57","observation_id":"a5bc8679-83f1-4d36-b2b5-378c2170ad53","resolution":{"observed_at":"2026-08-05T13:31:09.955938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-05T05:26:37.189981Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.05513","last_updated":"2025-09-05T21:47:55Z","snapshot_observed_at":"2026-08-05T05:26:36.814805Z","submitted_at":"2025-09-05T21:47:55Z","title":"OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:26:37.189981Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2509.05513"},"observation_digest":"sha256:d752c81d98fb3562998ca2eb867e2340c9c459f4de242c57bbceacaf57533e70","observation_id":"7f3bc4a7-4b41-4881-97f3-ca1276a2d3d2","resolution":{"observed_at":"2026-08-05T05:26:37.189981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:27db03eeb2ce1450996a57941f0f85c6ef765801bb28b230a12c7968a944bfad","observation_id":"248a9431-08ea-4cb8-9302-b9d334ec5d38","resolution":{"observed_at":"2026-05-16T01:14:10.531571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T20:09:39.677347Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2510.13778"},"observation_digest":"sha256:b4d819a83f8f5254f8544a772b57e1878a9623811e5961ef54421523f065eb46","observation_id":"5d8032de-8d82-4270-a002-d8d4ebad9ef2","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-04T09:33:40.382324Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:40.382324Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:58f371e4d1f0d8d33d4b11cc89f40719d85ba33a578d8f11173ef766948aad26","observation_id":"070e2f59-2fb9-4760-a14c-4a030752f44b","resolution":{"observed_at":"2026-08-04T09:33:40.382324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:d7b90fbd309b55656114385199e22aa651ab9deb033f9e9536b16fc2ed306df2","observation_id":"3c453cca-20f2-4bff-873f-c86d8923f044","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-03T20:32:28.968924Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-03T20:32:24.421072Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:32:28.968924Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2511.19433"},"observation_digest":"sha256:059f31621f7357076d47a8e8c7ea33cceb2b9209a9957aeffbac39acea9fb846","observation_id":"a8f7678e-4112-411e-83ce-3985fcda86e9","resolution":{"observed_at":"2026-08-03T20:32:28.968924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2511.20857","last_updated":"2026-05-18T16:18:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T21:08:07Z","title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","version":1},"reference_index":242,"source":"arxiv_source","source_observed_at":"2026-05-14T23:13:15.016486Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2511.20857"},"observation_digest":"sha256:b65072eecafcb228a0001e7f803cca59c685562f325433024d68a1ae467c5e5c","observation_id":"a3f6b563-cf25-4616-b239-2a8a523767a1","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-03T13:53:26.173751Z","title":"Hi robot: Open-ended instruction following with hierarchical vision- language-action models.arXiv preprint arXiv:2502.19417,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.22539","last_updated":"2026-07-02T08:55:28Z","snapshot_observed_at":"2026-08-06T03:03:38.906157Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:53:26.173751Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2512.22539"},"observation_digest":"sha256:b0e91451b119410ad55f70bcce22255f0b33cceadefae1b70d659d96aa3b1143","observation_id":"4b97762f-3eb2-4c18-a3ac-67b6873a2ef8","resolution":{"observed_at":"2026-08-03T13:53:26.173751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-03T13:29:50.876590Z","title":"Hi robot: Open- ended instruction following with hierarchical vision-language- action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-04T11:27:48.952895Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:50.876590Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:4b95f0c614b72f7f1471d2e53737c51102a071eca93ca43bdc58411869b4d422","observation_id":"365ffa90-3b94-405a-86ff-ebdf9eb7ff8a","resolution":{"observed_at":"2026-08-03T13:29:50.876590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:a9910313b3908deb76764b23f56642b60d3883461bd995a8d60b02730b95af75","observation_id":"aaa2c874-3f2f-45a2-b3a5-7a2ff28b3497","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:825807551162c050abfcac99fb868bc3634d32e7d2a5a59b2203287eead94198","observation_id":"df08cd3d-ce2b-4ff2-87f9-8429a1be6fdd","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T22:14:29.479477Z","title":"Hi robot: Open-ended instruction following with hier- archical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-04T20:00:40.213674Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:29.479477Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:7420a6070ae1ee01dcb0d1539bde2a7d9ea6eee43522f2aa884d2f59f55cd692","observation_id":"8280753a-024f-4345-b561-bdd53e654a5e","resolution":{"observed_at":"2026-08-02T22:14:29.479477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:07fd37b74f6a2c9a7b9bbbac9e0418b7be51064b8f0029865e99f06ed45025e3","observation_id":"845b1f96-7378-41f9-9a69-70a2e694fef6","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2603.14371","last_updated":"2026-05-18T10:25:25Z","snapshot_observed_at":"2026-08-02T15:59:44.938725Z","submitted_at":"2026-03-15T13:23:56Z","title":"OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T11:46:12.134869Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2603.14371"},"observation_digest":"sha256:626498bb9b733f9bc3f6753f648a2456ee08a4f6a4de5c22883beefdb33aea48","observation_id":"f8280362-d1e6-47af-8c7f-4634cf54b711","resolution":{"observed_at":"2026-05-21T11:50:03.915325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2603.22003","last_updated":"2026-05-09T06:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-23T14:08:58Z","title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T00:54:36.125258Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2603.22003"},"observation_digest":"sha256:3f203e7e71a7f63daabc3db77864d9f886137d484e53088cecd3b0370d90bb5e","observation_id":"4c4d5b42-98b8-475f-84eb-a87a98d54db9","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-13T19:50:50.950451Z","title":"X., Ichter, B., Equi, M., Ke, L., Pertsch, K., Vuong, Q., Tanner, J., Walling, A., Wang, H., Fusai, N., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23117","last_updated":"2026-06-01T08:02:23Z","snapshot_observed_at":"2026-08-04T07:57:16.483761Z","submitted_at":"2026-03-24T12:14:12Z","title":"TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T19:50:50.950451Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2603.23117"},"observation_digest":"sha256:4e2d57527800e0642d43c153ed0f579b91e3a369cb6293b16a756ac8e0c1d540","observation_id":"8d42439e-13a1-4b76-bead-14d28d5b7f3c","resolution":{"observed_at":"2026-07-13T19:50:50.950451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2603.25044","last_updated":"2026-03-30T07:44:33Z","snapshot_observed_at":"2026-08-02T12:22:24.189474Z","submitted_at":"2026-03-26T05:26:56Z","title":"ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T00:46:03.360770Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2603.25044"},"observation_digest":"sha256:2252211d05ffea8859fae394fb8ff8288453965a7953a515a4af09b46299f01d","observation_id":"914c24af-428e-41b4-9f11-03491d3bdce8","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.02786","last_updated":"2026-04-03T06:50:49Z","snapshot_observed_at":"2026-08-04T22:14:44.457603Z","submitted_at":"2026-04-03T06:50:49Z","title":"QuadAgent: A Responsive Agent System for Vision-Language Guided Quadrotor Agile Flight","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:36.843013Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.02786"},"observation_digest":"sha256:8d12571034f4f17915b919c9a6e04bc00f1487a8262049a6639dc7f60ff02547","observation_id":"aaae5352-3537-4fdb-ae78-25a238d7d4da","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.05320","last_updated":"2026-04-23T03:28:42Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T01:46:55Z","title":"ExpressMM: Expressive Mobile Manipulation Behaviors in Human-Robot Interactions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:55:47.280663Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.05320"},"observation_digest":"sha256:66868bb483293a210de5640811ef26abf13c45afaec21827878dc768b3866400","observation_id":"0fdc938a-94b4-4552-97bf-2c04e541adda","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:3fe7bc40dc5b12c774886f3712ec7c7c7a6d3f481ddd85c5ef0d18fe9b47d203","observation_id":"d1e66d14-0647-467b-bcf8-ebe8b6400adb","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.10432","last_updated":"2026-05-29T07:09:23Z","snapshot_observed_at":"2026-07-30T10:07:12.774748Z","submitted_at":"2026-04-12T03:09:44Z","title":"AnySlot: Goal-Conditioned Vision-Language-Action Policies for Zero-Shot Slot-Level Placement","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:41:28.529494Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.10432"},"observation_digest":"sha256:9005c505023124b65bb6412bcee32faf0b892dd28edddff61802425bd55767ba","observation_id":"4fbe1e40-b620-4f53-b54e-1362db033d34","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:01:50.429917Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:6501ec7b99a49801d96fecb0e00c709a882f6dcb056ee156b6637617a517d503","observation_id":"a3bed610-9656-41fd-a8be-9408cbc8ec84","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.14125","last_updated":"2026-05-10T14:25:46Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:50:07Z","title":"HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:51:46.849464Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.14125"},"observation_digest":"sha256:3fd15211b206ef15d7d2997ccd2e76e6ad9de0906c9c05550c36c6e0946127f1","observation_id":"1ac999ca-3d36-4ac7-9d26-60f8d00ab776","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T11:42:34.409651Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.15483"},"observation_digest":"sha256:f8b34e51661cfa46748cc092bfc3e147629317d23f9a5612920744eef326ad2e","observation_id":"cbc1d3c1-e7c9-43dc-8af6-2acac9628246","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2604.24447","last_updated":"2026-04-27T13:12:16Z","snapshot_observed_at":"2026-08-02T20:38:02.984524Z","submitted_at":"2026-04-27T13:12:16Z","title":"Characterizing Vision-Language-Action Models across XPUs: Constraints and Acceleration for On-Robot Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:04:46.460069Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2604.24447"},"observation_digest":"sha256:7722373d3ef985a405a92cd40d84c729c6200e01761ab9cd48c255cfe9cecae7","observation_id":"803aa985-99d7-4029-ade5-a4f87932ccd6","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.07465","last_updated":"2026-05-08T09:13:12Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:13:12Z","title":"SEIF: Self-Evolving Reinforcement Learning for Instruction Following","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:09.514927Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.07465"},"observation_digest":"sha256:79a62ada5bf4265aa18f19e8db61dcbdbb14a12638850eba7c70968063706ef8","observation_id":"169523e9-0d5a-4408-bb95-d5d2eea44f0b","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:a7c85595e191862afb6fa6aec53a2794ab87d88e785170479d3bf0f9cf3c1caa","observation_id":"8ca4eef0-e1bd-4d8f-92e3-b750f6589665","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:35:22.595183Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.13119"},"observation_digest":"sha256:4c9928ac9b529d142478cf9c8dd0e5df5e675b1d0d6045c3ced70f61e871d8a1","observation_id":"62c97075-5d5e-4478-8c9d-5416001a01c2","resolution":{"observed_at":"2026-05-15T22:53:37.470313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:718c96bfcb0e87e0417d80f508850f9d1f7ffba0aeac8356042870c9188c8c83","observation_id":"2bae7c3c-2551-4290-b2f1-fa36352554a7","resolution":{"observed_at":"2026-05-20T12:43:16.954611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.17522","last_updated":"2026-05-17T16:11:22Z","snapshot_observed_at":"2026-08-02T10:06:26.951786Z","submitted_at":"2026-05-17T16:11:22Z","title":"RoboFlow4D: A Lightweight Flow World Model Toward Real-Time Flow-Guided Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T12:34:11.744980Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.17522"},"observation_digest":"sha256:aaab1ca213a76a90c9954303ccb63a07d3537c78faa21f108f0078af39a313e5","observation_id":"94237870-196e-4dcc-b8eb-663c8804ea3b","resolution":{"observed_at":"2026-05-20T12:38:17.018853Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:ae1d9065ac4326db8b9ef5e0e71877762caa3fb54f16a2e892e5e90f94bdf61e","observation_id":"a4f803d9-cfcf-4bf1-939a-a1b638b79833","resolution":{"observed_at":"2026-05-22T05:31:08.115243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.22812","last_updated":"2026-05-21T17:57:44Z","snapshot_observed_at":"2026-08-01T15:37:49.036384Z","submitted_at":"2026-05-21T17:57:44Z","title":"GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T04:51:21.649138Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.22812"},"observation_digest":"sha256:409ea4cdeef0286fca7e24e50590779be00c3935a03e656b36f7051fe138eaa6","observation_id":"e5551921-f9cd-43d0-8029-9bf34b16985f","resolution":{"observed_at":"2026-05-22T04:54:36.746142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:7c14d8e69dcd768c787075a0879899362c137510f948bc66249cd10ec5b61159","observation_id":"68737d5f-53ef-4b44-a07f-3738098b9817","resolution":{"observed_at":"2026-05-22T04:46:04.531661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-02T22:10:19.505273Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:e52a3b121d72affd67e7028000f0904ac077bee3395f717f0190c674c0f242a8","observation_id":"779e8078-d37b-4970-8c9b-3f1d3416e2f6","resolution":{"observed_at":"2026-06-29T21:33:58.968708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.30877","last_updated":"2026-06-01T02:49:15Z","snapshot_observed_at":"2026-08-02T17:03:10.577295Z","submitted_at":"2026-05-29T06:04:03Z","title":"Wall-OSS-0.5 Technical Report","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T22:35:00.258436Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.30877"},"observation_digest":"sha256:ffdef7b0c8694bab92ac3ed552206bace02f2e7ab7f112e40a54503dd835213c","observation_id":"77cfea7c-fdc1-4b5c-936a-9945994b8735","resolution":{"observed_at":"2026-07-01T19:26:00.445957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.02735","last_updated":"2026-06-08T17:19:24Z","snapshot_observed_at":"2026-08-04T14:14:05.900644Z","submitted_at":"2026-06-01T18:02:07Z","title":"See Less, Specify More: Visual Evidence Budgets for Generalizable VLAs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T14:04:43.270155Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.02735"},"observation_digest":"sha256:b92fbde16186e93399ff6816ee928f7b04f01037dd1db59c8504080feef27be3","observation_id":"18b87252-64d6-4bd0-b933-da0bb49959bf","resolution":{"observed_at":"2026-07-01T23:36:24.052646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.03784","last_updated":"2026-06-03T08:29:49Z","snapshot_observed_at":"2026-08-02T17:48:25.989693Z","submitted_at":"2026-06-02T15:37:59Z","title":"Revisiting Embodied Chain-of-Thought for Generalizable Robot Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T09:40:04.685274Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.03784"},"observation_digest":"sha256:9f8a159871047cab00188c8de5d199a108285d947deaa5cd8e090e95c0accf5f","observation_id":"ec7e2c67-ad2a-4736-af5a-65a820c2e7d4","resolution":{"observed_at":"2026-07-02T03:46:33.253997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:be77573e0f7301c2b9d4b2c1afcc26f240f8970a1ae80d3220045fd6f23361a0","observation_id":"a08dcb0d-ee6a-48a8-a674-d42812e1e26a","resolution":{"observed_at":"2026-07-02T13:16:59.247183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T22:25:17.522240Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:62f50b1ddc44af176a60c3d052030483188da1976291950cd2dfb802a7807946","observation_id":"6c0a7078-71da-49a4-a094-a0129b447742","resolution":{"observed_at":"2026-07-02T16:47:09.455277Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.07100","last_updated":"2026-06-30T09:11:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T09:51:25Z","title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T07:17:42.045939Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.07100"},"observation_digest":"sha256:9fc349a5a8577c8c345bf9d17138b75acc72f8b360d97617ee14519b5da4a065","observation_id":"0e6af7fd-a55f-4de5-9cb1-0f59b107e7ef","resolution":{"observed_at":"2026-07-01T08:35:34.455697Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.07723","last_updated":"2026-06-05T16:21:27Z","snapshot_observed_at":"2026-08-02T03:37:35.733251Z","submitted_at":"2026-06-05T16:21:27Z","title":"VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:00.330510Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.07723"},"observation_digest":"sha256:6442310ae2747c86243ecfe18425e1a93c8c768941535848a4d8ef06eef01f16","observation_id":"24baadb7-8a8e-4df9-b1ed-9da6f6426033","resolution":{"observed_at":"2026-07-02T19:07:18.185116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.10267","last_updated":"2026-06-09T00:24:00Z","snapshot_observed_at":"2026-08-03T01:41:20.917317Z","submitted_at":"2026-06-09T00:24:00Z","title":"What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:36:56.552395Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.10267"},"observation_digest":"sha256:6bffdb1cbce929159d7a8453a02e7100761263cc0b2dfb2e8f2ac85a653b73cf","observation_id":"f2a8c76a-05f9-48db-b3cb-bbd976b06c7b","resolution":{"observed_at":"2026-07-03T04:47:38.578601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.11151","last_updated":"2026-06-09T17:36:06Z","snapshot_observed_at":"2026-08-02T18:20:53.777829Z","submitted_at":"2026-06-09T17:36:06Z","title":"JOIN: Anchor-Grasp-Conditioned Joining via Opposition, Inference, and Navigation for Bimanual Assistive Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T12:59:50.106598Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.11151"},"observation_digest":"sha256:6d568abd29785cbd83f94942b3a76ff82c6da7230a03bf5e695b8fc655163527","observation_id":"3a5f5cd2-023a-4867-ba6e-dbea9522f1a8","resolution":{"observed_at":"2026-07-03T05:57:41.724633Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.12402","last_updated":"2026-06-10T17:58:49Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T17:58:49Z","title":"DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T09:42:17.813126Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.12402"},"observation_digest":"sha256:1d3fbbb75ac24ac4116fe8bfee67f300ee53190c578ba9c1bd19384e4f28b10c","observation_id":"b37a4ce4-6dba-415e-8231-3a56c7c229f3","resolution":{"observed_at":"2026-07-03T11:08:03.023092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.12475","last_updated":"2026-06-10T05:42:49Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T05:42:49Z","title":"Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T09:57:14.119334Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.12475"},"observation_digest":"sha256:9f3081116b062da5fdbcfb5d4f12e9c8d448419afa623630416ed3b0a00c3a10","observation_id":"9f2d1c0b-67d9-4d20-a339-c72d382858a1","resolution":{"observed_at":"2026-07-03T10:37:56.654045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.13053","last_updated":"2026-06-11T08:35:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T08:35:37Z","title":"EA-WM: Event-Aware World Models with Task-Specification Grounding for Long-Horizon Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T06:22:27.987539Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.13053"},"observation_digest":"sha256:983622c20de1db78c1e8bc91165b5c341c2a0d599cb1d378493cc947cd94fde3","observation_id":"7c71fc48-fff0-4613-b4d9-bb17fba5cccf","resolution":{"observed_at":"2026-07-03T15:48:35.303669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.17046","last_updated":"2026-06-22T21:44:31Z","snapshot_observed_at":"2026-08-02T21:41:56.182346Z","submitted_at":"2026-06-15T17:58:03Z","title":"Geometric Action Model for Robot Policy Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T03:59:17.983035Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.17046"},"observation_digest":"sha256:2b4c25c0156c954a8ace7ee8ca7d31ea9b5389b79bd412fca2d2c10bb514d26c","observation_id":"5eb0afc2-384a-4880-b56d-4c8d8b945008","resolution":{"observed_at":"2026-07-03T17:38:43.878770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.20562","last_updated":"2026-06-18T17:59:51Z","snapshot_observed_at":"2026-07-06T23:55:43.830896Z","submitted_at":"2026-06-18T17:59:51Z","title":"MemoryWAM: Efficient World Action Modeling with Persistent Memory","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T17:00:43.138441Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.20562"},"observation_digest":"sha256:c49d4d66dc21d923c1e32ed9bf9a22e501e3919d314295662d452a0a29cd9614","observation_id":"07ad6dc1-1fd3-4a4b-8233-9b1ee89c5903","resolution":{"observed_at":"2026-07-04T04:29:34.822739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.24884","last_updated":"2026-06-23T17:59:01Z","snapshot_observed_at":"2026-08-02T14:15:11.008887Z","submitted_at":"2026-06-23T17:59:01Z","title":"InSight: Self-Guided Skill Acquisition via Steerable VLAs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T00:10:51.721485Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.24884"},"observation_digest":"sha256:36ee9e00efe386b124f2435d4dbaed232c5aa142f3f3402325af6e0b5e47212f","observation_id":"86462f29-4896-4aa8-b206-0689bac539ce","resolution":{"observed_at":"2026-07-04T16:49:58.295928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.26443","last_updated":"2026-06-24T23:13:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-24T23:13:56Z","title":"WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T01:10:24.450509Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.26443"},"observation_digest":"sha256:9fe0e31aeaac9363ea09277d29847895492ae9d0cf9998e7bb39b388c488eb4c","observation_id":"3c84ee17-17b2-4b28-8d4a-dd6466e08a7d","resolution":{"observed_at":"2026-07-04T15:59:56.659449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T04:41:13.473022Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:83a130b7bb4a59de1a00f04742cf31ee93f0b0a04864b8096afe195920d301a3","observation_id":"1aec08bd-09df-4cc8-bd44-2cb15d2ad425","resolution":{"observed_at":"2026-07-04T13:59:52.647202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.27295","last_updated":"2026-06-26T13:05:58Z","snapshot_observed_at":"2026-07-07T00:01:29.987067Z","submitted_at":"2026-06-25T17:13:02Z","title":"LA4VLA: Learning to Act without Seeing via Language-Action Pretraining","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T04:38:02.797595Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.27295"},"observation_digest":"sha256:f9aea98f7acb1ce7db6289dd5da6d7344f4df5632758e33665515e73dff53147","observation_id":"1889901c-8948-4a31-aea5-a829b69fad20","resolution":{"observed_at":"2026-06-29T19:53:56.078322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2606.31958","last_updated":"2026-06-30T17:00:33Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:00:33Z","title":"Adapting Generalist Robot Policies with Semantic Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-01T05:09:29.625066Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2606.31958"},"observation_digest":"sha256:534d64ddb05cffc9f1c0c81b7c6bf900dc4c4cbc2e07830997f35df8c718faaa","observation_id":"13f5f1f1-e77e-46a0-bf46-4186c37f3ffd","resolution":{"observed_at":"2026-07-01T10:45:42.746779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T10:37:31.925624Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:237e6efbef74fc54cceccb5b76473978cea29ee12908df7e9fe79bed40463f73","observation_id":"a2fae6f9-0aae-4919-90a1-65721e2ed10f","resolution":{"observed_at":"2026-07-03T10:37:56.102497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-12T08:00:25.815355Z","title":"HiRobot: Open-EndedInstructionFollowingwithHierarchicalVision-Language-Action Models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T08:00:25.815355Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:d18b6b0524def09d070eff8d5f134ed73ac5ef15d24a12befe24fc69075cc824","observation_id":"d0f7b84b-c647-4728-b060-0a6ad9b24bba","resolution":{"observed_at":"2026-07-12T08:00:25.815355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2607.07076","last_updated":"2026-07-08T07:08:11Z","snapshot_observed_at":"2026-08-04T07:44:41.493457Z","submitted_at":"2026-07-08T07:08:11Z","title":"PriGo: Test-Time Primitive Guidance to Diffusion and Flow Policies for Adaptive Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T20:38:38.404267Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.07076"},"observation_digest":"sha256:343e5ec93f68dba1521c11864183aa6effde2dbfe1a773d54cd135514159f263","observation_id":"6f0e86ae-3c9b-41fd-8caf-88eccfd4a26b","resolution":{"observed_at":"2026-07-09T20:46:33.633766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-02T07:53:29.177178Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:d7dfe718c04a2cfe75078ba91d56912ccf06fc26327c833b9ee5568858fa8891","observation_id":"f57cc924-132f-4cb7-af06-bdc38b5474cb","resolution":{"observed_at":"2026-07-10T04:16:48.656424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:53:40.859548Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-02T07:53:29.177178Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:40.859548Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:28c1df311ed618f135b235c3322d5e12ca8d5b0fe5cc45b9f85aa66d1c5000f3","observation_id":"7743bd04-6843-40a3-9be4-6d6e366a7489","resolution":{"observed_at":"2026-08-02T07:53:40.859548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:f8065a34b3c547b4ed7875bc1cc2e1989dbb013c52ad540a7bd000b7b8ec6852","observation_id":"93d8a16a-d707-4932-9130-093735406ff1","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:21:30.948050Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:30.948050Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:31e934d1c241e09dea8c08d6239e5b3a0e0258efba819682e3279ca2fcc75e58","observation_id":"4f636bde-a806-42f0-a043-33e6e6a357e0","resolution":{"observed_at":"2026-08-02T07:21:30.948050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:de70b001ead9ed9161205f2f57500fdd4f171217e3b32ed53c81d437e867a5ac","observation_id":"73da70a0-e6e0-4e29-a36c-c75fc076fc8a","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-02T07:19:41.156501Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:41.156501Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:ae7adf9902d0093eb5cfc2aa032d457fcdc2cad0a13014b899241377e01aaa10","observation_id":"7cadf22a-03b2-4143-8bf3-e1a1e5b5c8d7","resolution":{"observed_at":"2026-08-02T07:19:41.156501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-01T22:05:04.115994Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15898","last_updated":"2026-07-17T12:12:33Z","snapshot_observed_at":"2026-08-03T14:17:56.587198Z","submitted_at":"2026-07-17T12:12:33Z","title":"Orbis 2: A Hierarchical World Model for Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T22:05:04.115994Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.15898"},"observation_digest":"sha256:d4f46cfbd25c8421ffa1678dc18d0ae6ab1b5f99b4ddc7147b8c30ab30581227","observation_id":"7180c7de-5691-43d7-af8f-814f712160f4","resolution":{"observed_at":"2026-08-01T22:05:04.115994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-01T16:19:09.606067Z","title":"arXiv preprint arXiv:2502.19417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18060","last_updated":"2026-07-28T09:02:58Z","snapshot_observed_at":"2026-08-04T00:58:02.081242Z","submitted_at":"2026-07-20T15:27:13Z","title":"RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning","version":2},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-01T16:19:09.606067Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.18060"},"observation_digest":"sha256:032db3fc33b853fd31ba8794b1ad020652be3ce89e8fa3facdb69dc80f14876c","observation_id":"bfeedb94-76f1-423e-9cad-4ba9dee30d3b","resolution":{"observed_at":"2026-08-01T16:19:09.606067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-01T14:39:52.439334Z","title":"arXiv preprint arXiv:2502.19417 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":241,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.439334Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:80284ab463cf3c2f80cfcb7e035b37602d9449804b110fd6b1a5803b04787a7b","observation_id":"191f28b7-9290-4e84-ac84-0a4f29b1a1d5","resolution":{"observed_at":"2026-08-01T14:39:52.439334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-01T06:55:48.334745Z","title":"Shi et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21725","last_updated":"2026-07-23T18:18:32Z","snapshot_observed_at":"2026-08-05T06:28:52.756752Z","submitted_at":"2026-07-23T18:18:32Z","title":"Addressing the Orchestration Gap in Generalist Robots via Physical Agency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:55:48.334745Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2607.21725"},"observation_digest":"sha256:adaae2dd44d7be09ab7bfa3ae780807db274aabecb3a738c97e4838a4b12f5a3","observation_id":"704dceff-fb85-414a-bc98-3db68466de4c","resolution":{"observed_at":"2026-08-01T06:55:48.334745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.19417/citation-record","integrity":"/paper/2502.19417/integrity","json":"/paper/2502.19417/citation-record.json","paper":"/paper/2502.19417"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":"2403.01823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-07-10T14:37:16.092859Z","title":"RT-H: Action Hierarchies Using Language","venue":"cs.RO","work_id":"ecf7cf18-c1a8-4a6b-bc2a-fb165643aa0d","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:8bbe86c5f9a3a27509dba704c4fa60d0c657397280762fde784d58ebb0bb4ab3","observation_id":"1a958c7d-c056-49bb-94b6-790021a569e6","resolution":{"observed_at":"2026-05-17T06:53:27.953855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:6af1ea1fd363c909aa0d3c4ab3617c07659579dbe3fb6b73f789f6afbb1718eb","observation_id":"ec2d3a1c-da81-46e2-b3aa-fa771f7aa19d","resolution":{"observed_at":"2026-05-15T22:53:37.179006Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:3c67899037a09d22bd3995f52dbc8970b6af9835a32788f5202120dfbded109d","observation_id":"2d4f3a82-d24f-407b-9751-e0f38e9fdf9e","resolution":{"observed_at":"2026-05-15T22:53:37.185946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:9646339500a5a6d06234fc695ec537867ffb47ef39b6cc924e42e1f489c0e413","observation_id":"94388843-6dc1-4022-8ce5-4f4fb8f9dd76","resolution":{"observed_at":"2026-05-15T22:53:37.192807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:77d9a7c270ae27d7188b80370e2eee5c601a0cffce7fc82c7eb4e84fd9b958ef","observation_id":"95d55974-f9f6-4a4d-918f-621136103741","resolution":{"observed_at":"2026-05-15T22:53:37.199637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":"c3248291-633a-476d-888e-10093cf0f359","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:28c4afd6a4751ce77608560861145223fe6ba17998c51ad7704b39c476b9278d","observation_id":"3816f3b5-fb3e-472e-ac94-41b7b1b5ec31","resolution":{"observed_at":"2026-05-15T22:53:37.397186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03966","last_updated":"2024-09-06T01:29:35Z","snapshot_observed_at":"2026-07-06T19:11:18.410415Z","submitted_at":"2024-09-06T01:29:35Z","title":"Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts","version":1},"cited_work":{"arxiv_id":"2409.03966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03966","snapshot_observed_at":"2026-07-03T01:17:30.743384Z","title":"Automating robot failure recovery using vision-language models with optimized prompts","venue":null,"work_id":"d854d08b-8c6f-4189-9ef1-ef4571912927","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2409.03966","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:f3919b04c5b05c942ff75c6f4cfd31a68b566ba49b107b8413f3bc2e8a417bdd","observation_id":"0735a5b0-3d82-4339-aa7b-ff4c591293fa","resolution":{"observed_at":"2026-05-15T22:53:37.329808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"f967fa5d-acdb-4cfa-b7c8-9613a5dae2a4","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:bebc154a0e0e826521a8a8ad0acc7f5dc1a14c62c41454bfdca0c280c9171233","observation_id":"0823afd3-d37d-46ce-a7af-e0e517a8bbec","resolution":{"observed_at":"2026-05-15T22:53:37.406335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14674","last_updated":"2024-09-23T02:50:33Z","snapshot_observed_at":"2026-07-06T19:19:37.350445Z","submitted_at":"2024-09-23T02:50:33Z","title":"RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning","version":1},"cited_work":{"arxiv_id":"2409.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14674","snapshot_observed_at":"2026-07-03T01:17:30.820365Z","title":"Racer: Rich language-guided failure recovery policies for imitation learning","venue":null,"work_id":"48d53cee-481d-4db9-859b-6dee6dac2d8b","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2409.14674","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:6f3d3e0786aa1467d0229e01633235debaccd0169f07beb43dc15e881c952f48","observation_id":"651dd099-c50c-4915-83a2-5fefd5a8cb12","resolution":{"observed_at":"2026-05-15T22:53:37.337900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:124a5654e8de38752877798bbae3f904eb9259d86e669885b6d9a6848ce81237","observation_id":"2a3ad65f-e7ed-476b-b96b-4df071b5b615","resolution":{"observed_at":"2026-05-15T22:53:37.344281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":"2401.02117","doi":"10.48550/arxiv.2401.02117","metadata_source":"pith","pith_arxiv_id":"2401.02117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","venue":"cs.RO","work_id":"5f6ff8ef-ed80-4c00-92c2-361c80bf8448","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2401.02117","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:01111be781af00083faa6ca7f02225b169dad7bf2cce835e6d6ba8f2151b7d22","observation_id":"a8b1fd37-20ca-4377-a929-ac09c1984afb","resolution":{"observed_at":"2026-05-15T22:53:37.350550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-04T14:38:08.722883Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":"2311.17842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-07-10T23:07:47.839412Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision- language planning","venue":"cs.RO","work_id":"3a36cb18-2858-403a-b51b-66e98d943052","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:4ae72842f13d9e2455a7efa44873f554e10bbfcbda6fc4b4b25d6180f1afa1f4","observation_id":"4d482576-0e4f-46c0-b471-50f0e5da1b27","resolution":{"observed_at":"2026-05-15T22:53:37.357899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"be67ae36-02b1-47cb-a385-752256c9d025","year":2022},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:a4c8a2e1173278c26f64b014ac7be32b4a2239b25f72686094477f218987dee9","observation_id":"6ddefe39-adc7-40b4-9a91-13b71d5082e1","resolution":{"observed_at":"2026-05-15T22:53:37.426870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":"2307.05973","doi":"10.48550/arxiv.2307.05973","metadata_source":"pith","pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","venue":"cs.RO","work_id":"5a5edf95-2538-4e2b-8dfa-da39cec89f22","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:3fd8de76f06228189c507311ccb630b8f37955f8c6c0fe492d57915004406bce","observation_id":"c3105b97-d7d5-4263-85bf-d9cd826e7546","resolution":{"observed_at":"2026-05-15T22:53:37.364907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":"e10ebb99-ccfd-44b5-b788-fb58de3ed0fb","year":2022},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:bafc78fc0cee7709bb271727c0fdf011daa12bd772fd63bc6c93a5408b7a7cd4","observation_id":"e04c1e3b-a2cf-4f0b-bd4d-66d15c54f904","resolution":{"observed_at":"2026-05-15T22:53:37.435427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking, fast and slow","venue":null,"work_id":"91cbbc52-9258-4ecc-96f6-eae26ca04cfa","year":2011},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:fe307140b0aabf11dcd6157a4bc42e0faa82ff463df59e4eb64d6bd9b9834fb2","observation_id":"40e4c502-03cb-4713-af37-3a070f5a52e3","resolution":{"observed_at":"2026-05-15T22:53:37.439459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:617b0485faa46cfea530487ad1b07f403991dba3e24bfa5082be71e8f3e15fc7","observation_id":"99c0666b-25f3-436a-987a-25319cdc5d3f","resolution":{"observed_at":"2026-05-15T22:53:37.371736Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10645","last_updated":"2025-02-08T20:22:08Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:59:12Z","title":"Interactive Task Planning with Language Models","version":2},"cited_work":{"arxiv_id":"2310.10645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10645","snapshot_observed_at":"2026-07-04T10:49:46.311734Z","title":"arXiv preprint arXiv:2310.10645 , year=","venue":null,"work_id":"6a9f0b01-70ff-45b5-ab4d-6ad5f270d798","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2310.10645","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:4081b01ffc890202ae9e81108bb14b49046bd69d5b9cfa81f0c04acc9747e0ad","observation_id":"73eb7159-c35f-4db8-9ae0-51c67852d8a4","resolution":{"observed_at":"2026-05-15T22:53:37.379054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:b3df7015b39e4b230309c3c997b13ea07bf224f5434909f7a11f05c06c3a04e7","observation_id":"6d7b5753-3a88-4cf9-ab63-0a5e52d7584a","resolution":{"observed_at":"2026-05-15T22:53:37.385552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-07-06T20:33:15.472157Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2502.05485","doi":"10.48550/arxiv.2502.05485","metadata_source":"pith","pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hamster: Hierarchical action models for open-world robot manipulation","venue":"cs.RO","work_id":"f39a927c-66ea-4ef7-9099-acdb4855f6fa","year":2025},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:ae80b7797d2812e0bc76e2c01371948a0c7d009649308152044911c034eb886c","observation_id":"5b7af09a-3387-4883-a626-7e73b7d4fa0c","resolution":{"observed_at":"2026-05-15T22:53:37.392536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":"4391bee9-8e14-4a02-b62a-803634d8947e","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:921bd8984caa5ddfa837cda53749440228c64e173dafe93b07118b26f9b596ce","observation_id":"18c5638a-d462-46c1-80e2-db4b451f5212","resolution":{"observed_at":"2026-05-15T22:53:37.460513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":"faa0bc48-9690-4c90-a0ed-aab2812ab8a9","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:4cb42d4b7bc649c381dbb16a797def828c918210e003f39f93824e1ad1645ed5","observation_id":"95b78ed9-22bd-41c2-92f6-696ba21c9402","resolution":{"observed_at":"2026-05-15T22:53:37.464763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17555","last_updated":"2023-10-26T16:46:12Z","snapshot_observed_at":"2026-07-06T16:39:04.459332Z","submitted_at":"2023-10-26T16:46:12Z","title":"Interactive Robot Learning from Verbal Correction","version":1},"cited_work":{"arxiv_id":"2310.17555","doi":"10.48550/arxiv.2310.17555","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2310.17555 , year=","venue":"arXiv (Cornell University)","work_id":"9cdb92ae-3c01-41e6-81f2-296743736a66","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2310.17555","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:664ed9bb0c9417d32ff01ae2c31b3fe5d14c4bcbcacdc545fde26a00bd7c7776","observation_id":"2d7d0f23-c3b9-433b-ae0b-928593ef3915","resolution":{"observed_at":"2026-05-15T22:53:37.205688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-04T04:35:05.950904Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":"2401.12202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-07-04T17:09:59.559023Z","title":"OK-Robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":"0ed6249b-7e12-4a76-b290-b7493420d577","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:2793291a4b0b66af41a1734a408a0c4008aff719d4a6c176f971c5c5b6f73a59","observation_id":"8568d71b-1d54-41f3-8620-7868421ca1eb","resolution":{"observed_at":"2026-05-15T22:53:37.212576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:5aaa04514065fc4c997d627df61aec0306f3cad39fef5d36ec7f5dc8d0500f76","observation_id":"e33e9e85-65d1-4061-a93a-d09867759e79","resolution":{"observed_at":"2026-05-15T22:53:37.219528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Hutter, F","venue":null,"work_id":"7697a5b3-7fe9-4eb6-9ede-ffe5e5d19a3b","year":2017},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:da9017d67ca815b698b014b7a2176bd64405d381d58d17c168e7781fd4be152b","observation_id":"9d8d0d14-e00a-45de-b9d8-2643144fb1f6","resolution":{"observed_at":"2026-05-15T22:53:37.414665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to parse natural language commands to a robot control system","venue":null,"work_id":"f3dce836-cb14-4210-9d41-bf545047dd78","year":2013},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:aca97f1789cdbfe0f8e82debb5441fe25e5f3807b01cb5ea61119d645ccf048a","observation_id":"ec7e8029-ce24-4e92-b52c-fa52778d9631","resolution":{"observed_at":"2026-05-15T22:53:37.418645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is feedback all you need? leveraging natural language feedback in goal-conditioned rl","venue":null,"work_id":"65fdf369-3f6b-4005-ac5e-983f464e2e59","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:8309ad8f3f9159ae380e97080454c825e3a0c719289a575f3d12a7b99a8d6ecd","observation_id":"75c4a7f8-2f7b-45b6-9803-2473cf569ca7","resolution":{"observed_at":"2026-05-15T22:53:37.422712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning neuro-symbolic programs for language guided robot manipulation","venue":null,"work_id":"88ede09d-da59-4ff1-bd3b-4abc81c39041","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:82755e6291722b9608e0881cd7f525751c7d1de286d420cdbc28cb820d80f25b","observation_id":"32563067-76a8-4493-b945-b2997a98e215","resolution":{"observed_at":"2026-05-15T22:53:37.430904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":"2402.07872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-07-04T20:00:08.793749Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":"9bdbd928-061c-41e7-86fb-f0f2df7fd286","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:787ef06aaf39aac00dd05e01194b6a2343eb64dec716a3d10da9f23b7f3e1d5b","observation_id":"bac584d5-64b5-4b8d-85e2-2279e245f1fa","resolution":{"observed_at":"2026-05-15T22:53:37.226372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y., Sanketi, P., Vuong, Q., Xiao, T., Sadigh, D., Finn, C., and Levine, S","venue":null,"work_id":"0388e4ef-21b2-4386-8020-5c39287ed204","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:0d4c36e94b0c26c627a5db5b0d443ccc8930f1ae06a783d1a0d85a12e8bbb91e","observation_id":"f2a38f43-56c5-4fe6-a3f4-7edf90c441e7","resolution":{"observed_at":"2026-05-15T22:53:37.447769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":"06a132db-6c6d-49b6-b496-10c6a45d2284","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:07591f14d51f31af1d15be3164af9ea5398168ee5a3a0c44b1198a90b526ed1b","observation_id":"c6b3ef52-bd69-48ec-ae3c-d33268d8bd1f","resolution":{"observed_at":"2026-05-15T22:53:37.452474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"F., Walter, M","venue":null,"work_id":"e6ec97cc-703c-4ed8-93d2-9f4f19b8a2a4","year":2019},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:329bc690b5f870732744b19b79ffcd3c7789a97525e029eed57a42db565aab69","observation_id":"ae395392-7a19-4573-8fa2-838f1232e18a","resolution":{"observed_at":"2026-05-15T22:53:37.456387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:1b15058201f006fc8fbe1519c9a12a8cb1f5417ba3866ada9399c32ed7402dfd","observation_id":"432d5666-6801-4c84-88bc-4e89fa89b527","resolution":{"observed_at":"2026-05-15T22:53:37.233298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18115","last_updated":"2024-06-26T07:06:42Z","snapshot_observed_at":"2026-08-03T22:24:48.402918Z","submitted_at":"2024-06-26T07:06:42Z","title":"Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps","version":1},"cited_work":{"arxiv_id":"2406.18115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18115","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-vocabulary mobile manipulation in unseen dynamic environments with 3d semantic maps","venue":null,"work_id":"bd342540-73c1-466e-96e9-4e02f7dc67f4","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2406.18115","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:301a56f95f81632c0ff2d8cf246c7a645d55dc6f5df41b4a14e690a591aab461","observation_id":"641b521d-332a-45b7-b303-32f9ccc3ec5e","resolution":{"observed_at":"2026-05-15T22:53:37.240701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":"7dc179b9-e634-48c5-aac0-a8a43617bac4","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:7e1514d36dcffe14189d52196a947595a8888ffc3700f12f61f6e71965ca7c2e","observation_id":"80222e84-084d-4b9a-8ddc-af934b1f55a3","resolution":{"observed_at":"2026-05-15T22:53:37.410596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06237","last_updated":"2024-10-08T17:52:29Z","snapshot_observed_at":"2026-08-06T03:12:41.018982Z","submitted_at":"2024-10-08T17:52:29Z","title":"BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bumble: Unifying reasoning and acting with vision-language models for building-wide mobile manipulation","venue":null,"work_id":"2f463d16-11f9-4b5f-9cbe-a563d02b11db","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2410.06237","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:5b275dd778f152a1dc7b3ac8a008e6076ab21e3c2d50d1dd90d54da4a4de690a","observation_id":"19bdf996-31dd-4e97-9e13-67ad52c450de","resolution":{"observed_at":"2026-05-15T22:53:37.247250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-04T09:24:08.528569Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":"2403.12910","doi":"10.48550/arxiv.2403.12910","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yell at your robot: Improving on-the-fly from language corrections","venue":"arXiv (Cornell University)","work_id":"efeb3fdb-ee67-40c2-9c43-c2b12b925654","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:203254bb2aa0ce56c29769701f01dc83d493a54a7f36695e955576c081eff398","observation_id":"6fc61aad-38f3-49f8-97aa-45a6a422476c","resolution":{"observed_at":"2026-05-15T22:53:37.254239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"c02866ae-287f-48f1-a30e-2b44339bccde","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:eb90f1c743d65b049024c85fcb38ad3c1a13e18ff2195cf937376e086f39e467","observation_id":"9ae65d96-6411-495f-8d08-1fa058f87ea2","resolution":{"observed_at":"2026-05-15T22:53:37.401770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05881","last_updated":"2026-07-22T01:32:22Z","snapshot_observed_at":"2026-07-26T17:20:00.969669Z","submitted_at":"2024-06-09T18:40:24Z","title":"Training Fast Robot Policies with Slow Foundation Models","version":7},"cited_work":{"arxiv_id":"2406.05881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05881","snapshot_observed_at":"2026-07-24T00:23:02.532335Z","title":null,"venue":null,"work_id":"103fa3e7-a015-41d7-89cf-83c9aad34c8b","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2406.05881","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:9be14d80e4e612be2d9f0e63dcfdebf1313ecb3596d1975b8e0611583a7d1cf1","observation_id":"3ee2b254-045e-4727-b55f-fe12164054e8","resolution":{"observed_at":"2026-07-24T00:23:02.532335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10893","last_updated":"2024-02-16T18:50:24Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:50:24Z","title":"RLVF: Learning from Verbal Feedback without Overgeneralization","version":1},"cited_work":{"arxiv_id":"2402.10893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10893","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S., Hsu, S., Sharma, A., and Finn, C","venue":null,"work_id":"255672b5-5938-4ac2-af4f-b8d76951f453","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2402.10893","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:54dcae1161d0902c08934cf30fe1c2118d8fa175caec7654e32385f47d98390f","observation_id":"ef5cb244-e53e-4bf8-bc3d-385b39448694","resolution":{"observed_at":"2026-05-15T22:53:37.267277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language-conditioned imitation learning for robot manipulation tasks","venue":null,"work_id":"dab71c35-e903-443c-81d3-7b91fcc50c42","year":2020},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:d8a018a4c0310379c63271b29f41243766dee0cc14633d04b5d19c078a20b6eb","observation_id":"cb1064fc-f406-4c05-916d-f63a04455ab6","resolution":{"observed_at":"2026-05-15T22:53:37.443628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:33f9f6291c98847b3a549cea9fddf1c22e7308cb2589e532e4d37352ead6d22b","observation_id":"ca32e68d-fc72-41e1-957f-8f24fc0e225e","resolution":{"observed_at":"2026-05-15T22:53:37.275383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A computational model for the alignment of hierarchical scene representations in human-robot interaction","venue":null,"work_id":"37606fbc-0938-4379-a613-610ff94de52a","year":2009},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:b3ac6182798fcd69968b95f1de1a3b7c66d8d8a8a5fd673fa9ada9a0edccd539","observation_id":"cc439541-8449-4002-a0cd-3466210e0189","resolution":{"observed_at":"2026-05-15T22:53:37.469021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11552","last_updated":"2024-08-21T09:46:35Z","snapshot_observed_at":"2026-08-02T11:44:59.463472Z","submitted_at":"2024-03-18T08:03:47Z","title":"LLM3:Large Language Model-based Task and Motion Planning with Motion Failure Reasoning","version":3},"cited_work":{"arxiv_id":"2403.11552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11552","snapshot_observed_at":"2026-07-10T13:37:06.907974Z","title":"N., Zhu, S.-C., and Liu, H","venue":"cs.RO","work_id":"b56ac001-6484-4e80-91cb-ff321d8ea29b","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2403.11552","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:ff223087aafa87307271de270f20a83a719cf0506b1e6eca5034d9b9c005818e","observation_id":"0cdda36b-5a7f-4d42-9578-097b375bf7df","resolution":{"observed_at":"2026-05-15T22:53:37.282338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":"2409.12514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-07-04T04:29:35.761670Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"20b3dc32-113f-4f7b-8826-52a8d03fd6b3","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:84e2fdcd0692906d6199cab86a8ad7fadc8bad5795826aa9ca9f8ee1aaae2c51","observation_id":"59ad44b2-61a6-44d4-886a-06fcdd0365a0","resolution":{"observed_at":"2026-05-17T16:12:26.208161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20548","last_updated":"2025-03-10T06:00:08Z","snapshot_observed_at":"2026-07-06T19:24:43.745786Z","submitted_at":"2024-09-30T17:49:09Z","title":"Robi Butler: Multimodal Remote Interaction with a Household Robot Assistant","version":2},"cited_work":{"arxiv_id":"2409.20548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.20548","snapshot_observed_at":"2026-07-08T02:44:27.777852Z","title":"Robi butler: Remote multimodal interactions with household robot assistant","venue":"cs.RO","work_id":"182018b4-ee27-49a7-88dd-a40bd5594960","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2409.20548","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:346bbec895180cbfe70250bbd81a4025fde041615a7963e1fc05b8b2c786447b","observation_id":"b40cdafd-277a-4546-87cc-bc79b45938e1","resolution":{"observed_at":"2026-05-15T22:53:37.296992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":"2407.08693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-07-10T13:37:06.920040Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","venue":"cs.RO","work_id":"bbe96698-686e-4b4a-9f7f-ed5054e61cca","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:a28a9f64ff8b71e19d1e415ff97bbef3a7e0807b93fd88ac2fc23373a9ba2b75","observation_id":"4addb3e2-b222-4426-9475-4765e7396165","resolution":{"observed_at":"2026-05-15T22:53:37.303492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:4e5ade3acca23d21c75d308d8307c1287054504081b1fd2afabdfc1659b55354","observation_id":"2c1b937b-7b89-4beb-a411-74e7fa79e76f","resolution":{"observed_at":"2026-05-15T22:53:37.310049Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-07-06T20:22:23.609336Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":"2501.10105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10105","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal actions for enhanced embodied foundation models","venue":null,"work_id":"2efa306c-e95c-4a8d-965d-f4f79e0c4879","year":2025},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2501.10105","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:5f72ed71191a2c8fca10d2cbcfd9cef88b6a30640c8eb1520989ae840c81dfad","observation_id":"a7db7abc-abe5-4901-8b10-5a40f51ccbb1","resolution":{"observed_at":"2026-05-15T22:53:37.317372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10220","last_updated":"2025-03-07T05:09:28Z","snapshot_observed_at":"2026-07-06T18:00:44.208590Z","submitted_at":"2024-04-16T02:01:56Z","title":"Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V","version":2},"cited_work":{"arxiv_id":"2404.10220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closed-loop open-vocabulary mobile manipulation with GPT-4V","venue":null,"work_id":"9f20a2bc-3a17-422e-8937-8fc645deca60","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2404.10220","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:8c0371685786c4a940cc2d65f70031dfbe3836d3ec466be85a9d3f167af3725a","observation_id":"ce8349bf-d08d-4091-bc0e-9d0ff3388db8","resolution":{"observed_at":"2026-05-15T22:53:37.323534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":18},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 77 inbound Pith citation observations for arXiv:2502.19417."}