{"as_of":"2026-08-08T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b8ea1620921a6811cd783656d0aaecb2b8e6d9244e6c0cee521669a7dc6436d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:53.760420Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:32:20.472823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:03.086630Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:0780c719fa0d216ecfc0fb25933be8226a3970c714b6c8e82a668b3dd5c5ea5b","observation_id":"997d3490-1325-4a65-8c76-7513290a445c","resolution":{"observed_at":"2026-05-17T20:28:16.118267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T22:05:39.797848Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2602.13193"},"observation_digest":"sha256:a7f19d51def5d3b47221fc01e13577d90d7d7ea9958c3d7643efb6e8eb054931","observation_id":"e8d5e4cc-5464-4f4e-af06-f03fa3161f38","resolution":{"observed_at":"2026-05-15T22:06:43.006415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-14T21:59:30.885343Z","title":"arXiv preprint arXiv:2506.00411 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12939","last_updated":"2026-07-10T06:29:36Z","snapshot_observed_at":"2026-08-07T14:59:00.612222Z","submitted_at":"2026-03-13T12:34:26Z","title":"RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T21:59:30.885343Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2603.12939"},"observation_digest":"sha256:da40e29b27e4fb2e0eea4f60db9ad7a8d8551092aecf6f0cdcf679d02269ed06","observation_id":"fec2673b-f60e-44eb-bda3-4d0186d6a3ea","resolution":{"observed_at":"2026-07-14T21:59:30.885343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.02965","last_updated":"2026-04-03T10:55:51Z","snapshot_observed_at":"2026-08-03T01:48:29.110837Z","submitted_at":"2026-04-03T10:55:51Z","title":"Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:17.852646Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.02965"},"observation_digest":"sha256:7ef92de925bb0c7dbf8be37a77fb1f389b366fa9de1242b66f5da0d1c41ac037","observation_id":"828b5d19-bd5e-441f-8931-da55b7502848","resolution":{"observed_at":"2026-05-13T19:48:11.475227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T17:59:48.877783Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:3e1c936771980aac9bab98ba197924dc8a31367ebcc24ca27f23057639630dc5","observation_id":"6dc473a3-1204-429a-bf56-f4debac64faa","resolution":{"observed_at":"2026-05-11T05:41:00.470165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-08-04T05:32:20.472823Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08340","last_updated":"2026-08-03T15:01:45Z","snapshot_observed_at":"2026-08-06T23:31:01.339828Z","submitted_at":"2026-04-09T15:12:36Z","title":"Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T05:32:20.472823Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.08340"},"observation_digest":"sha256:a9002c171cb6ac78cc20d8f97f537bbdb481d0c2e70f1ae2dca933511893a4db","observation_id":"fc4d610d-b7e9-4f44-91bd-fa748b1f2c2e","resolution":{"observed_at":"2026-08-04T05:32:20.472823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2604.17880","last_updated":"2026-04-20T06:48:47Z","snapshot_observed_at":"2026-08-01T03:28:42.182562Z","submitted_at":"2026-04-20T06:48:47Z","title":"ST-$\\pi$: Structured SpatioTemporal VLA for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:21.784769Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2604.17880"},"observation_digest":"sha256:3e1ea864475802fa51c75caa2b32e1b11f824ba968f0f6312e50a7905c4ad5ba","observation_id":"d3e491ca-6df3-4e6a-8276-241a1931768e","resolution":{"observed_at":"2026-05-10T11:40:19.846507Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:35:22.595183Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2605.13119"},"observation_digest":"sha256:f4c827ab1bf5000004d042ab2b6db4558085bf8ffebb47fcfc7ec2b67c3fd23c","observation_id":"e6720793-1822-43d3-89f0-542ec16861f6","resolution":{"observed_at":"2026-05-14T18:37:35.551039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.05660","last_updated":"2026-06-04T03:43:09Z","snapshot_observed_at":"2026-08-03T21:53:08.948703Z","submitted_at":"2026-06-04T03:43:09Z","title":"Safe Embodied AI for Long-horizon Tasks: A Cross-layer Analysis of Robotic Manipulation","version":1},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-06-28T01:46:36.081851Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.05660"},"observation_digest":"sha256:114ee6d33cb18c2f68da28fd5bf3c22926318b4f020f876fa2ad937456b47aeb","observation_id":"fb1f5b37-0eb1-4e8f-8cfb-d3a8159b8376","resolution":{"observed_at":"2026-07-02T12:56:56.738255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.12402","last_updated":"2026-06-10T17:58:49Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T17:58:49Z","title":"DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T09:42:17.813126Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.12402"},"observation_digest":"sha256:14739dba47e452e02becdb33a912ef8f5ae62166c8e9d0b2566eb6ad439e8f5a","observation_id":"402cf453-63ce-463a-b2f4-a06344575e19","resolution":{"observed_at":"2026-07-03T11:08:03.088305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2506.00411","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-07-03T11:08:03.086630Z","title":"Lohovla: a unified vision-language-action model for long-horizon embodied tasks","venue":null,"work_id":"d11a9291-dbcd-4a96-9250-727193cce701","year":2025},"citing_paper":{"arxiv_id":"2606.12497","last_updated":"2026-06-10T13:26:40Z","snapshot_observed_at":"2026-08-05T05:15:21.338433Z","submitted_at":"2026-06-10T13:26:40Z","title":"$\\mu$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T10:50:55.866910Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2606.12497"},"observation_digest":"sha256:dc81c51116385c4132ff133f595de4cc6d94db4fbcceecf78a8aaa39ea8490ed","observation_id":"4e08cc78-0e59-4138-aeab-62b2d17b03af","resolution":{"observed_at":"2026-07-03T08:17:45.702600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00411","snapshot_observed_at":"2026-08-01T12:14:50.679321Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19633","last_updated":"2026-07-22T00:05:00Z","snapshot_observed_at":"2026-08-06T15:14:50.244885Z","submitted_at":"2026-07-22T00:05:00Z","title":"LENS: LLM-guided Environment Simplification for Planning and Control in Clutter","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:14:50.679321Z"},"links":{"cited_paper":"/paper/2506.00411","citing_paper":"/paper/2607.19633"},"observation_digest":"sha256:31bcaa99c9fc86f2e30c00043a429dca238aa02b19e6dc825a750582ce430de9","observation_id":"6307be61-d675-45f9-a719-c1b73bd6ef7b","resolution":{"observed_at":"2026-08-01T12:14:50.679321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00411/citation-record","integrity":"/paper/2506.00411/integrity","json":"/paper/2506.00411/citation-record.json","paper":"/paper/2506.00411"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T12:11:50.402461Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.402461Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f09e16068f5ab0dac1ca07a5bd6e7c99bf39566aef353b8e4077c486b0f2d198","observation_id":"4a2af5aa-9214-4678-b52c-ff461c051d81","resolution":{"observed_at":"2026-08-07T12:11:50.402461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:50.464311Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35: 23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.464311Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:0dff5152cf32c2ba96db019ddf3874b8b008a4d47a880d46d017d90edc06cf7d","observation_id":"a77ad4cb-596c-4755-9d43-0fc6784262a7","resolution":{"observed_at":"2026-08-07T12:11:50.464311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T12:11:50.538884Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.538884Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:93e80fc6f2bb88015892c733b771bdb759a420d0c8571855c4c28e82a42217db","observation_id":"611eeb08-4644-4e15-a778-1ea7082f4471","resolution":{"observed_at":"2026-08-07T12:11:50.538884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-07T12:11:50.638916Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.638916Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f119c1d0adadb78e2e779a3838f15e210b21f786837e2b694a94ead1489d6c88","observation_id":"cff18067-3996-452b-bbe3-4b916fb73641","resolution":{"observed_at":"2026-08-07T12:11:50.638916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T12:11:50.724857Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.724857Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b8a3a6567a02ba092a78e3df1711f73edd163d7e04bf92a8f3ec83c2a3aa4f8b","observation_id":"2625f32f-eb50-44d3-b841-6476248aa767","resolution":{"observed_at":"2026-08-07T12:11:50.724857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:11:50.793559Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.793559Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:9de137d62c8e8231fbc9026ab4eb89beba94fb8f3dd833c8c594c265794b15a1","observation_id":"f68be341-bf14-4d2a-a232-7818b06184ca","resolution":{"observed_at":"2026-08-07T12:11:50.793559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T12:11:50.866410Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.866410Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:dc3daaa0d934de89711a34bb26089256b4704028f9a14e17eda8780daa6cd49b","observation_id":"95deca43-e5e2-464d-9bda-785345e02078","resolution":{"observed_at":"2026-08-07T12:11:50.866410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T12:11:50.945418Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:50.945418Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:d78e7a674ea19bd3a43491653745a84e1c099306adabec2e63cd2c0e09851e70","observation_id":"95e8f96c-6bd4-4f52-ad50-8481b3b626d0","resolution":{"observed_at":"2026-08-07T12:11:50.945418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03966","last_updated":"2024-09-06T01:29:35Z","snapshot_observed_at":"2026-07-06T19:11:18.410415Z","submitted_at":"2024-09-06T01:29:35Z","title":"Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03966","snapshot_observed_at":"2026-08-07T12:11:51.017370Z","title":"Automating robot failure recovery using vision-language models with optimized prompts.arXiv preprint arXiv:2409.03966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.017370Z"},"links":{"cited_paper":"/paper/2409.03966","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b07f82f8a6cfd14b77736a12d9ae72bb360caa6ef93cf05556d3eaf76f68003e","observation_id":"2bce84f4-9a64-4654-ab50-1a81f0449008","resolution":{"observed_at":"2026-08-07T12:11:51.017370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-07T12:11:51.104029Z","title":"Pali-3 vision language models: Smaller, faster, stronger.arXiv preprint arXiv:2310.09199, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.104029Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:fcf2f671d6dca8354cafc78c08593fa5297ab9408d9ac853b8258e3645040736","observation_id":"e027e3ac-455f-4719-bcb7-ec0c4b1b4b45","resolution":{"observed_at":"2026-08-07T12:11:51.104029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:11:51.175126Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.175126Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:713ca9b5f61f8abe9634572db6914ff43d2f4391af96ca3bdf63e2aaf22f26d6","observation_id":"396dad35-108d-4f25-beea-2953d1be9b1d","resolution":{"observed_at":"2026-08-07T12:11:51.175126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14674","last_updated":"2024-09-23T02:50:33Z","snapshot_observed_at":"2026-08-07T05:54:18.018605Z","submitted_at":"2024-09-23T02:50:33Z","title":"RACER: Rich Language-Guided Failure Recovery Policies for Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14674","snapshot_observed_at":"2026-08-07T12:11:51.255771Z","title":"Racer: Rich language-guided failure recovery policies for imitation learning.arXiv preprint arXiv:2409.14674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.255771Z"},"links":{"cited_paper":"/paper/2409.14674","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:49fde290ee8883306fb96da9fbee1571de54e387721aea71c2a19777a66e97f0","observation_id":"1948774a-2fca-4c78-93aa-6210970583db","resolution":{"observed_at":"2026-08-07T12:11:51.255771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.332588Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.332588Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f2ecb601b52db5de67f329dcd393a49dbd13754ce1f848ad88f6d350dda3996a","observation_id":"a3fc4e88-3361-40d0-9bef-a5335e1f2455","resolution":{"observed_at":"2026-08-07T12:11:51.332588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.411720Z","title":"A survey of embodied ai: From simulators to research tasks.IEEE Transactions on Emerging Topics in Computational Intelligence, 6(2):230–244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.411720Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:879d042e6f56f43d02c0c5e8a649f68deabb14f3d41c8837fd0877172328ac90","observation_id":"f21d51c6-ae7e-4ddd-b8f0-221e2238bedd","resolution":{"observed_at":"2026-08-07T12:11:51.411720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09572","last_updated":"2025-04-22T17:56:22Z","snapshot_observed_at":"2026-08-07T20:22:20.692339Z","submitted_at":"2025-03-12T17:40:52Z","title":"Plan-and-Act: Improving Planning of Agents for Long-Horizon Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09572","snapshot_observed_at":"2026-08-07T12:11:51.503670Z","title":"Plan-and-act: Improving planning of agents for long-horizon tasks.arXiv preprint arXiv:2503.09572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.503670Z"},"links":{"cited_paper":"/paper/2503.09572","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b5e939ab1be9d47625e0910ca2d77cf4b649f57fa7e02619b0b30fd81abf32fe","observation_id":"494d03c6-01c8-4a84-bd5f-6d0f74311564","resolution":{"observed_at":"2026-08-07T12:11:51.503670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16768","last_updated":"2024-08-29T17:59:45Z","snapshot_observed_at":"2026-07-06T19:07:50.782209Z","submitted_at":"2024-08-29T17:59:45Z","title":"SAM2Point: Segment Any 3D as Videos in Zero-shot and Promptable Manners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16768","snapshot_observed_at":"2026-08-07T12:11:51.580798Z","title":"Sam2point: Segment any 3d as videos in zero-shot and promptable manners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.580798Z"},"links":{"cited_paper":"/paper/2408.16768","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:66ecc9de31f33b3d75240d8d3e3866673ae218f04f21cddb8b32d18415916f5f","observation_id":"e0d22152-43ea-4d7b-a36d-d572447164f7","resolution":{"observed_at":"2026-08-07T12:11:51.580798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.657514Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.657514Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:69d7f015a4b2c5c2c240c451a48a1cdb78fb2cf39dd6893fef6fc447f0a62cd0","observation_id":"6c15d737-1812-4af8-ba9e-405a1fe6fea4","resolution":{"observed_at":"2026-08-07T12:11:51.657514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-07T02:37:30.672574Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-07T12:11:51.749872Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning.arXiv preprint arXiv:2311.17842, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.749872Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:d89cef6f9a7a2429a2918ea8844b62d3d350dd4b04fc8de0e443a0331ab069fa","observation_id":"5d3a4d0f-abc1-438d-8dbb-3e89c20b1864","resolution":{"observed_at":"2026-08-07T12:11:51.749872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T12:11:51.808027Z","title":"Inner monologue: Embodied reasoning through planning with language models.arXiv preprint arXiv:2207.05608, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.808027Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f03a2a81baf456d4288f3c9bfff5ee76dc00fa60346ee4a39858758c5edefa4c","observation_id":"f686ef96-63b8-4e2e-bac4-d26f9da7dd92","resolution":{"observed_at":"2026-08-07T12:11:51.808027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T12:11:51.879427Z","title":"π0.5: a vision- language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.879427Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ff6a46063e49af81a4fe421f379f44518c7b747f159fa3dc9eb3bb43cd0a6196","observation_id":"557ec476-913e-47e3-8b7f-4c041f2747f7","resolution":{"observed_at":"2026-08-07T12:11:51.879427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:51.933742Z","title":"Rlbench: The robot learning benchmark & learning environment.IEEE Robotics and Automation Letters, 5(2): 3019–3026, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.933742Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:9df6ee294b632e2fdd2115bf0ccb7138b934fb8ff43db3299df7328620ed685a","observation_id":"8c84b103-0336-4f5d-8135-47005bbcd31d","resolution":{"observed_at":"2026-08-07T12:11:51.933742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-07T13:44:24.778030Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-07T12:11:51.991716Z","title":"Vima: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2(3):6, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:51.991716Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ec8ae21946724877c0d67f94bf345e37f550e73803b4363506a8950262fede36","observation_id":"820a1bc0-e137-4067-9af1-de82658f6d3c","resolution":{"observed_at":"2026-08-07T12:11:51.991716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.049828Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.049828Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:9b2ec43af30c50c3cddbce11667d62b612566e1447ff78b1dad8e361aff16bd0","observation_id":"65712fe7-bfe9-44b7-b52b-5f09f8b515d4","resolution":{"observed_at":"2026-08-07T12:11:52.049828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:11:52.108675Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.108675Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:5e8cec5b9728ffed2ec412890b6659113c9e09c80ee8b6b344c31fb9a50f1415","observation_id":"fb2a4c9e-8674-4c17-9c5b-62aca763dcf9","resolution":{"observed_at":"2026-08-07T12:11:52.108675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10645","last_updated":"2025-02-08T20:22:08Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:59:12Z","title":"Interactive Task Planning with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10645","snapshot_observed_at":"2026-08-07T12:11:52.169199Z","title":"Interactive task planning with language models.arXiv preprint arXiv:2310.10645, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.169199Z"},"links":{"cited_paper":"/paper/2310.10645","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:34f1923347146edc84e31bdd42b47a7857a5e139617319c8baceb45553c917fb","observation_id":"3e511f46-d589-4f42-b24f-5c5beb0ba397","resolution":{"observed_at":"2026-08-07T12:11:52.169199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-07T12:11:52.234021Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.234021Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:fd195471752c2c3f61665edb8d18ccdd6fdcc213a55d8ba5d8a880204f000151","observation_id":"3b256970-321e-4233-a30c-d662d2bc37dd","resolution":{"observed_at":"2026-08-07T12:11:52.234021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-07-06T20:33:15.472157Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-07T12:11:52.289000Z","title":"Hamster: Hierarchical action models for open-world robot manipulation.arXiv preprint arXiv:2502.05485, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.289000Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:dd58d4043f997708e2968902b403241e1b1c6a7bc35e030c13196a9e07783fc1","observation_id":"ae26849b-d5ab-43d1-9fc1-9ea2f5737a9c","resolution":{"observed_at":"2026-08-07T12:11:52.289000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.345413Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.345413Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:6059542f55e422f377369b8430922dda1c07307916e52849e8652dc836a7d2cf","observation_id":"f6a8cf29-9d17-40d7-bbfd-907b591e9eae","resolution":{"observed_at":"2026-08-07T12:11:52.345413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.417895Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.417895Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:43b62a6f8750c2dfb0ad53349c62c8280b860ed7bc5ce68e068f27323d3bdc3e","observation_id":"7cedec1a-53b2-46fd-b1a4-90fde3db3aa3","resolution":{"observed_at":"2026-08-07T12:11:52.417895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-07T12:11:52.474356Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.arXiv preprint arXiv:2407.06886, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.474356Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:25095a5f1e4bdb8894fd22587471c0fc610e5782478986b2864129cc8ca5698b","observation_id":"d2b24dac-6fca-4be1-be34-5526efb36c12","resolution":{"observed_at":"2026-08-07T12:11:52.474356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:11:52.542027Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.542027Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:b2ce2d44bd7456f8cf589953f0c3caffeb642f63107ea9c1db4f103f23b50d47","observation_id":"3386d76e-45b7-452b-8eaf-5b90a4ccebaf","resolution":{"observed_at":"2026-08-07T12:11:52.542027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21969","last_updated":"2025-08-21T02:16:40Z","snapshot_observed_at":"2026-08-07T16:31:39.152125Z","submitted_at":"2025-03-27T20:32:58Z","title":"Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation","version":3},"cited_work":{"arxiv_id":"2503.21969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.21969","snapshot_observed_at":"2026-08-07T12:11:53.996299Z","title":"Embodied Long Horizon Manipulation with Closed-loop Code Generation and Incremental Few-shot Adaptation","venue":"cs.RO","work_id":"8fa81a1c-a0ee-4db8-93b6-da6b7652cfad","year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.605689Z"},"links":{"cited_paper":"/paper/2503.21969","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:548190c40e182ac73627317ec66e315a86bc0b30e7b1eee628ca610a4331dc42","observation_id":"27dcc32e-f1f9-41ff-82c6-e4dcf848fd98","resolution":{"observed_at":"2026-08-07T12:11:54.106121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-07T12:11:52.663287Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms.arXiv preprint arXiv:2402.07872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.663287Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:4c3c7ea9c358c28c7463c75f6c7d651617cd86fdea375312ce5945b12bce0bda","observation_id":"19d7957c-ead7-4c6a-af9c-1d95c5e5b4f9","resolution":{"observed_at":"2026-08-07T12:11:52.663287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.737739Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.737739Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:60c9dfa01cbc801fc4beb42c48072fcbf79e5e819f24c5956e063df88508e3b0","observation_id":"926c4d49-089e-447c-ae47-79f582e9e696","resolution":{"observed_at":"2026-08-07T12:11:52.737739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.813700Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.813700Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:946e9582e56b1bdf6408a84d43a3e48a2d2c951191cf8e2c2c069cf5f19547cb","observation_id":"8482fb7b-520f-41f1-9783-1f9b55ce32c6","resolution":{"observed_at":"2026-08-07T12:11:52.813700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.870099Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.870099Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:4661187f75a24ac52c4cf90e34973d1dc59cda239e4cf83b43e5579b1b6e7135","observation_id":"adf29dd0-4804-45d4-b563-50b5267c01ba","resolution":{"observed_at":"2026-08-07T12:11:52.870099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-04T09:24:08.528569Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-07T12:11:52.939905Z","title":"Yell at your robot: Improving on-the-fly from language corrections.arXiv preprint arXiv:2403.12910, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.939905Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:fb614c78dbdcbb8b77cfa611cd8fea47307688a8c83f3762adae4b5151e8868f","observation_id":"1e9729c2-9d0d-48c4-a8b2-d8135faa509e","resolution":{"observed_at":"2026-08-07T12:11:52.939905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:52.996432Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:52.996432Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:c749631f8148bdd138550f691a3f0db65ae6305102145b64d3e7ed08c721842e","observation_id":"f5a57f0c-fb57-4e52-a7ed-b5d87fcc5baa","resolution":{"observed_at":"2026-08-07T12:11:52.996432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T12:11:53.054561Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.054561Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:5d4f5ce72fa300ddd7a0d6733c90136ce497a249d6816e2dab9f1a6445aac5ae","observation_id":"62ae627e-101d-4083-93a9-756881a0c8a7","resolution":{"observed_at":"2026-08-07T12:11:53.054561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:53.109639Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.109639Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:d03380a0712a58d3092a01b2fe56547317a559ae072fc82957565add4467a70a","observation_id":"26fcc7d7-4dd4-4a28-b637-5c9c9505445e","resolution":{"observed_at":"2026-08-07T12:11:53.109639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14908","last_updated":"2025-03-21T01:58:00Z","snapshot_observed_at":"2026-07-06T19:20:19.151388Z","submitted_at":"2024-09-23T11:02:46Z","title":"KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14908","snapshot_observed_at":"2026-08-07T12:11:53.136088Z","title":"Karma: Augmenting embodied ai agents with long-and-short term memory systems.arXiv preprint arXiv:2409.14908, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.136088Z"},"links":{"cited_paper":"/paper/2409.14908","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a8d81a82b5d1b6758d64216d991eb59052afe2686f9fa9ebb6970fcf6f143078","observation_id":"1333bbd0-2651-4b57-b84e-918508fb06b2","resolution":{"observed_at":"2026-08-07T12:11:53.136088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.156816Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.156816Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:24042c92fc6d26df3b2477ea07b33230840448b241cb9fbc4210e87ab9fa1814","observation_id":"267028b0-7e69-49df-8662-1eedb1064a11","resolution":{"observed_at":"2026-08-07T12:11:53.156816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-07T12:11:53.176992Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.176992Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:fcea56721189cfe9c8a68252a00ebe59e8610407da6a0e886fff20b6d5404818","observation_id":"7ecbe182-66c7-4eb9-b7b9-233a0db0521f","resolution":{"observed_at":"2026-08-07T12:11:53.176992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-07T12:11:53.199045Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.199045Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:ab32ec30d0723f1375fc101bbbb85083bc96c7b7aa0ab546d986ff9ae1aa17a7","observation_id":"6d1168fb-ecff-4995-826c-eccec69fc6f6","resolution":{"observed_at":"2026-08-07T12:11:53.199045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01848","last_updated":"2023-07-04T17:58:25Z","snapshot_observed_at":"2026-08-06T10:55:32.798065Z","submitted_at":"2023-07-04T17:58:25Z","title":"Embodied Task Planning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01848","snapshot_observed_at":"2026-08-07T12:11:53.224883Z","title":"Embodied task planning with large language models.arXiv preprint arXiv:2307.01848, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.224883Z"},"links":{"cited_paper":"/paper/2307.01848","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:7bbb41ae07f7e82758d99bc551aa49e74cb84451ce46c5aa835e2dd08fb4c486","observation_id":"b0777f90-df48-4f56-927b-3d6696670cd4","resolution":{"observed_at":"2026-08-07T12:11:53.224883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-06T03:27:47.616528Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-07T12:11:53.248800Z","title":"Guiding long-horizon task and motion planning with vision language models.arXiv preprint arXiv:2410.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.248800Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:2c9b612596467975797c1fc01af8352a632906925e341e3355a51564ced06459","observation_id":"1dadc5fd-e2b5-4f32-a48f-cc3b5ba8e226","resolution":{"observed_at":"2026-08-07T12:11:53.248800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.279922Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.279922Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:d916098a36874c22a4aefb9c67851cb601b4407f99689553c93ba8e968ce06a8","observation_id":"d053f5ef-cf53-42ef-8fd1-0ad9ef18c56b","resolution":{"observed_at":"2026-08-07T12:11:53.279922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T12:11:53.309841Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.309841Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:4374444161147b30f001556fcfc976eebd2b6ba7fe9367b26db2fef460efbf9e","observation_id":"99ab15d2-1cd4-40ce-95ac-854b15e2e5fd","resolution":{"observed_at":"2026-08-07T12:11:53.309841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:53.341794Z","title":"Transporter networks: Rearranging the visual world for robotic manipulation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.341794Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:4ba3bde881cf5e38bf052045ed3c5454d3001c4142c36af0e5d62aac72f0d092","observation_id":"32a1e977-58cf-4ec1-aef5-422dc7c48f00","resolution":{"observed_at":"2026-08-07T12:11:53.341794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12020","last_updated":"2023-10-23T12:29:33Z","snapshot_observed_at":"2026-07-06T16:35:07.121479Z","submitted_at":"2023-10-18T14:53:14Z","title":"LoHoRavens: A Long-Horizon Language-Conditioned Benchmark for Robotic Tabletop Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12020","snapshot_observed_at":"2026-08-07T12:11:53.410773Z","title":"Lohoravens: A long-horizon language- conditioned benchmark for robotic tabletop manipulation.arXiv preprint arXiv:2310.12020, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.410773Z"},"links":{"cited_paper":"/paper/2310.12020","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:fe329fc196393f6e75261ad5264fa834365ee955b502d2952ca1297b00cce02e","observation_id":"029dc6b2-2290-4ed4-a692-683e44f7cde3","resolution":{"observed_at":"2026-08-07T12:11:53.410773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-02T00:03:22.878669Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-07T12:11:53.465809Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks.arXiv preprint arXiv:2412.18194, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.465809Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:d5f84eb1945507b8984a7bd30f87d4264d266d1135758a4f84f3598f5c934f35","observation_id":"04cad5a2-d5bb-4cd1-aa82-961911dc6ef4","resolution":{"observed_at":"2026-08-07T12:11:53.465809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:54.637990Z","title":"Erra: An embodied representation and reasoning architecture for long-horizon language- conditioned manipulation tasks.IEEE Robotics and Automation Letters, 8(6):3230–3237, 2023","venue":null,"work_id":"3f07147f-9606-41de-a380-2d6d1652f6b5","year":2023},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.529912Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:a5c83180037b09a5414e9bb3e9eb7c2d21c121733778842922cd7e83a430aab8","observation_id":"1c0fcf83-bbca-43ca-b251-01076d826155","resolution":{"observed_at":"2026-08-07T12:11:54.804295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-07T12:11:53.612115Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint arXiv:2503.22020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.612115Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:f6184b85a528cc82d34d5b733846b0a3cdc8d93523ad68b917a0471545b66fe5","observation_id":"7b5230cb-1021-4eb9-8fd9-e7342d94e7e3","resolution":{"observed_at":"2026-08-07T12:11:53.612115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:54.412043Z","title":"Isr-llm: Iterative self-refined large language model for long-horizon sequential task planning","venue":null,"work_id":"decb7777-e47a-4dfe-a0d2-1f57263b9b87","year":2024},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.679712Z"},"links":{"citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:26bcf8ba8c7ea95fdc6da46c441707ab70ce4ae1b67ab7a6257de1869c265c56","observation_id":"d5853545-59f4-46b9-b4bb-6d32d1843908","resolution":{"observed_at":"2026-08-07T12:11:54.486441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.12293","last_updated":"2025-01-18T02:57:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-25T15:32:31Z","title":"robosuite: A Modular Simulation Framework and Benchmark for Robot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.12293","snapshot_observed_at":"2026-08-07T12:11:53.760420Z","title":"Put the [OBJ] on the [OBJ]","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:53.760420Z"},"links":{"cited_paper":"/paper/2009.12293","citing_paper":"/paper/2506.00411"},"observation_digest":"sha256:21e797e37d22e48a7a95e54cb322fa0e9bc341f2a0d5814f834edb4885842b6e","observation_id":"2fe3bc54-3dad-47d6-97a8-3fb0fa87f083","resolution":{"observed_at":"2026-08-07T12:11:53.760420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00411","last_updated":"2025-05-31T06:01:03Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T13:44:51.518766Z","submitted_at":"2025-05-31T06:01:03Z","title":"LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 12 inbound Pith citation observations for arXiv:2506.00411."}