{"as_of":"2026-08-19T07:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd0ad053262264dc2fb2d10aba01078609c4c7ff7d73b6d1616f115421091295","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:10:27.648196Z","state":"measured"},{"denominator":114,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":114,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:38:41.712173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:51a2e61cb8655cb4f96e66ec7f3e39b27f9679533e078fa96819b928b5b47873","observation_id":"1b1409b6-a8a0-4b15-bccd-5823be6bceb9","resolution":{"observed_at":"2026-05-15T20:43:24.461538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T13:31:09.958850Z","title":"Vla-os: Structuring and dissecting planning repre- sentations and paradigms in vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-14T02:52:34.768729Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.958850Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:ef402f655754857729d849f0b3930ff10c6160bf752e0617b35fac025a340ed5","observation_id":"4d9825f4-f8e2-4510-b434-fc1732b5d445","resolution":{"observed_at":"2026-08-05T13:31:09.958850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2511.18085","last_updated":"2026-05-08T04:30:23Z","snapshot_observed_at":"2026-08-16T22:09:16.875749Z","submitted_at":"2025-11-22T15:00:08Z","title":"Continually Evolving Skill Knowledge in Vision Language Action Model","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T06:02:31.638120Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2511.18085"},"observation_digest":"sha256:c21f42d13b1517c11a926f2b0eae4ae87a358a22788687f4cf23ec0b9e5d2116","observation_id":"c3266e4c-70c4-4b32-a59f-e9a0947a83dd","resolution":{"observed_at":"2026-05-17T06:04:09.142663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-03T20:32:26.811080Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models.arXiv preprint arXiv:2506.17561, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19433","last_updated":"2026-05-29T16:37:52Z","snapshot_observed_at":"2026-08-18T00:54:37.494749Z","submitted_at":"2025-11-24T18:59:51Z","title":"Mixture of Horizons in Action Chunking","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:32:26.811080Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2511.19433"},"observation_digest":"sha256:ef1fc3b69ae7f81d72eef3e844b11a28efa4f7832659709907b3b70ec957a32c","observation_id":"c19d9121-4ffe-4a89-83d4-3ddb452ead54","resolution":{"observed_at":"2026-08-03T20:32:26.811080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2605.06175","last_updated":"2026-05-08T06:32:29Z","snapshot_observed_at":"2026-08-15T01:07:51.226843Z","submitted_at":"2026-05-07T12:56:58Z","title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T09:11:21.715023Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2605.06175"},"observation_digest":"sha256:8aa685c0089abd8402da213e05f0546967df20db5f9b6e6a80e6d56b35382a3b","observation_id":"a8ef4a7a-3f03-4953-a533-2a3faadffc76","resolution":{"observed_at":"2026-05-11T20:26:10.231298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2605.07381","last_updated":"2026-05-08T07:35:24Z","snapshot_observed_at":"2026-08-15T00:01:25.552816Z","submitted_at":"2026-05-08T07:35:24Z","title":"Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T02:25:23.710842Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2605.07381"},"observation_digest":"sha256:121bde034a197faff20ec15525dba1c32bffd8369cbacbcbdc2e1b77e342c17d","observation_id":"9fce7ef5-7bec-4bce-a585-0e7d327e8a39","resolution":{"observed_at":"2026-05-11T02:25:52.929046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-15T08:15:33.417798Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T04:46:03.020800Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2605.22816"},"observation_digest":"sha256:f2eab340f7936f2f7e84c0bd233f538d8c73aaaa21b24e530aad8095afe46f0e","observation_id":"d7a4b6d9-4f86-46a6-bb5b-8b5e954b8d57","resolution":{"observed_at":"2026-05-22T04:46:04.519797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2605.24203","last_updated":"2026-05-22T20:43:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-22T20:43:47Z","title":"Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T15:36:13.134340Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2605.24203"},"observation_digest":"sha256:5ce611e2819eaeeece9bff0cd79c38648f7f88b617ac8fd000f1c83c15c6cde4","observation_id":"44aea398-8255-41bc-b582-90bb43ed3b0e","resolution":{"observed_at":"2026-06-30T15:44:48.603453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2606.10267","last_updated":"2026-06-09T00:24:00Z","snapshot_observed_at":"2026-08-12T22:22:26.538374Z","submitted_at":"2026-06-09T00:24:00Z","title":"What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T13:36:56.552395Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2606.10267"},"observation_digest":"sha256:f979c06774bc43a20cbfe649a065002c7657231456c6cfd64c8f7e56fdbf7af1","observation_id":"32b0416f-6a3d-4e5d-ab44-9ef473cb0564","resolution":{"observed_at":"2026-07-03T04:47:38.571669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.17561","doi":"10.48550/arxiv.2506.17561","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":"arXiv (Cornell University)","work_id":"2f6a2ca4-9b17-4e04-9fd2-2bda1ec1519b","year":2025},"citing_paper":{"arxiv_id":"2606.27872","last_updated":"2026-06-26T09:13:16Z","snapshot_observed_at":"2026-08-17T11:20:29.077261Z","submitted_at":"2026-06-26T09:13:16Z","title":"S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T04:41:57.643116Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2606.27872"},"observation_digest":"sha256:3e7a03c82f39ce17ba0ff90a6fcdf85aa884ac1a879715fbb075080655fc9499","observation_id":"27885bd4-0d9a-4583-aaca-4507cc721d18","resolution":{"observed_at":"2026-06-29T04:43:06.349780Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-07-14T15:19:27.489381Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision- language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09818","last_updated":"2026-07-10T07:06:02Z","snapshot_observed_at":"2026-08-18T03:21:33.659260Z","submitted_at":"2026-07-10T07:06:02Z","title":"TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T15:19:27.489381Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2607.09818"},"observation_digest":"sha256:ab247a79b83308724b564aeabf7677f64c6defe76de7bfb331612ca12c2132d3","observation_id":"3541f0cc-245d-4df8-a6af-7f0f93129804","resolution":{"observed_at":"2026-07-14T15:19:27.489381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-01T14:39:35.190360Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-16T19:36:52.307904Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:35.190360Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:49cc03c1294c75fdfe3e31e8e0412377d00ea585a2a21c18179efe05a85dcfb4","observation_id":"9c481aa7-258e-4ac7-bea4-c374833899c7","resolution":{"observed_at":"2026-08-01T14:39:35.190360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-06T14:54:47.724159Z","title":"Vla- os: Structuring and dissecting planning representations and paradigms in vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04854","last_updated":"2026-08-05T13:47:59Z","snapshot_observed_at":"2026-08-11T01:54:15.111239Z","submitted_at":"2026-08-05T13:47:59Z","title":"Transforming Remanufacturing Automation with Large Language Models: A Forward-Looking Analysis with Case Studies","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:47.724159Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2608.04854"},"observation_digest":"sha256:5097ef26ffee61684957e942069bd73e908ea219f37d1be6096b99c497ca95c5","observation_id":"05b03699-62f1-40f9-b3c7-5e0390014d80","resolution":{"observed_at":"2026-08-06T14:54:47.724159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17561","snapshot_observed_at":"2026-08-07T19:38:41.712173Z","title":"Guo, D.; Yang, D.; Zhang, H.; Song, J.; Wang, P.; Zhu, Q.; Xu, R.; Zhang, R.; Ma, S.; Bi, X.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05999","last_updated":"2026-08-06T13:07:56Z","snapshot_observed_at":"2026-08-18T23:11:29.104904Z","submitted_at":"2026-08-06T13:07:56Z","title":"Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T19:38:41.712173Z"},"links":{"cited_paper":"/paper/2506.17561","citing_paper":"/paper/2608.05999"},"observation_digest":"sha256:dec717e86b00a504585e5f35250da550e1b9d5f5253a9954f8d0cf97cb539782","observation_id":"e9e93aa3-4f76-4be8-883e-411a146f47b1","resolution":{"observed_at":"2026-08-07T19:38:41.712173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17561/citation-record","integrity":"/paper/2506.17561/integrity","json":"/paper/2506.17561/citation-record.json","paper":"/paper/2506.17561"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:10:27.003333Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.003333Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:84272060abbd86366c19c79371a541d6cbf0406b7c4aaf665a5e88ed082a42af","observation_id":"9ec5de35-6096-4d2f-8296-10f60ef2fd82","resolution":{"observed_at":"2026-08-15T19:10:27.003333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T19:10:27.009878Z","title":"Do as i can, not as i say: Grounding language in robotic affordances.arXiv preprint arXiv:2204.01691, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.009878Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8d38e9f6a21bd3f1a8dd78f55ccb310707e3c738dc8dabafdb2a0168fe1fb995","observation_id":"5d926090-8c7b-46aa-a059-5a883583aeea","resolution":{"observed_at":"2026-08-15T19:10:27.009878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.015062Z","title":"Dexart: Benchmarking generalizable dexterous manipulation with articulated objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.015062Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:351f2df93746637e9a195acf1ce270a6139f7547e4e2c24e90599ba082bab2dd","observation_id":"9d03ec14-9f3e-48c2-b990-72f4cc939298","resolution":{"observed_at":"2026-08-15T19:10:27.015062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.019970Z","title":"Minivla: A better vla with a smaller footprint","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.019970Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:1b669f4a61a7dd63d2f6373f86edb28866d15f3b957deadd7514eb28d5d69614","observation_id":"3b7bbc82-118a-485e-9d98-338d4d1fac28","resolution":{"observed_at":"2026-08-15T19:10:27.019970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T19:10:27.025891Z","title":"Rt-h: Action hierarchies using language.arXiv preprint arXiv:2403.01823, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.025891Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:4b35da6e4f3cd3668ebbf11e5884a06be489cc74ce1fb5c423b44a1fd71ed3f1","observation_id":"6aa62eb3-b3cc-410f-809d-fd521ce12374","resolution":{"observed_at":"2026-08-15T19:10:27.025891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-15T19:10:27.031239Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.031239Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:a0230c6360a179ba7332a2afe292952fd5cd74544a8a836c12c02739b5b6b99f","observation_id":"bf2ae482-fef2-4bab-ad87-67c9bd34d633","resolution":{"observed_at":"2026-08-15T19:10:27.031239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T19:10:27.037102Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.037102Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:f4bafca569a713081b7e8baa9556791002d21c750ddceba1b2195e69fc025c29","observation_id":"35b47c6d-5c46-4310-b54f-4e5b814b9559","resolution":{"observed_at":"2026-08-15T19:10:27.037102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T19:10:27.042074Z","title":"pi0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.042074Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:be4084f46c4bf41d582e825a11e1284d5213fd73edb9b10802668ccce24235c7","observation_id":"f6ad6bc2-204a-4beb-8e66-71771cb81664","resolution":{"observed_at":"2026-08-15T19:10:27.042074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.048240Z","title":"MIT press, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.048240Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:26bba6c6eeb5d33d2220b0abc3e7297afc500c9e218d56750a6e7308acbd0971","observation_id":"5d421add-9cf8-4ff3-8c02-89de5e8cd8b5","resolution":{"observed_at":"2026-08-15T19:10:27.048240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T19:10:27.053827Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.053827Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:a10b9b7aec3281bca3b6affc5123bbf4ca57796ac6f2f463c1a4896866dabc52","observation_id":"e0f215ab-bfcb-460d-8122-9fb53d629c09","resolution":{"observed_at":"2026-08-15T19:10:27.053827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T19:10:27.058990Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.058990Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:be827abf5b5c7fea0a904c679840b0b8dc65ebc0a60b326173ff49956c79506f","observation_id":"ae157066-4690-4f23-9fe7-7273fe336801","resolution":{"observed_at":"2026-08-15T19:10:27.058990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-15T19:10:27.063851Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.063851Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:d6fc24bb28d4e30da89b6635a1809ead7ea793b1259d7647ecfbb4056bcfae71","observation_id":"4c2fa5b2-242f-4fb2-9b04-f0fc4d1e03f9","resolution":{"observed_at":"2026-08-15T19:10:27.063851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.068940Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.068940Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:61d118b80f229bf435a07c6a08655b3df14dfc4c2ffb4469ba1a728ffa9b4ee9","observation_id":"eaf6eb3d-16b3-43c7-a976-d831098c78f1","resolution":{"observed_at":"2026-08-15T19:10:27.068940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08372","last_updated":"2025-08-13T11:56:17Z","snapshot_observed_at":"2026-08-17T06:14:07.258189Z","submitted_at":"2025-03-11T12:30:21Z","title":"MetaFold: Language-Guided Multi-Category Garment Folding Framework via Trajectory Generation and Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08372","snapshot_observed_at":"2026-08-15T19:10:27.073785Z","title":"Metafold: Language-guided multi-category garment folding framework via trajectory generation and foundation model.arXiv preprint arXiv:2503.08372, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.073785Z"},"links":{"cited_paper":"/paper/2503.08372","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:f839c678d6f4ab60f7e6cdf2d4a11012d57fcf052bd463a761d65726184e72cf","observation_id":"8d42b62d-b0fc-4115-a016-0d3b712ff8e8","resolution":{"observed_at":"2026-08-15T19:10:27.073785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.078702Z","title":"Pixart- σ: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.078702Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:d1bc412471ff4fe68057e337772840fb1eb3e74298a4687e625b42ee62fa7da2","observation_id":"fcbf8451-f69e-4dd3-85ef-88806e85856a","resolution":{"observed_at":"2026-08-15T19:10:27.078702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00785","last_updated":"2024-10-17T13:41:16Z","snapshot_observed_at":"2026-08-16T13:08:25.687323Z","submitted_at":"2024-10-17T13:41:16Z","title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00785","snapshot_observed_at":"2026-08-15T19:10:27.083480Z","title":"Igor: Image-goal representations are the atomic control units for foundation models in embodied ai.arXiv preprint arXiv:2411.00785, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.083480Z"},"links":{"cited_paper":"/paper/2411.00785","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:aa22387c721e09fafd52be626dbae9071362176430c4e031baa642de3622c705","observation_id":"4ddca0e3-d259-40f1-a1f5-800e9a5cb0ce","resolution":{"observed_at":"2026-08-15T19:10:27.083480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20154","last_updated":"2025-03-16T12:51:44Z","snapshot_observed_at":"2026-08-16T13:14:11.582562Z","submitted_at":"2024-09-30T10:02:42Z","title":"GravMAD: Grounded Spatial Value Maps Guided Action Diffusion for Generalized 3D Manipulation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20154","snapshot_observed_at":"2026-08-15T19:10:27.088478Z","title":"Gravmad: Grounded spatial value maps guided action diffusion for generalized 3d manipulation.arXiv preprint arXiv:2409.20154, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.088478Z"},"links":{"cited_paper":"/paper/2409.20154","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6e380ba3882327eb172bbbba57203fde5e33bcb6a2926a5f4e711942f91f4295","observation_id":"720b0bd8-8bf7-44c7-a166-e0a64d9670ce","resolution":{"observed_at":"2026-08-15T19:10:27.088478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.093662Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.093662Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:462de9d6e6244a7384eeee4c4033427033c6751cb8aeae13b675a9d87c71f085","observation_id":"2c7cd1f0-3902-43c5-a7b9-3957e217126c","resolution":{"observed_at":"2026-08-15T19:10:27.093662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.098304Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.098304Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:f97dbcb32ae2cfef2f4a44c5c2190ae7b78e54ebd1a37ffbd60e44f0b2de8a66","observation_id":"37a6dc63-29f5-41d1-9baf-1838eeb6e3e1","resolution":{"observed_at":"2026-08-15T19:10:27.098304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.103053Z","title":"Learning universal policies via text-guided video generation.Advances in neural information processing systems, 36:9156–9172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.103053Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:805cc54187d21c882a503c6a5c02e88074ee5cb734e5e24f75de6564e99ccfd0","observation_id":"bbd3ecab-970e-41ff-a67d-1968169d066f","resolution":{"observed_at":"2026-08-15T19:10:27.103053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.107903Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.107903Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:12f02cab80a055d0eccb19ba6c987b5085eeb4bcc0451f8ab7a9d615ba5cd379","observation_id":"66b63c11-d1cc-4147-82b4-d16af2d16d1b","resolution":{"observed_at":"2026-08-15T19:10:27.107903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.113547Z","title":"Helix: A vision-language-action model for generalist humanoid control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.113547Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:fa1ea6b2520402366b8ae2af10ed7534961cb21830562830f466bc1528bd26cb","observation_id":"1ae7c703-13b9-4e3b-a1b6-f9b37008791b","resolution":{"observed_at":"2026-08-15T19:10:27.113547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.118351Z","title":"Foundation models in robotics: Applications, challenges, and the future.The International Journal of Robotics Research, page 02783649241281508, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.118351Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:9108c720d028b6e34aeffedcb666f4a8edcbc505ff636e3b002e7f697cbeda32","observation_id":"34badb41-4d38-4ea4-ad74-7936abfe692d","resolution":{"observed_at":"2026-08-15T19:10:27.118351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.125156Z","title":"Cril: Continual robot imitation learning via generative and prediction model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.125156Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:98404a167b12a87099c932f5dc1a4facf4a3a00f3e655da360c3379cc65ef80a","observation_id":"f5cabab8-3937-42e5-8f40-3e27b6781869","resolution":{"observed_at":"2026-08-15T19:10:27.125156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.130146Z","title":"Transferring hierarchical structures with dual meta imitation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.130146Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:569d69f6521f433d4c470f3fd17da1a802e0f9a8ba8c678d33f6a20f8c8751c7","observation_id":"127ace33-b85d-4412-8d4a-0393891ec53c","resolution":{"observed_at":"2026-08-15T19:10:27.130146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.135031Z","title":"Iterative interactive modeling for knotting plastic bags","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.135031Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:4f292d6c531d4a11f5e6e348dce400c2a18ecf3b033c1a24c04603c87d3b2f24","observation_id":"9446cf73-ef99-4828-8a0b-a21c70511013","resolution":{"observed_at":"2026-08-15T19:10:27.135031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08261","last_updated":"2025-02-16T03:13:51Z","snapshot_observed_at":"2026-08-16T21:37:54.743597Z","submitted_at":"2024-12-11T10:17:00Z","title":"FLIP: Flow-Centric Generative Planning as General-Purpose Manipulation World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08261","snapshot_observed_at":"2026-08-15T19:10:27.140114Z","title":"Flip: Flow-centric generative planning for general-purpose manipulation tasks.arXiv preprint arXiv:2412.08261, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.140114Z"},"links":{"cited_paper":"/paper/2412.08261","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:af70808b13a427a7da578a59310201de69b6630f418d90c70941c12b3d5ede44","observation_id":"9cfe5a7f-32b7-4311-92b8-5082c6c98d24","resolution":{"observed_at":"2026-08-15T19:10:27.140114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.148990Z","title":"Peract2: Benchmarking and learning for robotic bimanual manipulation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.148990Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:ea0b6c8a57d44ac4d749d114c6165cb8d70bfa252ee3c001fc4de41d3be796fd","observation_id":"7bc351a4-0c81-4930-868d-ad444cef80fa","resolution":{"observed_at":"2026-08-15T19:10:27.148990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-16T14:46:11.532367Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-15T19:10:27.154410Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches.arXiv preprint arXiv:2311.01977, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.154410Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:4363be8a9f51f8fc521348617f53a0208449ebdf0e4aabd9a89423bfdeb3e101","observation_id":"4a794c05-14d3-468f-b720-cebc3611754b","resolution":{"observed_at":"2026-08-15T19:10:27.154410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T19:10:27.160457Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.160457Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:c86a8fc6e2bfe1338785398f22c1a0d1acbc9b6681b7332c6c968ba0b620d599","observation_id":"3784f67d-ee61-43dc-b36e-e58ca98ac549","resolution":{"observed_at":"2026-08-15T19:10:27.160457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04431","last_updated":"2025-06-17T15:32:20Z","snapshot_observed_at":"2026-08-15T00:31:45.808844Z","submitted_at":"2024-12-05T18:53:02Z","title":"Infinity: Scaling Bitwise AutoRegressive Modeling for High-Resolution Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04431","snapshot_observed_at":"2026-08-15T19:10:27.165223Z","title":"Infinity: Scaling bitwise autoregressive modeling for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.165223Z"},"links":{"cited_paper":"/paper/2412.04431","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:da178ced01af5a6c4199abcca81628c9c4bac2d451224023249f0041987c4762","observation_id":"25c08f81-c3f0-459f-bb21-d5422ca2b2f8","resolution":{"observed_at":"2026-08-15T19:10:27.165223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.169851Z","title":"Furniturebench: Reproducible real-world benchmark for long-horizon complex manipulation.The International Journal of Robotics Research, page 02783649241304789, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.169851Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:d306ff163156ef3c0e5e30860d9476bd2b98bec56bd7012766ee704c1e7d7e37","observation_id":"ccee3d34-3d57-4f4f-8959-24fc8e79b7af","resolution":{"observed_at":"2026-08-15T19:10:27.169851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-16T12:46:56.834354Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-15T19:10:27.174266Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy.arXiv preprint arXiv:2503.19757, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.174266Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:29ab5a293f51c6fbe7c66c70905cb9327c0ed20fce6b6f2ed88f82c0cc684519","observation_id":"90667bea-1a84-4668-95d3-4a67e3bc3843","resolution":{"observed_at":"2026-08-15T19:10:27.174266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08782","last_updated":"2024-10-01T08:54:53Z","snapshot_observed_at":"2026-08-17T22:45:34.417683Z","submitted_at":"2023-12-14T10:02:55Z","title":"Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08782","snapshot_observed_at":"2026-08-15T19:10:27.179019Z","title":"Toward general-purpose robots via foundation models: A survey and meta-analysis.arXiv preprint arXiv:2312.08782, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.179019Z"},"links":{"cited_paper":"/paper/2312.08782","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:a3af741a659e88d91bb9253a13dcb38b1b4bc6855922733100b10d648c5b90b0","observation_id":"bbb32158-d27e-4b4d-86df-2f3fd0827424","resolution":{"observed_at":"2026-08-15T19:10:27.179019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-15T19:10:27.183764Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint arXiv:2412.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.183764Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:776dcebc5a11d73fae89e95560195182110fc9ae9fd7e7f0a3926107a603006a","observation_id":"a4570be2-5ab4-45b8-95b0-e48641531207","resolution":{"observed_at":"2026-08-15T19:10:27.183764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.188840Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.188840Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:981944ce0302a15a1d4073850dafd95c044d27b0f6cec9034fe6c54b1a55eed5","observation_id":"44974a0e-f713-441e-bc0a-d6345852dd51","resolution":{"observed_at":"2026-08-15T19:10:27.188840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-15T19:10:27.193785Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models.arXiv preprint arXiv:2307.05973, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.193785Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:0aa82f1bbfd7fa8b4fb2f7feb220cee9cbe90bcf20d8fcbbb7775afa178c2300","observation_id":"12bfa25a-b0d4-4149-bc4b-29f0e6a50825","resolution":{"observed_at":"2026-08-15T19:10:27.193785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-15T19:10:27.199126Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation.arXiv preprint arXiv:2409.01652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.199126Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6b39421def7ab944ca6d7deafdf6726b678b30c65d649f7931687fc628fe0170","observation_id":"62ad3dcf-ac87-4f66-93eb-402d0ee45e2f","resolution":{"observed_at":"2026-08-15T19:10:27.199126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-16T12:54:11.878854Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-15T19:10:27.204775Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete.arXiv preprint arXiv:2502.21257, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.204775Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:cf37142adae0998034a2ec175e295001f0f522fed6148031da787701426a11ae","observation_id":"4528cd50-4c89-417b-9b54-83855159888b","resolution":{"observed_at":"2026-08-15T19:10:27.204775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-18T10:54:06.071321Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-15T19:10:27.210219Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.210219Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:507529634c186648b7f16a159ba09cc4c5c01687e980a6976387b84ca27aa73c","observation_id":"b1a1af65-5c05-468a-97a2-41e65c9067c3","resolution":{"observed_at":"2026-08-15T19:10:27.210219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.216285Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.216285Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:a1b0f1be6e5c1a7a51417a245422f715226ab1f8e935d68c46ba3b7d4ce2bd49","observation_id":"b3d386a0-5c77-4e66-86a3-d21109583148","resolution":{"observed_at":"2026-08-15T19:10:27.216285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-15T19:10:27.221449Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations.arXiv preprint arXiv:2402.10885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.221449Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:72e5fd9ac595b53bad3fe66f03e2270bdd600f7d6efbde24d65af908202c3cb8","observation_id":"ce8e387d-0f3a-4f19-af60-efa5883cef10","resolution":{"observed_at":"2026-08-15T19:10:27.221449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T19:10:27.227125Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.227125Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:ec997dae41eb16129f01756625c8e30757d6003cc0f5d496505d22a2db730187","observation_id":"58bede9a-0671-4b96-8878-712b6279513d","resolution":{"observed_at":"2026-08-15T19:10:27.227125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-08-15T09:35:08.116329Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-15T19:10:27.231900Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.231900Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:21a202000e24cf2aecd6449115e1c08a3eb4e9897b8107c138b913bc0d13c6b2","observation_id":"19f38507-8370-4ef5-92ca-796f0a2e8502","resolution":{"observed_at":"2026-08-15T19:10:27.231900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.236696Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.236696Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:bcbf9fc05ddc3cfc4221a75e93018e4df52209674fb7e6f50ca143d2616057bf","observation_id":"51b81117-1059-4855-a127-d0f2bf9b9184","resolution":{"observed_at":"2026-08-15T19:10:27.236696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-15T19:10:27.241005Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.241005Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6026c31100492810cecd9cc9bacc39b01e02980870b19075ac86ef018fbe2196","observation_id":"d9f8815a-0023-4b5c-8fc3-037002ce252d","resolution":{"observed_at":"2026-08-15T19:10:27.241005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-15T19:10:27.245859Z","title":"Towards generalist robot policies: What matters in building vision-language-action models.arXiv preprint arXiv:2412.14058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.245859Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:4bbb88f227bcea2d11f4ca46f3a2098bddac043072a82021e19d80498e0c53da","observation_id":"1d1d8ce3-4fa7-43eb-8964-f2492252831c","resolution":{"observed_at":"2026-08-15T19:10:27.245859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-08-18T14:14:32.909861Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-15T19:10:27.250566Z","title":"Hamster: Hierarchical action models for open-world robot manipulation.arXiv preprint arXiv:2502.05485, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.250566Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:46c9f26e516567f49d9cfe8966336b3c15eb2fcff8979287b302436707afeb4a","observation_id":"62c8773d-0242-4c74-ac32-6ed1f9555e05","resolution":{"observed_at":"2026-08-15T19:10:27.250566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.256457Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.256457Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6e047b32e79248dc29c5e5a95cd52ae24205360ed58e9a4903114abcf53ec76e","observation_id":"0cf68b7d-6d66-4354-8bef-253c7b323f79","resolution":{"observed_at":"2026-08-15T19:10:27.256457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T19:10:27.261844Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.261844Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6c8d8bbe581002c0739b385bc06bf25aa267cc15aa7f3e7162e679145d059112","observation_id":"ade42fed-3a92-4aa6-9ef0-fc298af79248","resolution":{"observed_at":"2026-08-15T19:10:27.261844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.267226Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.267226Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:e383a36135f6cbffa0e1ac9b1487b513e8889f1b527492c3760da226832d78b2","observation_id":"ea34b8be-fa20-45e9-976b-5a5ca993a081","resolution":{"observed_at":"2026-08-15T19:10:27.267226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.271777Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.271777Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8ea8769981632040923c51f60c730ef710cb6d95a7c2dfd5f21dcbb21f1db36a","observation_id":"52d21b8f-5b49-4905-8601-b7eb7574d7e6","resolution":{"observed_at":"2026-08-15T19:10:27.271777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-14T20:34:51.960761Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-15T19:10:27.276576Z","title":"Rectified flow: A marginal preserving approach to optimal transport.arXiv preprint arXiv:2209.14577, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.276576Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:3421917173ee473098828448b2f5db78c8cad239be1f2ac2c5701ff6fb3c36f2","observation_id":"5efa89d5-6566-49d4-bd5f-119da8ab5bb8","resolution":{"observed_at":"2026-08-15T19:10:27.276576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-15T19:10:27.282155Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.282155Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:df23bc6e1520f738aa039f47fd49f3a22b2f9e90ecfb47818c5c87878b80133b","observation_id":"084827d1-0369-4d6e-9e27-ab208db2038e","resolution":{"observed_at":"2026-08-15T19:10:27.282155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10901","last_updated":"2023-08-21T17:59:32Z","snapshot_observed_at":"2026-08-16T15:06:54.970053Z","submitted_at":"2023-08-21T17:59:32Z","title":"Structured World Models from Human Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10901","snapshot_observed_at":"2026-08-15T19:10:27.287296Z","title":"Structured world models from human videos.arXiv preprint arXiv:2308.10901, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.287296Z"},"links":{"cited_paper":"/paper/2308.10901","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:c0f9f8e266ea728910009bf3c6af9869e1cce800dad9ace65a94473ca466b2dc","observation_id":"9e47f889-03a2-47de-b7ea-7d58862239d7","resolution":{"observed_at":"2026-08-15T19:10:27.287296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02704","last_updated":"2024-11-05T01:02:51Z","snapshot_observed_at":"2026-08-16T13:02:56.960449Z","submitted_at":"2024-11-05T01:02:51Z","title":"RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02704","snapshot_observed_at":"2026-08-15T19:10:27.292201Z","title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation.arXiv preprint arXiv:2411.02704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.292201Z"},"links":{"cited_paper":"/paper/2411.02704","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:24a835bedee66cd430ad22b14420785c5f4be1ceaa26d0d47d930cce6454ae22","observation_id":"54ebc49d-9fa4-43e9-b1e1-27180a0e8fe3","resolution":{"observed_at":"2026-08-15T19:10:27.292201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-15T19:10:27.298511Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms.arXiv preprint arXiv:2402.07872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.298511Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:ef5fbef2a900a4cef26150b56eb9bdfe4137d70cc53f31051dfff2fdb011805a","observation_id":"dba92367-874c-441b-b2c1-f972801ef107","resolution":{"observed_at":"2026-08-15T19:10:27.298511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T19:10:27.303883Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.303883Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:196bfc112e51334e6c286f3cf682804b211d7e0910c63aa17109e454898570ce","observation_id":"1fd7db5f-5287-417c-80ba-b875d3cc9c9f","resolution":{"observed_at":"2026-08-15T19:10:27.303883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.313763Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.313763Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:665d1c2dcdb0eaaf862ec20a88c1a9e03dbc1d3d7bd42a28ec0561b3f92bf5f9","observation_id":"8c4e211a-9b94-437d-ab62-bb3861ccf149","resolution":{"observed_at":"2026-08-15T19:10:27.313763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-15T19:10:27.318235Z","title":"Kosmos-2: Grounding multimodal large language models to the world.arXiv preprint arXiv:2306.14824, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.318235Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:c83bfc3d40c6089ba9b8d3c095bd16a96d42f7fe29d1bbd24011a0891792dc8d","observation_id":"1e14c9f2-3112-46d7-99ce-e879ab1510c6","resolution":{"observed_at":"2026-08-15T19:10:27.318235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-15T19:10:27.323117Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.323117Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:403ce05595e08b7a1520260061ce396189bb1afc2bdc782327b4226d22a0f4a0","observation_id":"11d6191d-ae5e-4a7f-9370-f7941eac36d7","resolution":{"observed_at":"2026-08-15T19:10:27.323117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-15T19:10:27.328677Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.328677Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:16feb8043cdeb71cec752295ce8f98e7945bef3c61496a3540c43d8e8c947e72","observation_id":"09d1547a-b8d4-4fee-ac8d-ed8b48754385","resolution":{"observed_at":"2026-08-15T19:10:27.328677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08191","last_updated":"2024-05-28T00:37:02Z","snapshot_observed_at":"2026-08-16T14:19:07.560970Z","submitted_at":"2024-02-13T03:25:33Z","title":"THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08191","snapshot_observed_at":"2026-08-15T19:10:27.333639Z","title":"The colosseum: A benchmark for evaluating generalization for robotic manipulation.arXiv preprint arXiv:2402.08191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.333639Z"},"links":{"cited_paper":"/paper/2402.08191","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:72a5c49b2dcebeb5111f415a84ae9afd058456e8c051f899790f1247af7298ae","observation_id":"370a51f9-414d-4da0-b0c4-d64ae2220bbb","resolution":{"observed_at":"2026-08-15T19:10:27.333639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18115","last_updated":"2024-06-26T07:06:42Z","snapshot_observed_at":"2026-08-17T17:33:43.102983Z","submitted_at":"2024-06-26T07:06:42Z","title":"Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18115","snapshot_observed_at":"2026-08-15T19:10:27.338620Z","title":"Open-vocabulary mobile manipulation in unseen dynamic environments with 3d semantic maps.arXiv preprint arXiv:2406.18115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.338620Z"},"links":{"cited_paper":"/paper/2406.18115","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:6effb95c6eedc8103681c3fccc5b1771a274e03bc391b74c1468ef0042f7111d","observation_id":"183f2236-2e46-4520-87be-7fef6f368d8a","resolution":{"observed_at":"2026-08-15T19:10:27.338620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T19:10:27.343826Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model.arXiv preprint arXiv:2501.15830, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.343826Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:ad92288c0db4c63e025baaca96c60779b58959a7fec57312ab1442c24c37b690","observation_id":"e56934cd-e5c5-4973-ab06-af846be78952","resolution":{"observed_at":"2026-08-15T19:10:27.343826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.349176Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.349176Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:721a63aef644af7fe4b1e041966fa4261460f752f3bcc5919892afc66d39f546","observation_id":"59875891-dd11-48c4-897b-f2c7e59d664a","resolution":{"observed_at":"2026-08-15T19:10:27.349176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-15T19:10:27.353687Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.353687Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:f7bf70627e4f0ee812f86a9621ce0f7ce9073b0c7038f53e99e8141ea1676d21","observation_id":"c15eb20d-766d-48bd-bafc-58f858d803e3","resolution":{"observed_at":"2026-08-15T19:10:27.353687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-08-16T13:36:08.629560Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-15T19:10:27.359020Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals.arXiv preprint arXiv:2407.05996, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.359020Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8b2e765a418cfbef2e78e816e6be9a5eac64e8683cc7907a50f7e2c342115b26","observation_id":"54e0ec3e-c0ef-4d4c-8f7a-77b6477186c6","resolution":{"observed_at":"2026-08-15T19:10:27.359020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10812","last_updated":"2024-03-27T00:15:16Z","snapshot_observed_at":"2026-08-18T10:25:00.211012Z","submitted_at":"2023-12-17T20:39:54Z","title":"Learning to Act without Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10812","snapshot_observed_at":"2026-08-15T19:10:27.480043Z","title":"Learning to act without actions.arXiv preprint arXiv:2312.10812, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.480043Z"},"links":{"cited_paper":"/paper/2312.10812","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:fc66481c8ecb4b8f58648fc13dec8e0be0f35960ac08d7ca7d1a9c8265db477f","observation_id":"9d8dd8cd-9f4f-4400-aa9d-dbdfbeaf9398","resolution":{"observed_at":"2026-08-15T19:10:27.480043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06237","last_updated":"2024-10-08T17:52:29Z","snapshot_observed_at":"2026-08-18T09:19:45.451184Z","submitted_at":"2024-10-08T17:52:29Z","title":"BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06237","snapshot_observed_at":"2026-08-15T19:10:27.484823Z","title":"Bumble: Unifying reasoning and acting with vision-language models for building-wide mobile manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.484823Z"},"links":{"cited_paper":"/paper/2410.06237","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:7bc9f0c7c16ce6addc0c3b4b63f7c63c65dcf430e898d20c6014e975155cbd7c","observation_id":"4479e97e-078f-44d4-8deb-75ef88d4657f","resolution":{"observed_at":"2026-08-15T19:10:27.484823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-15T19:10:27.489750Z","title":"Hi robot: Open- ended instruction following with hierarchical vision-language-action models.arXiv preprint arXiv:2502.19417, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.489750Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:1573a7a5987e187e0eccd991500a3f0f4c1d8aa5d0346202f1375b84621c299a","observation_id":"8dc55914-ea42-4a7d-8a3b-6e358567cd2c","resolution":{"observed_at":"2026-08-15T19:10:27.489750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.494695Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.494695Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:76a0095a0f54f1129363cef80d198de8f9af2ecd1cfa028680bc2a4c81bfcfbe","observation_id":"fc06fdbd-7fe4-4365-b8b2-ca056bab4c37","resolution":{"observed_at":"2026-08-15T19:10:27.494695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T19:10:27.501457Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.501457Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:47a7a9fe954054a999620179f69ad3f22960113f060427885cd2792d8d4ef4ec","observation_id":"9a1c103d-1ee5-48af-8ff8-9e139eea3969","resolution":{"observed_at":"2026-08-15T19:10:27.501457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T19:10:27.507119Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.507119Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:66c6ec047e49d1dab8c8f1149c4b44274ec859851969b1b7ad578942a2d64d43","observation_id":"3ffd21c3-9ee9-48a5-9617-a1283b5a6467","resolution":{"observed_at":"2026-08-15T19:10:27.507119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.511441Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.511441Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:e42d60aacf05446192505f0e2029ba45552f8228d4b31546350dcd8f55f91f24","observation_id":"97e66d6e-ecd0-4584-b8ca-637fa755131d","resolution":{"observed_at":"2026-08-15T19:10:27.511441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-08-18T07:25:34.849820Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-15T19:10:27.515569Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation.arXiv preprint arXiv:2412.15109, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.515569Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:60f5209f71df13d601e3bf0b6e70a8411a8c7e12a676078dc8feee5b6c8ef7aa","observation_id":"cb1b856c-bce7-4bf2-8e19-17ae716835eb","resolution":{"observed_at":"2026-08-15T19:10:27.515569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.519672Z","title":"Llm^ 3: Large language model-based task and motion planning with motion failure reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.519672Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8eec0dfe851fd97b64f0bf0e3b2c7295c3f17e3e8e3543d96ba935fe3fd95a3e","observation_id":"315a5d10-127f-4f33-9e51-dc51f21ae169","resolution":{"observed_at":"2026-08-15T19:10:27.519672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.524313Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.524313Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:20cf301dcf952a2746b50e1f9ad139c21223ad40a58ab86d6b4dfc657e6442bd","observation_id":"c8f36ef7-0f0f-4ef1-903e-3b4793e5bd2e","resolution":{"observed_at":"2026-08-15T19:10:27.524313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01702","last_updated":"2025-03-14T07:49:02Z","snapshot_observed_at":"2026-08-16T13:13:17.720024Z","submitted_at":"2024-10-02T16:12:18Z","title":"$\\mathcal{D(R,O)}$ Grasp: A Unified Representation of Robot and Object Interaction for Cross-Embodiment Dexterous Grasping","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01702","snapshot_observed_at":"2026-08-15T19:10:27.529499Z","title":"D (r, o) grasp: A unified representation of robot and object interaction for cross-embodiment dexterous grasping.arXiv preprint arXiv:2410.01702, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.529499Z"},"links":{"cited_paper":"/paper/2410.01702","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:a0ce012501084e7bf8ccd9fc7300508f08d4ba9aee2fb082c5a5115f704b89a6","observation_id":"fd3a2dd9-3a41-4008-996c-361cf17c92fa","resolution":{"observed_at":"2026-08-15T19:10:27.529499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-15T19:10:27.534917Z","title":"Any-point trajectory modeling for policy learning.arXiv preprint arXiv:2401.00025, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.534917Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:2884b4692f692391ae51d0c92d95285dc8a8ad9eabab6bee1b1758b17bd2a1a8","observation_id":"6ebc802f-158b-469f-9730-d32e35db6c1a","resolution":{"observed_at":"2026-08-15T19:10:27.534917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T19:10:27.540220Z","title":"Diffusion-vla: Scaling robot foundation models via unified diffusion and autoregression.arXiv preprint arXiv:2412.03293, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.540220Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:e90b9ca6dceb55746c4bdcb7700c97d572c031d17fbe1fe86a793a1bfd4f7f70","observation_id":"aa52847d-d72f-4257-a581-a7e6d0f8791a","resolution":{"observed_at":"2026-08-15T19:10:27.540220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-15T19:10:27.545942Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.545942Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:81a61a5c7ba1b0de207b727ef824ceeedeaf6120a1ca94f0d5cfe6f710a61f82","observation_id":"988e8b70-1b10-4ca3-aae5-44bd9776cdb3","resolution":{"observed_at":"2026-08-15T19:10:27.545942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.557930Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.557930Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:3500b03f6fcd607d85da1ec2699bff46421909bb2b2ea22a59d957e4cbef07d8","observation_id":"d93be186-6d36-47d8-a0cc-864385877482","resolution":{"observed_at":"2026-08-15T19:10:27.557930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.566206Z","title":"Sapien: A simulated part-based interactive environment","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.566206Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8fb7d001084add2cc783e2fed634b3878f104a5f0f92098ebdfa28ad74d405ad","observation_id":"d7ae7b81-399b-4d01-916b-0c10a3d845d9","resolution":{"observed_at":"2026-08-15T19:10:27.566206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.575264Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.575264Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:51ab235f201deade3938435180ca937dc82abea2e9c91a93f4e177b4c5eee641","observation_id":"9dd4d635-b4ad-4bc8-8f42-22e06d3cfd02","resolution":{"observed_at":"2026-08-15T19:10:27.575264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:29.180138Z","title":"Manifoundation model for general- purpose robotic manipulation of contact synthesis with arbitrary objects and robots","venue":null,"work_id":"6c75e28b-ec92-4e38-87aa-d595c829bf6a","year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.580101Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:2ab3707e8d91786d54c39c6d5c8bd77d5a49e58b246b42bdb08474e76beb946e","observation_id":"a9605982-a5e8-4281-bd7d-412c877c068b","resolution":{"observed_at":"2026-08-15T19:10:29.184845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.584573Z","title":"Robomm: All-in-one multimodal large model for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.584573Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:b9dd039be0fe3c51e8b9f2eda7c1b32aace5b933e663d57473b8a5fc51462f04","observation_id":"2eff18e7-954d-4c87-a07e-d8a0f04ac6db","resolution":{"observed_at":"2026-08-15T19:10:27.584573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T19:10:27.589117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.589117Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:1818474c9020a44cab870ab49840c96b3bdcf6d5de50b55b40211184ccaf60c6","observation_id":"64e90c23-6fcd-4d53-b330-be5927ca307a","resolution":{"observed_at":"2026-08-15T19:10:27.589117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10462","last_updated":"2021-02-20T22:37:41Z","snapshot_observed_at":"2026-08-16T18:44:11.232831Z","submitted_at":"2021-02-20T22:37:41Z","title":"BSQ: Exploring Bit-Level Sparsity for Mixed-Precision Neural Network Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10462","snapshot_observed_at":"2026-08-15T19:10:27.594157Z","title":"Bsq: Exploring bit-level sparsity for mixed-precision neural network quantization.arXiv preprint arXiv:2102.10462, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.594157Z"},"links":{"cited_paper":"/paper/2102.10462","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:81473a75e6a14ded68b7a4e7f3e08d38c63fcb77e6e2a101d23f62d06d589711","observation_id":"eaa65cd4-029e-4e8e-a201-dd3da6cd5161","resolution":{"observed_at":"2026-08-15T19:10:27.594157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-15T19:10:27.598959Z","title":"Learning interactive real-world simulators.arXiv preprint arXiv:2310.06114, 1 (2):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.598959Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:9fd52b28fa219ca91f711035cea27ff3dd51576b26368ef31b5ce78b182a142f","observation_id":"8219064f-8bc8-4ea4-a728-f1485c32fdee","resolution":{"observed_at":"2026-08-15T19:10:27.598959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-08-17T21:22:10.233179Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-15T19:10:27.603536Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.603536Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:47027b1081c9d7af9aed3317095309b996e964f6e7b38eb0dd86eac628d975b5","observation_id":"47a7d6b6-d25e-40ab-a63e-2e5e1386a40f","resolution":{"observed_at":"2026-08-15T19:10:27.603536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11758","last_updated":"2025-05-15T12:13:37Z","snapshot_observed_at":"2026-08-12T08:06:42.236760Z","submitted_at":"2024-10-15T16:28:09Z","title":"Latent Action Pretraining from Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11758","snapshot_observed_at":"2026-08-15T19:10:27.608248Z","title":"Latent action pretraining from videos.arXiv preprint arXiv:2410.11758, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.608248Z"},"links":{"cited_paper":"/paper/2410.11758","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:c861212fb63880b21c45f1001335a65afb7dc77a38a499ebd62b3d1a1a16f7cd","observation_id":"9b59f4b3-ec40-4353-a1e8-0dacdbc317c4","resolution":{"observed_at":"2026-08-15T19:10:27.608248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-16T13:42:40.054113Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-15T19:10:27.612740Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics.arXiv preprint arXiv:2406.10721, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.612740Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:f8860546534c6fd079696c5ab6a406eda8aafcf48d01f867b206adfee03cbbe0","observation_id":"8444b4ae-aabd-4e78-9011-0d699d113629","resolution":{"observed_at":"2026-08-15T19:10:27.612740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-15T19:10:27.617413Z","title":"Robotic control via embodied chain-of-thought reasoning.arXiv preprint arXiv:2407.08693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.617413Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:1fac5f07ee86abefbfd31be8a117bb0a27982fdf62b771731b62eaf76fae958a","observation_id":"2d95718c-b065-4b13-a942-bd12653ddf7a","resolution":{"observed_at":"2026-08-15T19:10:27.617413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:10:27.622572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.622572Z"},"links":{"citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:c6168ccbc8ed2db3c872bd445982a52727caccf46a995f47c47d188f84cf697a","observation_id":"d7d5761f-c4cc-41e3-8a1d-4b9652b7e651","resolution":{"observed_at":"2026-08-15T19:10:27.622572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-15T19:11:06.150955Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18194","snapshot_observed_at":"2026-08-15T19:10:27.627121Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks.arXiv preprint arXiv:2412.18194, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.627121Z"},"links":{"cited_paper":"/paper/2412.18194","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:68a8df74636e3302f83fd46cb341835f8fd023f38ef8abaf0e66498473b3abe2","observation_id":"e21363c4-de58-43e7-addd-118d46879e4d","resolution":{"observed_at":"2026-08-15T19:10:27.627121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-18T09:32:30.308050Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-15T19:10:27.633325Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language- action models.arXiv preprint arXiv:2503.22020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.633325Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:00e79f1356f089c6cfa51575c93bcbdacc341bdde0c04a41aeeb612a8ca2aafd","observation_id":"700946ae-e552-4edd-a701-778f98350994","resolution":{"observed_at":"2026-08-15T19:10:27.633325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-15T19:10:27.638634Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware.arXiv preprint arXiv:2304.13705, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.638634Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:cbca400084ebb08c3eb2afb48af98e58df1f865a160a3b72ffe9bd6afb5ec4c4","observation_id":"49be3601-4f4f-4377-9ba8-78e6b763d4c4","resolution":{"observed_at":"2026-08-15T19:10:27.638634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-18T03:07:31.486347Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-08-15T19:10:27.643489Z","title":"Aloha unleashed: A simple recipe for robot dexterity.arXiv preprint arXiv:2410.13126, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.643489Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:8dc133a4843b7f6d3d84e719f3f4d06ac85513df88062a1bb2438c3bde903f77","observation_id":"43390db1-f8f4-4f41-8aab-4331000e72e6","resolution":{"observed_at":"2026-08-15T19:10:27.643489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-15T19:10:27.648196Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T19:10:27.648196Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.17561"},"observation_digest":"sha256:fbbb2c8ca20f9ea33b0cf62b6e78cc1aed5d4d453e87702a27f13989ea6088d6","observation_id":"9ff03f4e-97e5-4870-9e1c-803d3c3de889","resolution":{"observed_at":"2026-08-15T19:10:27.648196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17561","last_updated":"2025-06-21T03:07:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:11:57.987688Z","submitted_at":"2025-06-21T03:07:48Z","title":"VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 14 inbound Pith citation observations for arXiv:2506.17561."}