{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f9e4c5640d2365e74af2f1645407058151b46925711daf6a479db32d3d2fc8e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:04:16.844847Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T06:02:31.638120Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T06:04:09.181694Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"cited_work":{"arxiv_id":"2506.06196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06196","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging perception and action: Spatially-grounded mid-level representations for robot generalization.arXiv preprint arXiv:2506.06196","venue":null,"work_id":"d367e06e-2eb4-40cf-8d66-9ab6fa26bb4c","year":null},"citing_paper":{"arxiv_id":"2511.18085","last_updated":"2026-05-08T04:30:23Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-22T15:00:08Z","title":"Continually Evolving Skill Knowledge in Vision Language Action Model","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T06:02:31.638120Z"},"links":{"cited_paper":"/paper/2506.06196","citing_paper":"/paper/2511.18085"},"observation_digest":"sha256:577195234e3b6731b8399b3e30b17b157f0e71f21fa9227f8cc7ed8723b3be2f","observation_id":"2b3285ce-41ec-4537-81f0-c8891e2ac14d","resolution":{"observed_at":"2026-05-17T06:04:09.185337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06196/citation-record","integrity":"/paper/2506.06196/integrity","json":"/paper/2506.06196/citation-record.json","paper":"/paper/2506.06196"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T06:04:11.033917Z","title":"Do as i can, not as i say: Grounding language in robotic affordances, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.033917Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:8f3ac07fd9872b48fa97d720e4e000189ad3c3b3347931f40e12561d06276460","observation_id":"1b2a33bc-b820-4e31-aadc-427dcb8b041f","resolution":{"observed_at":"2026-08-07T06:04:11.033917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-07T06:04:11.137684Z","title":"Rt-h: Action hier- archies using language, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.137684Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:0c760fc7b2355bdf04ec81586d71063296674eb8093751ea7c8ebf64c76ae2e5","observation_id":"48b2af8f-acb5-4e04-8eb6-180a621a7250","resolution":{"observed_at":"2026-08-07T06:04:11.137684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-07T06:04:11.265627Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.265627Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:ea734e7707f74383e6bc14b7ca475008b61c123630917c346b2bfb840535389f","observation_id":"04e9c524-ce43-4847-808b-a700a037d53b","resolution":{"observed_at":"2026-08-07T06:04:11.265627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T06:04:11.406735Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.406735Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:9b2e52f9da85e1b855a9298f12df6f03faf164d479d84cefc88b62d603306bc3","observation_id":"ba69c4b4-c5c9-4d6e-8086-3653d68b3a13","resolution":{"observed_at":"2026-08-07T06:04:11.406735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:20.211143Z","title":"Spatialvlm: Endowing vision- language models with spatial reasoning capabilities,","venue":null,"work_id":"3d3fd2fd-dfa3-4fe7-a6ab-e362f7a2717f","year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.538502Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:d88a26e90f84bb0ca697bde0c104d2ea4a117fec9b20b35a50daf317b1db9d45","observation_id":"e94d5aa8-d95d-48e7-9cf2-7ff61fd6eec7","resolution":{"observed_at":"2026-08-07T06:04:20.371729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08686","last_updated":"2022-10-11T09:08:26Z","snapshot_observed_at":"2026-07-06T13:21:57.238438Z","submitted_at":"2022-06-17T11:09:06Z","title":"Towards Human-Level Bimanual Dexterous Manipulation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08686","snapshot_observed_at":"2026-08-07T06:04:11.859563Z","title":"Towards human-level bimanual dexterous manipulation with reinforcement learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.859563Z"},"links":{"cited_paper":"/paper/2206.08686","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:880d49d8106cf95cb997bd0a5fc972eafd32d7287e7e7a5f9cbb1d0b4b2b6406","observation_id":"dd2bad11-c156-4878-a78f-7290705ce8b8","resolution":{"observed_at":"2026-08-07T06:04:11.859563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:19.940978Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models,","venue":null,"work_id":"6c2b55cf-4bb3-468e-9d41-e394eeaa0209","year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.067288Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:9d196bcf62f44615db54a9d0843bbbb59c516688ed51382a0c47e2fe2e759df5","observation_id":"a32a3ecd-42e8-4a43-9a48-07bcfe48b8b9","resolution":{"observed_at":"2026-08-07T06:04:20.078039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11215","last_updated":"2020-01-02T06:26:37Z","snapshot_observed_at":"2026-07-06T08:31:59.314616Z","submitted_at":"2019-10-24T15:20:03Z","title":"RoboNet: Large-Scale Multi-Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11215","snapshot_observed_at":"2026-08-07T06:04:12.307676Z","title":"Robonet: Large-scale multi-robot learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.307676Z"},"links":{"cited_paper":"/paper/1910.11215","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:6aac256a5d2878e71c29606a07b09c6a6e4c5163a32676f54ed848872f064de1","observation_id":"ef7fdd6a-cfee-4057-a51e-109cb29c73be","resolution":{"observed_at":"2026-08-07T06:04:12.307676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T06:04:12.206866Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.206866Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:0249d339cf28f32b4becb9a7187c4e4e84021d7f4be6b38ca76e4d5569248236","observation_id":"96c4315e-3e64-40b0-83bb-a3d7c5e414e2","resolution":{"observed_at":"2026-08-07T06:04:12.206866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T06:04:12.847476Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.847476Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:c01594b6137e9b8da613ec8967f3f79b0668deeb1721099c074d20c6af353cca","observation_id":"e04d1035-3dcc-4afd-a3fb-70d09f167aff","resolution":{"observed_at":"2026-08-07T06:04:12.847476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:19.645794Z","title":"Goal-conditioned imitation learning,","venue":null,"work_id":"ed2381f7-bb59-4ec0-a731-8d182a78ae5e","year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.506939Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:baa5d770037614ba13368286174093492121140a2e381205386f62b183085424","observation_id":"71e35357-4ddc-4a40-9075-d55046e143b0","resolution":{"observed_at":"2026-08-07T06:04:19.782268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:19.275580Z","title":"Bridge data: Boosting generalization of robotic skills with cross- domain datasets, 2021","venue":null,"work_id":"9353ea6c-dc68-427f-853e-2b0e7a9950bf","year":2021},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.114027Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:6eb022a3c03349b63be91fecb92daabafb63e87e402dc819b395e1e3c3b0a3db","observation_id":"f8e0dc2a-dc31-4c6c-baa0-fe14db1d8574","resolution":{"observed_at":"2026-08-07T06:04:19.483094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02972","last_updated":"2021-06-05T21:39:04Z","snapshot_observed_at":"2026-07-06T11:16:19.955258Z","submitted_at":"2021-06-05T21:39:04Z","title":"Zero-shot Task Adaptation using Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02972","snapshot_observed_at":"2026-08-07T06:04:13.256781Z","title":"Mooney, and Scott Niekum","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.256781Z"},"links":{"cited_paper":"/paper/2106.02972","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:9f0a9a5faa7b07df1f84d13794a437da25efdb9aef3673deaa43d883e4790c09","observation_id":"7bc2c181-e75b-4b2c-be2c-be5eedf95333","resolution":{"observed_at":"2026-08-07T06:04:13.256781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:13.008703Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.008703Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:36ed894bd0b3821e220c4d20660b03c687d2942b5aa609968bc5e567eab8c7eb","observation_id":"98af9672-62c5-4c32-8e14-9b839cba2c5a","resolution":{"observed_at":"2026-08-07T06:04:13.008703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:18.894560Z","title":"Scaling up and distilling down: Language-guided robot skill acquisition,","venue":null,"work_id":"b56ba837-b226-4939-87b3-2d20e47de0fa","year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.641938Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:977d96a1f039c72620c9601d793e273f7489080707064e4a8951552bef579c49","observation_id":"bbab7591-1d4b-449b-800b-4d99923cb8a1","resolution":{"observed_at":"2026-08-07T06:04:19.083800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08981","last_updated":"2022-03-10T18:17:08Z","snapshot_observed_at":"2026-08-03T17:25:16.451880Z","submitted_at":"2021-07-19T15:56:01Z","title":"Hierarchical Few-Shot Imitation with Skill Transition Models","version":2},"cited_work":{"arxiv_id":"2107.08981","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.08981","snapshot_observed_at":"2026-08-07T06:04:17.210255Z","title":"Hierarchical Few-Shot Imitation with Skill Transition Models","venue":"cs.LG","work_id":"277d1a2d-c9ff-48c2-bbe7-596106c7345f","year":2021},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.916780Z"},"links":{"cited_paper":"/paper/2107.08981","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:ae14495e511ebdb20fd7893b8c998948ea86f40fddf4788289d1a65212a13d03","observation_id":"77d7b19a-06fe-44d6-b545-81a41046f6ba","resolution":{"observed_at":"2026-08-07T06:04:17.299566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:13.396260Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.396260Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:f730911e989f9a59ac3e478cda62442481e4ab65876f04580d23c9c58330dd09","observation_id":"af306728-a8d2-493e-bef3-befb557e26f9","resolution":{"observed_at":"2026-08-07T06:04:13.396260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T06:04:14.300460Z","title":"Inner monologue: Embodied reasoning through planning with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.300460Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:8ff924c4c52182e2d134d626b640b6dc1c04a6d21713961d5cc1c61e233adeda","observation_id":"3ab4ef90-0d42-499e-890e-2265f8db6e41","resolution":{"observed_at":"2026-08-07T06:04:14.300460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:18.558100Z","title":"Davi- son","venue":null,"work_id":"6f8deb71-f083-4923-b808-55a0ff3dbea8","year":2018},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.423649Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:3b2a85557ccab6614e201d2ebf0c8cd19a4dde0a19d381ba797c21407694da1c","observation_id":"d1b67de7-7075-4b12-a775-bf24e5ce6635","resolution":{"observed_at":"2026-08-07T06:04:18.676762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14535","last_updated":"2023-10-01T00:51:18Z","snapshot_observed_at":"2026-07-06T15:59:03.095461Z","submitted_at":"2023-07-26T22:52:43Z","title":"Scaling Up and Distilling Down: Language-Guided Robot Skill Acquisition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14535","snapshot_observed_at":"2026-08-07T06:04:13.792473Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.792473Z"},"links":{"cited_paper":"/paper/2307.14535","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:60eee37fc80f3fa36a1d37dfa37ebab7063de2e863bfe108d0a00e2420568a9d","observation_id":"301e6b42-0a85-4c6a-b92b-082e95a0d7a5","resolution":{"observed_at":"2026-08-07T06:04:13.792473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:14.632736Z","title":"Egomimic: Scaling imitation learning via egocentric video, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.632736Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:efb7aa7a4eaa4328b7f6873c6b6191401a54a135b78937711cdf1c4d05541a64","observation_id":"4499946b-792c-45f3-a8ee-e712764fee94","resolution":{"observed_at":"2026-08-07T06:04:14.632736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:14.064861Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.064861Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:0b9382759f0d43805165abd6ef492bef75cd48eeb89079dc151b31d3597b5028","observation_id":"eb8e90ef-5c1e-42c4-843a-b877d33a5a80","resolution":{"observed_at":"2026-08-07T06:04:14.064861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:18.292187Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":"babc97c9-bcb6-4a91-8b9c-56912dfede0a","year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.874563Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:718e736b6471c8569e3513c615e7fe8654f389a90257d768cc4576376cf93b1f","observation_id":"64a33463-34f3-4274-a335-c93734941f1e","resolution":{"observed_at":"2026-08-07T06:04:18.399852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-08-05T02:35:14.331933Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-08-07T06:04:15.152345Z","title":"Code as policies: Language model programs for embod- ied control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.152345Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:4296e058ef52fdf266864b2b870cf284ce2ca67e33e48c89f258133c13854460","observation_id":"ddc84c13-9c55-4c89-8003-930e5b9430ff","resolution":{"observed_at":"2026-08-07T06:04:15.152345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-08-08T15:04:46.831297Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-07T06:04:15.276212Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.276212Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:1af7eb433d05ebf648a26a3960636ab56405757e72b6d305eb94e13f3fd81d34","observation_id":"094e848f-e007-4bf2-a841-b7ed10906f90","resolution":{"observed_at":"2026-08-07T06:04:15.276212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:14.540458Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.540458Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:bc6a94b66a2acdea8875f626fc246bad7acabb2fe9e8b501c2f145c031dcf6e6","observation_id":"d40ce355-46d7-4239-bb10-ed404cb7b352","resolution":{"observed_at":"2026-08-07T06:04:14.540458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:18.095830Z","title":"Learning latent plans from play","venue":null,"work_id":"352ca227-9835-4c7a-a0f5-495706026951","year":2020},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.530183Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:148b8e7bfaa1d5bb98f198787fe34b85626f57fe9ac78cd06afeef4e45c3813f","observation_id":"a2f8b3cc-c20c-44cb-ac76-a04d0f763938","resolution":{"observed_at":"2026-08-07T06:04:18.177456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-07T06:04:14.738359Z","title":"Droid: A large-scale in-the- wild robot manipulation dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.738359Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:4d7a595fdffbd6432d659e8ae7f025fec845d45f38fa7de0155a658e9cdc14d4","observation_id":"8f362bea-e46d-4cea-a396-ee2e0a5f58dc","resolution":{"observed_at":"2026-08-07T06:04:14.738359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.04742","last_updated":"2018-12-04T08:44:08Z","snapshot_observed_at":"2026-07-06T06:49:53.002704Z","submitted_at":"2018-07-12T17:51:16Z","title":"Visual Reinforcement Learning with Imagined Goals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.04742","snapshot_observed_at":"2026-08-07T06:04:15.752484Z","title":"Visual reinforcement learning with imagined goals, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.752484Z"},"links":{"cited_paper":"/paper/1807.04742","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:d21adcfed3e2e187ec2bc19ce5dbd0e6b508b3e9e2162963f3ee48425e5487cb","observation_id":"4aa998ca-47b7-4171-9228-3d09c27d40f0","resolution":{"observed_at":"2026-08-07T06:04:15.752484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T06:04:14.996024Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.996024Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:5806a1995f1fff10f2a7d09a9224c6808e490b959f7bf6f61150ceb1dac86a6c","observation_id":"c258ec24-6ed2-4454-aacd-133ee025ff65","resolution":{"observed_at":"2026-08-07T06:04:14.996024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-08-07T06:04:16.013005Z","title":"Llarva: Vision-action instruction tuning enhances robot learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.013005Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:380c32d386964b80cb5608a745bade7175fea4da1e676c1d7230f62e6c04c058","observation_id":"9e66d2b2-3332-410e-b1d7-9f79c874c03c","resolution":{"observed_at":"2026-08-07T06:04:16.013005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:17.967462Z","title":null,"venue":null,"work_id":"82e6e406-f05c-41c3-afd0-963249e2eb11","year":2006},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.122763Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:c2ab25081a01cf89672a4499303a30c0fc472ca5564ab0406aa112da5c89b9ce","observation_id":"4e0423d0-c961-43ae-944f-95f520db5b34","resolution":{"observed_at":"2026-08-07T06:04:18.027711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T06:04:15.419455Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.419455Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:6138b78a1f778977f8de58c6f94c76dd2a9cacf6a90f20b4781b0a7311dba3ed","observation_id":"587726b3-0826-4a81-afb2-4cc58c84d4e1","resolution":{"observed_at":"2026-08-07T06:04:15.419455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01517","last_updated":"2022-05-02T12:04:59Z","snapshot_observed_at":"2026-08-04T15:32:11.783625Z","submitted_at":"2021-10-04T15:36:32Z","title":"Skill Induction and Planning with Latent Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01517","snapshot_observed_at":"2026-08-07T06:04:16.313044Z","title":"Skill induction and planning with latent language, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.313044Z"},"links":{"cited_paper":"/paper/2110.01517","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:716e7e568bd7aa82069fdd0637e6b3afbd12fdb9ee3f6d4b5681a071f96d16af","observation_id":"c30664b7-ea4d-4650-9262-cd75fe29750e","resolution":{"observed_at":"2026-08-07T06:04:16.313044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09312","last_updated":"2017-08-08T21:46:24Z","snapshot_observed_at":"2026-07-06T05:35:24.598806Z","submitted_at":"2017-03-27T21:16:30Z","title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.09312","snapshot_observed_at":"2026-08-07T06:04:15.631738Z","title":"Dex-net 2.0: Deep learning to plan ro- bust grasps with synthetic point clouds and analytic grasp metrics, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.631738Z"},"links":{"cited_paper":"/paper/1703.09312","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:91bd0a16fca82ae291c3329c14193e1e73d8cd0af4a9dace18a076b5e74e4165","observation_id":"335c160c-5635-429c-8999-124272021dc1","resolution":{"observed_at":"2026-08-07T06:04:15.631738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16605","last_updated":"2023-10-11T18:09:59Z","snapshot_observed_at":"2026-07-06T15:48:05.491179Z","submitted_at":"2023-06-29T00:12:21Z","title":"KITE: Keypoint-Conditioned Policies for Semantic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16605","snapshot_observed_at":"2026-08-07T06:04:16.485673Z","title":"Kite: Keypoint-conditioned policies for semantic manipulation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.485673Z"},"links":{"cited_paper":"/paper/2306.16605","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:e6ad27c4fb70ab8bd4e49e7e901d8d5660477a6fdfc1d1e23ba831f120798cd4","observation_id":"c3d5ce3a-d78e-4923-82b3-774bae28362f","resolution":{"observed_at":"2026-08-07T06:04:16.485673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02523","last_updated":"2024-06-04T17:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T17:41:31Z","title":"RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02523","snapshot_observed_at":"2026-08-07T06:04:15.921883Z","title":"Robocasa: Large-scale simulation of everyday tasks for generalist robots, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:15.921883Z"},"links":{"cited_paper":"/paper/2406.02523","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:ae8d7ec824a6f1f2617b7890cc709c6ade8aa1c6badad587baa45770b5b8bb71","observation_id":"0257a728-d1a0-4ecd-aa02-63c2951c0e17","resolution":{"observed_at":"2026-08-07T06:04:15.921883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T06:04:16.624067Z","title":"Robotic control via embodied chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.624067Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:df3f69716e48647af5b762c6d36b71a7a102a4e5fab9be45991e094e524d8207","observation_id":"769b965c-2dee-46ec-8b43-21acd8735ce3","resolution":{"observed_at":"2026-08-07T06:04:16.624067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-07T06:04:16.711246Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.711246Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:ee4b2b532766817c706a2a430eb2d1f1e09308fe1c58809e8dab2671c08e2657","observation_id":"dd3f4caf-acb7-4b27-b876-81fd35ced15e","resolution":{"observed_at":"2026-08-07T06:04:16.711246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:17.800460Z","title":"Discovering motor programs by re- composing demonstrations","venue":null,"work_id":"f7466876-04a7-44e9-bd22-c60d5071deb6","year":2020},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.248457Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:74fd02ea8a8dbe61a923b3a1fdf38b60ad4ea720ec5fb8922fe296f064ededbc","observation_id":"5bd28e61-5b4f-4f08-a081-3bfc54cceac9","resolution":{"observed_at":"2026-08-07T06:04:17.857100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10807","last_updated":"2026-06-22T19:43:20Z","snapshot_observed_at":"2026-07-06T17:04:17.738921Z","submitted_at":"2023-12-17T20:13:20Z","title":"Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10807","snapshot_observed_at":"2026-08-07T06:04:16.844847Z","title":"left\", \"right","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.844847Z"},"links":{"cited_paper":"/paper/2312.10807","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:b0304835d0be7fc5b500e62a0f98a8b9e487877544e1707b2c7215a6d8b934e3","observation_id":"d2eee499-57e4-4e5f-8b69-f99ad7ae9380","resolution":{"observed_at":"2026-08-07T06:04:16.844847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07899","last_updated":"2023-10-11T21:10:21Z","snapshot_observed_at":"2026-08-07T12:50:27.325576Z","submitted_at":"2023-10-11T21:10:21Z","title":"RoboCLIP: One Demonstration is Enough to Learn Robot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07899","snapshot_observed_at":"2026-08-07T06:04:16.384793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.384793Z"},"links":{"cited_paper":"/paper/2310.07899","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:d91d4ebe3461cff1227d0d67fbacfa2cda8c22f2aaed9008e0fe1130a73a9533","observation_id":"04ea60fa-6bd8-421d-b5fd-28f30bf65f3a","resolution":{"observed_at":"2026-08-07T06:04:16.384793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:17.602105Z","title":"Robust imitation of diverse behaviors, 2017","venue":null,"work_id":"1f81d370-d0a2-44f3-8679-6528cb7ee32d","year":2017},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.546319Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:554231678bdd0846b84e7d079391a44e0cd147bf9e02c0233440e1cebfe66030","observation_id":"5f61b262-e051-453d-ab56-4b5be6ccd34f","resolution":{"observed_at":"2026-08-07T06:04:17.688878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:04:16.776984Z","title":"Zhao, Jonathan Tompson, Danny Driess, Pete Florence, Kamyar Ghasemipour, Chelsea Finn, and Ayzaan Wahid","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:16.776984Z"},"links":{"citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:d35cad4d816993b403e92c7fc97e0e75bab2968790e9df2c30e5c3078b616d30","observation_id":"7af48a98-fc57-4197-9039-0db98dc9e37a","resolution":{"observed_at":"2026-08-07T06:04:16.776984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05838","last_updated":"2020-05-27T06:47:07Z","snapshot_observed_at":"2026-07-06T08:00:11.162659Z","submitted_at":"2019-06-13T17:39:52Z","title":"Goal-conditioned Imitation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05838","snapshot_observed_at":"2026-08-07T06:04:12.655115Z","title":null,"venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:12.655115Z"},"links":{"cited_paper":"/paper/1906.05838","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:36d417486c72d4c438bf52fe32613c3f2d4dcdf2904805e81017add6542efb98","observation_id":"3337a975-e389-4e13-8b0d-db66e74bdc7e","resolution":{"observed_at":"2026-08-07T06:04:12.655115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-06T08:07:23.771593Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-07T06:04:14.191632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:14.191632Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:3739bdb9a20f890752fefe32960e714a84713274250742ddb56333774e693f46","observation_id":"bc320820-7c37-4171-98ce-06cae42dc222","resolution":{"observed_at":"2026-08-07T06:04:14.191632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-07T20:30:49.785912Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-07T06:04:13.524282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:13.524282Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:eda58f2f81d372bdffbbc12661bbe25535b5bd0e109e58b65d3ebb5e1718499c","observation_id":"7ccb436b-01f9-486c-a6c5-f9be3b136d8c","resolution":{"observed_at":"2026-08-07T06:04:13.524282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12168","last_updated":"2024-01-22T18:01:01Z","snapshot_observed_at":"2026-08-08T07:48:26.170625Z","submitted_at":"2024-01-22T18:01:01Z","title":"SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12168","snapshot_observed_at":"2026-08-07T06:04:11.687427Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:11.687427Z"},"links":{"cited_paper":"/paper/2401.12168","citing_paper":"/paper/2506.06196"},"observation_digest":"sha256:1613fb0a6435616632c437afa7bfa7d9133fc18987149df86a7ae55896efb528","observation_id":"a82e9a24-ed16-4b9a-a427-25cd479fe798","resolution":{"observed_at":"2026-08-07T06:04:11.687427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06196","last_updated":"2025-06-06T15:57:48Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T03:36:14.586019Z","submitted_at":"2025-06-06T15:57:48Z","title":"Bridging Perception and Action: Spatially-Grounded Mid-Level Representations for Robot Generalization"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2506.06196."}