{"as_of":"2026-08-19T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:503b38325ba91b8ea4c93d1efdf0fbc3daf07ae92b03dc013fa3421d3ec8c0e9","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:21:39.190424Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06256/citation-record","integrity":"/paper/2607.06256/integrity","json":"/paper/2607.06256/citation-record.json","paper":"/paper/2607.06256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:36.930757Z","title":"Do As I Can, Not As I Say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.930757Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:a561fc64ed19655a0a0c1c82d0ecd3bd325bd68b91069c440870a6a55a114866","observation_id":"9e48dca1-2d8a-4c68-bede-3590cba5a6e2","resolution":{"observed_at":"2026-08-02T08:21:36.930757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-02T08:21:36.948882Z","title":"RoboBrain 2.0 technical report.arXiv preprint arXiv:2507.02029, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.948882Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:9657ba5424ec49d432a7c2c4485adbf24612672e03f5200c8c5aeb11cf491ab7","observation_id":"08bcabca-1051-4af6-b540-b0d21096afe0","resolution":{"observed_at":"2026-08-02T08:21:36.948882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T08:21:36.963029Z","title":"arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.963029Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:b4f53e32f77f6ed86f0cf88c064c8b322b863678429eacd497c6fd2c8bfd362b","observation_id":"6369f292-34ae-48fe-9a1a-7824682db02b","resolution":{"observed_at":"2026-08-02T08:21:36.963029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T08:21:36.984901Z","title":"RT-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.984901Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:d8b363a758899b84ffdf557513b44713a11b5ebeb2831fe54291d56f3f8fa6b3","observation_id":"ec3797da-f2f0-4ea9-8042-fae0b464c7ea","resolution":{"observed_at":"2026-08-02T08:21:36.984901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-02T08:21:36.995061Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:36.995061Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:c6158609c31352226a3b33553f6e96dc2cfd42c2dfd555cb259b93b535877a75","observation_id":"917525f3-eb59-465b-8da7-bce32f98a84a","resolution":{"observed_at":"2026-08-02T08:21:36.995061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-02T08:21:37.001317Z","title":"WorldVLA: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.001317Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:610cdd575716f4f086c9bf0720db760410ed92d40730813fb1cd503fc2a83cc3","observation_id":"57e95438-548d-4df5-a9b1-1d2a7cb9ee90","resolution":{"observed_at":"2026-08-02T08:21:37.001317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-02T08:21:37.011874Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.arXiv preprint arXiv:2303.04137, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.011874Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:201a133f26cc7b2fb04c0520c810b230e04bb622564c83c47c9ba591c7eb52d6","observation_id":"6ecf9c8a-839b-4806-a1d9-449fa2c14f24","resolution":{"observed_at":"2026-08-02T08:21:37.011874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22435","last_updated":"2026-07-02T17:36:10Z","snapshot_observed_at":"2026-08-17T04:07:31.550147Z","submitted_at":"2026-03-23T18:08:10Z","title":"CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22435","snapshot_observed_at":"2026-08-02T08:21:37.015901Z","title":"CaP-X: A framework for benchmarking and improving coding agents for robot manipulation.arXiv preprint arXiv:2603.22435, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.015901Z"},"links":{"cited_paper":"/paper/2603.22435","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:622a0f4d9f7643600968c4dcc254bb6dfb0128a2c63b2ee1dcab027e2f4f6794","observation_id":"0ce6a5d0-e9ec-4db7-9e72-f313aee174b4","resolution":{"observed_at":"2026-08-02T08:21:37.015901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.021234Z","title":"PDDLStream: Integrating symbolic planners and blackbox samplers via optimistic adaptive planning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.021234Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:031b498e6fb40544327c03bf098997f4121af8ea6eb30ab0efccc2cd3e3fc90f","observation_id":"56c0dc92-3929-4f66-a01b-8f392496b9ec","resolution":{"observed_at":"2026-08-02T08:21:37.021234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.024578Z","title":"TIGeR: Tool-integrated geometric reasoning in vision-language models for robotics.arXiv preprint arXiv:2510.07181, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.024578Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:27a82d7e62154dfad4e948191eeecad82484a132afa8dcf3fe867cc66b681255","observation_id":"2492a56b-fbb4-444f-9338-7c9209f21352","resolution":{"observed_at":"2026-08-02T08:21:37.024578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.027682Z","title":"H-WM: Robotic task and motion planning guided by hierarchical world model.arXiv preprint arXiv:2602.11291, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.027682Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:deccd8d8110d9e2581f3c570e8b87673f3dd9292e4ec65de7c48fcf928ae7f3f","observation_id":"d2b041b7-30ba-4dce-a6f2-1c78388a81af","resolution":{"observed_at":"2026-08-02T08:21:37.027682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.030746Z","title":"Inner Monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.030746Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:75f3c56a65f3c5e3e644011626d6b0bb55b43e5eb683565b5d0884634e80f5ad","observation_id":"85ec16b0-f9c1-4e33-b6fd-7dcf23fefb30","resolution":{"observed_at":"2026-08-02T08:21:37.030746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.036368Z","title":"V oxPoser: Composable 3D value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.036368Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:8d62e5681af636dd73bf6598b76840a84b15dc7892a6e3953be38942cc4904a8","observation_id":"dacefc99-1fba-4797-a7a6-3cca6ed9bc7d","resolution":{"observed_at":"2026-08-02T08:21:37.036368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-02T08:21:37.164694Z","title":"VIMA: General robot manipulation with multimodal prompts.arXiv preprint arXiv:2210.03094, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.164694Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:0362e03d126317ddcf98cd450fb3a2115ed75b9c0bd1e90d77c225308c9d45e6","observation_id":"58c7f301-d62d-4abb-aa3c-0a8bae451664","resolution":{"observed_at":"2026-08-02T08:21:37.164694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.262300Z","title":"Hier- archical task and motion planning in the now","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.262300Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:092f5d0ea655e7acca8c582986f5b230a6e3ffadeda1a6a9a67980b09bf7f2ef","observation_id":"0a9a65f2-2496-4352-a762-02e0c7e6ea47","resolution":{"observed_at":"2026-08-02T08:21:37.262300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T08:21:37.378731Z","title":"Open- VLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.378731Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:76097721b44eb1eda3a3341a59200c75074d6d77d1698b31387473b24d6a976d","observation_id":"05fb2e5c-3794-445f-9e0f-904d15d8d1a7","resolution":{"observed_at":"2026-08-02T08:21:37.378731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.440569Z","title":"BEHA VIOR-1K: A benchmark for embodied AI with 1,000 everyday activities and realistic simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.440569Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:88901274fb78c1af72dc04e22a3f33957fe4e1b62cee481ccca433998c19f088","observation_id":"75555e82-84cb-410e-b71c-c96aaec60d49","resolution":{"observed_at":"2026-08-02T08:21:37.440569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15068","last_updated":"2025-02-05T08:49:14Z","snapshot_observed_at":"2026-08-18T01:24:03.436765Z","submitted_at":"2025-01-25T04:19:33Z","title":"An Atomic Skill Library Construction Method for Data-Efficient Embodied Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15068","snapshot_observed_at":"2026-08-02T08:21:37.542259Z","title":"An atomic skill library construction method for data-efficient embodied manipulation.arXiv preprint arXiv:2501.15068, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.542259Z"},"links":{"cited_paper":"/paper/2501.15068","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:855a2e62ddfe7be8559955613ce9c6569997d286c9c17b96562b94688ee55dc4","observation_id":"e229040f-300b-4ff5-aa0e-31991967f9db","resolution":{"observed_at":"2026-08-02T08:21:37.542259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.598653Z","title":"RoboClaw: An agentic framework for scalable long-horizon robotic tasks.arXiv preprint arXiv:2603.11558, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.598653Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:2b8aad0f1445e030ef48b91a72b39062f65f38c066ff50d69054f29ee96becb5","observation_id":"2a1c37b8-9765-4852-bc45-860cdc68adef","resolution":{"observed_at":"2026-08-02T08:21:37.598653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.700761Z","title":"Code as Policies: Language model programs for em- bodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.700761Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:13a8d5620df16ec53f3c2073dd079a44fda4e0a6cac3203ea2e6b55830f009ee","observation_id":"ea04134c-62f9-421a-9fcc-2b66fb691cee","resolution":{"observed_at":"2026-08-02T08:21:37.700761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T08:21:37.785322Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.785322Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:81269031aaeff4a413cadb34b8333394c095944f2d69526c2507128f7727c7e8","observation_id":"4a887c34-dc58-44fb-98db-896c51f56e99","resolution":{"observed_at":"2026-08-02T08:21:37.785322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-02T08:21:37.856668Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.856668Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:dc278942ed750287701bc600faba669f2cc004769ad4a243080b4b692cb0a6e2","observation_id":"0c34976a-0040-43a0-afcb-6b90e89d0cf2","resolution":{"observed_at":"2026-08-02T08:21:37.856668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:37.962258Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:37.962258Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:660bad11661f5dfa44a5c67bb18448f4a3f6af0bda6f29dee4ef46622d16a73f","observation_id":"9fabf01f-a488-4367-ab4b-2a6e21a8a71a","resolution":{"observed_at":"2026-08-02T08:21:37.962258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:38.094091Z","title":"Gordon, and J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.094091Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:d288ea5a8a05269b9d8eef679b1702439ed72a2fd0d5ed39c20f9ef99714223e","observation_id":"1b72e14d-634d-4556-b27d-9f8d6437492e","resolution":{"observed_at":"2026-08-02T08:21:38.094091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-02T08:21:38.222946Z","title":"MemoryVLA: Perceptual- cognitive memory in vision-language-action models for robotic manipulation.arXiv preprint arXiv:2508.19236, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.222946Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:10e68af078ac234251db40f550aa0764f1bd5fdb4323cf02b503e257873db780","observation_id":"642b594e-df45-4729-8ace-d6cd3323287b","resolution":{"observed_at":"2026-08-02T08:21:38.222946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:38.342518Z","title":"MAESTRO: Orchestrating robotics modules with vision-language models for zero-shot generalist robots.arXiv preprint arXiv:2511.00917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.342518Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:a7d5f5bc8ebd77088543540aa82355cc4ca43d84a246df8eb17c5ad5254c9f15","observation_id":"6a3cb752-57ae-42c6-bbd8-0e35d41bf82a","resolution":{"observed_at":"2026-08-02T08:21:38.342518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:38.511360Z","title":"CLI- Port: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.511360Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:7c8d53c5333c6558fe63f6d4255a28b31f53a645feb28bc0e3d9be968fa4af9e","observation_id":"211406bc-a90f-4e25-ab13-8c35a80de2b3","resolution":{"observed_at":"2026-08-02T08:21:38.511360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:38.672316Z","title":"Perceiver-actor: A multi-task transformer for robotic ma- nipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.672316Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:127fb7bbbac5dc1163a1089d2e55b0ee11b95f001740c2d3142fb85027452b21","observation_id":"e6e798b6-d446-461b-b422-664208284a07","resolution":{"observed_at":"2026-08-02T08:21:38.672316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:38.857771Z","title":"ManiAgent: An agentic framework for general robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:38.857771Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:a27985fd9819079a927926d507e86eda8b166952e76c717bea01c057a4aec71c","observation_id":"60fcc17d-9c3a-41ac-97d4-88feb5c76e4f","resolution":{"observed_at":"2026-08-02T08:21:38.857771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23450","last_updated":"2025-06-11T03:16:06Z","snapshot_observed_at":"2026-08-07T12:43:12.816737Z","submitted_at":"2025-05-29T13:56:49Z","title":"Agentic Robot: A Brain-Inspired Framework for Vision-Language-Action Models in Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23450","snapshot_observed_at":"2026-08-02T08:21:39.024057Z","title":"Agentic robot: A brain- inspired framework for vision-language-action models in embodied agents.arXiv preprint arXiv:2505.23450, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:39.024057Z"},"links":{"cited_paper":"/paper/2505.23450","citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:1eda9c3e00a08edecd7edaf3d9e585cdd3183242e9948781856aedb965c218f9","observation_id":"2a7face0-0a48-4b3e-87d8-62c078f4c5fe","resolution":{"observed_at":"2026-08-02T08:21:39.024057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:21:39.190424Z","title":"the head camera does not show any object identifiable as a radio close-up and prominent at arm-reach distance. . . the robot has not successfully navigated to the radio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:39.190424Z"},"links":{"citing_paper":"/paper/2607.06256"},"observation_digest":"sha256:3146af4e4279866169df03d2baabb2d5408cc883d0d8dc0638a68b557058bcc6","observation_id":"8f960ae5-af96-478f-914f-c8d6eb446a86","resolution":{"observed_at":"2026-08-02T08:21:39.190424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.06256","last_updated":"2026-07-15T12:10:06Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T06:48:33.158793Z","submitted_at":"2026-07-07T13:24:37Z","title":"Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.06256."}