{"as_of":"2026-08-17T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f358331e93cb481052e5bb487d1c71c4ef81b3756f6436dea5e393545a607a81","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:33:41.001318Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21627/citation-record","integrity":"/paper/2506.21627/integrity","json":"/paper/2506.21627/citation-record.json","paper":"/paper/2506.21627"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-15T18:33:40.311558Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.311558Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:01e29b8b1633cb19b440d21daf8189f194c22787ca81e505901be76b145c4e59","observation_id":"9acdae59-8f94-48f8-b167-21108caf4dbf","resolution":{"observed_at":"2026-08-15T18:33:40.311558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T18:33:40.355272Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.355272Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:3218c0c4ab5da14f0338cca7b5e5eab9ad6be545e2509544228ff6538dc53998","observation_id":"638013c5-272c-49f9-b28c-150a3ee7e338","resolution":{"observed_at":"2026-08-15T18:33:40.355272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-15T18:33:40.360796Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.360796Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:610615d6c74e4ac664010fbd18b252b056a1eeaab6090e65faa03a1947bb62f2","observation_id":"71c8e237-0d9e-4b07-a525-b4c35664547a","resolution":{"observed_at":"2026-08-15T18:33:40.360796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-15T18:33:40.366042Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.366042Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:fea0593c28199229e2664dcf09ceac87048029a06abccd236f4ca481b90b3c56","observation_id":"dad0d8a4-4860-4185-9244-b420c72848e1","resolution":{"observed_at":"2026-08-15T18:33:40.366042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-15T18:33:40.371578Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.371578Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:bd8119100b02ee50d6de755c5e16ed621489a416fa8c8033db3acc4af314363b","observation_id":"17cb6abe-14cc-46a4-91c6-2d5e90f33e1e","resolution":{"observed_at":"2026-08-15T18:33:40.371578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-16T14:46:11.532367Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-15T18:33:40.376627Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.376627Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:6a4212a0a5068cb5ca85ec0cab293303af29c9b6bf8614dede61769a78624787","observation_id":"4925d189-943c-4e12-92e6-01fad0759725","resolution":{"observed_at":"2026-08-15T18:33:40.376627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-15T18:33:40.382416Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.382416Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:cd6d13edeb00d582699330c2ac4d6e10d1aca6855e339288cb90df094db1bc44","observation_id":"9317cc87-8624-4cc5-96a8-0e2dd883d5ec","resolution":{"observed_at":"2026-08-15T18:33:40.382416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-15T18:33:40.387764Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.387764Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:8898efc387946b0ace35c1a3db608aa1c9457c99890031f4d0f827bdd548484b","observation_id":"72e4fd1e-67a5-482c-a07f-1459c9edcbe4","resolution":{"observed_at":"2026-08-15T18:33:40.387764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-15T18:33:40.392626Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.392626Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:63aee6deaa7338bc40b6311c894406fc29d1e7357b05dc132afd1c1bc8ff108e","observation_id":"1a635cde-59f1-4711-b7be-672cc51fc324","resolution":{"observed_at":"2026-08-15T18:33:40.392626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-15T18:33:40.397546Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.397546Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:f7305b6ec08d9414677eacbfb5f0ce02175247023b0c125ff37cf8b0c947f6e9","observation_id":"fa83145e-a52a-44de-a4ae-0610c6289c7a","resolution":{"observed_at":"2026-08-15T18:33:40.397546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19510","last_updated":"2025-03-25T10:01:57Z","snapshot_observed_at":"2026-08-16T12:47:02.484468Z","submitted_at":"2025-03-25T10:01:57Z","title":"RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19510","snapshot_observed_at":"2026-08-15T18:33:40.402121Z","title":"Roboflamingo-plus: Fusion of depth and rgb perception with vision-language models for enhanced robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.402121Z"},"links":{"cited_paper":"/paper/2503.19510","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:db07f456e1a0626268d11726585e74e602dc716aa6ce10e8b6ed23f830ae0dfb","observation_id":"6f2e4fbf-ae08-48ef-a0a5-fd75f90fba7b","resolution":{"observed_at":"2026-08-15T18:33:40.402121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-15T18:33:40.407218Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.407218Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:a264f8c3a31adb74fe65b52b6f26eb15eaf50447044f408ce51ed9c26cd8fc65","observation_id":"6eb58b9b-21a7-47fd-b367-d89dec916a1a","resolution":{"observed_at":"2026-08-15T18:33:40.407218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-15T18:33:40.413435Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.413435Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:25a925052444a84a14cd0ab656e8d1a1834858166eaf90db1fc53aaf28533c6c","observation_id":"eb689115-5562-41e8-bfe7-5f03ac42b461","resolution":{"observed_at":"2026-08-15T18:33:40.413435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-08-11T02:04:51.188806Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-15T18:33:40.480171Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.480171Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:40223cd15c5f62d4722599ad6ba88c50e7915e03fc1e073fa1f1099afb2e8016","observation_id":"ed12329b-e38f-4ed7-a09c-1ce558020aca","resolution":{"observed_at":"2026-08-15T18:33:40.480171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-17T09:51:16.654214Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-15T18:33:40.539824Z","title":"Pointvla: Injecting the 3d world into vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.539824Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:9d9e26058ebd1254179f77abdf9a0076547eb2dc13a2be9fe900e46ca8ec6171","observation_id":"d3990cfa-2027-4ad4-9b23-8e9237975210","resolution":{"observed_at":"2026-08-15T18:33:40.539824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-15T18:33:40.544727Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.544727Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:a6dca6660a0c5535631b29f81eb418220d329bd526567eaf5bf77c63d1fe9028","observation_id":"03397fc6-4d92-4ace-8bbf-2a586f8c20ca","resolution":{"observed_at":"2026-08-15T18:33:40.544727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T18:33:40.548862Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.548862Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:2121b88cef88ffdc291fb23d51423c4dc9cd7731dcf2d27337c76cc90b3bb5fa","observation_id":"20c04634-06c0-4e64-805b-69bdc14ee3c4","resolution":{"observed_at":"2026-08-15T18:33:40.548862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-08-15T18:33:40.553841Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.553841Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:0d74ae80652a5a385707748cdecc3150f4b5076cd5277ba916602e1606148fd1","observation_id":"c1c46419-560f-49a3-bb96-b77f8a14d57f","resolution":{"observed_at":"2026-08-15T18:33:40.553841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-15T18:33:40.559196Z","title":"Gemini robotics: Bringing ai into the physical world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.559196Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:42e37cc29a03623ab03d06f7446ea5427281f0fafd3923c0dcfbd2499051e4f0","observation_id":"51f34591-b112-469f-ba39-d709416c42b1","resolution":{"observed_at":"2026-08-15T18:33:40.559196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21257","last_updated":"2025-03-25T05:46:03Z","snapshot_observed_at":"2026-08-16T12:54:11.878854Z","submitted_at":"2025-02-28T17:30:39Z","title":"RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21257","snapshot_observed_at":"2026-08-15T18:33:40.563981Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.563981Z"},"links":{"cited_paper":"/paper/2502.21257","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:5f0d316d41462b8515178cbdf97c1877f281a8cadd2171ba5f990aa707401476","observation_id":"fcbdc1f9-4a7f-48dd-981a-dda23e518026","resolution":{"observed_at":"2026-08-15T18:33:40.563981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-16T14:39:09.587564Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-08-15T18:33:40.568980Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.568980Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:1e54c51df7c3b28875854d82c5f467e97549d1339b71bdcfbe8169f1f5e04646","observation_id":"b3856b48-3ca6-4573-b89b-db22a530e895","resolution":{"observed_at":"2026-08-15T18:33:40.568980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02193","last_updated":"2024-10-03T04:14:21Z","snapshot_observed_at":"2026-08-16T13:13:06.020109Z","submitted_at":"2024-10-03T04:14:21Z","title":"Guiding Long-Horizon Task and Motion Planning with Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02193","snapshot_observed_at":"2026-08-15T18:33:40.598576Z","title":"Guiding long-horizon task and motion planning with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.598576Z"},"links":{"cited_paper":"/paper/2410.02193","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:5dd1a00b2afa515085b3f8025ad19213ca10133d1db1dae8b47e506c6a89de54","observation_id":"f2fb0ea0-2ead-49a1-8222-826997721c3c","resolution":{"observed_at":"2026-08-15T18:33:40.598576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:33:40.691651Z","title":"Open-world task and mo- tion planning via vision-language model inferred constraints","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.691651Z"},"links":{"citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:3dbfae4424c5a6f034b52e8b74d9923f3230bfa3c06f87b22aa986567cc46727","observation_id":"fc591322-80f5-48e5-ba7f-3eb799ba3c21","resolution":{"observed_at":"2026-08-15T18:33:40.691651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:33:40.778509Z","title":"Sofar: Language-grounded orientation bridges spatial reasoning and object manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.778509Z"},"links":{"citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:381164e12e1f1d57ef9edf5c3c4e932a5de9b3123e25ff6035055f0fc960c204","observation_id":"9a67c72a-4f78-4d20-9000-ded50285f855","resolution":{"observed_at":"2026-08-15T18:33:40.778509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09829","last_updated":"2024-07-13T09:42:02Z","snapshot_observed_at":"2026-08-16T13:34:32.798731Z","submitted_at":"2024-07-13T09:42:02Z","title":"VLMPC: Vision-Language Model Predictive Control for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09829","snapshot_observed_at":"2026-08-15T18:33:40.854827Z","title":"Vlmpc: Vision-language model predictive control for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.854827Z"},"links":{"cited_paper":"/paper/2407.09829","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:240c49a51f700027fe85cb4c6dfe2dbcfa2621b997b496ce124f29e28e21586f","observation_id":"dccd0830-ecd0-4669-9a81-a86801d11bb0","resolution":{"observed_at":"2026-08-15T18:33:40.854827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10546","last_updated":"2025-03-13T16:59:17Z","snapshot_observed_at":"2026-08-16T12:50:18.238133Z","submitted_at":"2025-03-13T16:59:17Z","title":"KUDA: Keypoints to Unify Dynamics Learning and Visual Prompting for Open-Vocabulary Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10546","snapshot_observed_at":"2026-08-15T18:33:40.874538Z","title":"Kuda: Keypoints to unify dynamics learning and visual prompting for open-vocabulary robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.874538Z"},"links":{"cited_paper":"/paper/2503.10546","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:638f0e599b4b4c14f1182b56881d29c9e1762de4055de7db186629427f496865","observation_id":"9016e6d4-d309-411d-97d1-ab8c0877797b","resolution":{"observed_at":"2026-08-15T18:33:40.874538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-15T18:33:40.879088Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.879088Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:ef9114c843340215b19c01a462c2eab0bf10b62ca21eee2c6b0924628790e3a3","observation_id":"3dd3ad0d-d350-4112-875b-c2d61aec02e2","resolution":{"observed_at":"2026-08-15T18:33:40.879088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-08-16T14:12:33.532936Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-15T18:33:40.883770Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.883770Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:42c239cf9fd270468cc9403f0608f47bc991a780868bef9217e55e9c3927736b","observation_id":"2ddfb630-de15-4416-8d12-ad5a1b39d3b3","resolution":{"observed_at":"2026-08-15T18:33:40.883770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-15T18:33:40.889573Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.889573Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:62dbb0edbf37bbfbee6cd117aa87ceb5a5db5037d25b825a02a3c36308cf9929","observation_id":"8153fce6-66f6-4404-9f40-0dc7de775b57","resolution":{"observed_at":"2026-08-15T18:33:40.889573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03841","last_updated":"2025-01-07T14:50:33Z","snapshot_observed_at":"2026-08-16T17:04:20.261940Z","submitted_at":"2025-01-07T14:50:33Z","title":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03841","snapshot_observed_at":"2026-08-15T18:33:40.896674Z","title":"Omni- manip: Towards general robotic manipulation via object-centric interaction primitives as spatial constraints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.896674Z"},"links":{"cited_paper":"/paper/2501.03841","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:c5ae4d3b9ea4722bd038b4dfd257a92922c3c117791191af32378d6a263f2a4f","observation_id":"bfaa7033-d236-45a5-a8c8-7db095987b8a","resolution":{"observed_at":"2026-08-15T18:33:40.896674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-15T10:36:09.653529Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09783","snapshot_observed_at":"2026-08-15T18:33:40.901745Z","title":"Geomanip: Geometric constraints as general interfaces for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.901745Z"},"links":{"cited_paper":"/paper/2501.09783","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:98ecd23b19f57e55d9d6588953db7c4eebeea0a5840f2a4513bab41f3c80a850","observation_id":"88ab367e-1bbf-48f5-aec3-33938e82b765","resolution":{"observed_at":"2026-08-15T18:33:40.901745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04455","last_updated":"2025-03-21T14:54:29Z","snapshot_observed_at":"2026-08-17T19:44:45.637480Z","submitted_at":"2024-12-05T18:58:27Z","title":"Code-as-Monitor: Constraint-aware Visual Programming for Reactive and Proactive Robotic Failure Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04455","snapshot_observed_at":"2026-08-15T18:33:40.906539Z","title":"Code-as-monitor: Constraint-aware visual programming for reactive and proac- tive robotic failure detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.906539Z"},"links":{"cited_paper":"/paper/2412.04455","citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:61e46368990aee4de0a9e072e03c5de0ebabbfcf19b0cab8b10faf4af557757c","observation_id":"6bccd161-ac33-427a-9878-7a4a88254a48","resolution":{"observed_at":"2026-08-15T18:33:40.906539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:33:41.836769Z","title":"Doremi: Grounding language model by detecting and recovering from plan-execution misalignment","venue":null,"work_id":"dd3048a4-b296-42e2-9aa6-0c7c0fba46ab","year":2024},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:40.947340Z"},"links":{"citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:008baae08b691d5b04aaa0732cb9b0392d22e3d53044604feb736cbbed008342","observation_id":"6a65d874-1734-49aa-8385-b9b1ab956f85","resolution":{"observed_at":"2026-08-15T18:33:41.843553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:33:41.817713Z","title":"object unexpectedly moved","venue":null,"work_id":"ae1b9b0d-515d-4eee-ace1-f001bc96d725","year":1936},"citing_paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:41.001318Z"},"links":{"citing_paper":"/paper/2506.21627"},"observation_digest":"sha256:f0a92293446a19a29992f2f8c8e66a78e77ff2cb3545c5be01cb32585c8e37b2","observation_id":"bfae37db-c2c9-4b2f-85f0-81ff6dee8204","resolution":{"observed_at":"2026-08-15T18:33:41.824556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21627","last_updated":"2025-06-24T14:11:22Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T12:04:29.320693Z","submitted_at":"2025-06-24T14:11:22Z","title":"FrankenBot: Brain-Morphic Modular Orchestration for Robotic Manipulation with Vision-Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2506.21627."}