{"as_of":"2026-08-17T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ab639710033f5e2971091bcfb833c5bbd35005d55f82fa1c386410d9f6da9a8","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:07:35.526355Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:30:14.233767Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T05:31:07.993966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02166","snapshot_observed_at":"2026-08-15T21:30:14.233767Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09723","last_updated":"2025-05-14T18:30:53Z","snapshot_observed_at":"2026-08-17T16:11:04.845043Z","submitted_at":"2025-05-14T18:30:53Z","title":"EnerVerse-AC: Envisioning Embodied Environments with Action Condition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:30:14.233767Z"},"links":{"cited_paper":"/paper/2505.02166","citing_paper":"/paper/2505.09723"},"observation_digest":"sha256:e2e76f8215338dd5a250e9d896415cf198a0908e0154c57766dc25d3815db10d","observation_id":"c09ebaf2-e8f3-4d1f-a84d-6e3e92ccfded","resolution":{"observed_at":"2026-08-15T21:30:14.233767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02166","snapshot_observed_at":"2026-08-06T20:04:38.174259Z","title":"Crayonrobo: Object-centric prompt-driven vision-language-action model for robotic manipula- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03930","last_updated":"2025-07-08T01:07:30Z","snapshot_observed_at":"2026-08-14T06:49:46.315439Z","submitted_at":"2025-07-05T07:29:37Z","title":"RwoR: Generating Robot Demonstrations from Human Hand Collection for Policy Learning without Robot","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:38.174259Z"},"links":{"cited_paper":"/paper/2505.02166","citing_paper":"/paper/2507.03930"},"observation_digest":"sha256:257e122d6508b1c7bf04b1079335a3f53330c154b8f5ef9ddba2f5f651a8e6fb","observation_id":"677516cd-73b1-4364-9fe9-c089ce42d628","resolution":{"observed_at":"2026-08-06T20:04:38.174259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2505.02166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02166","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"18ba11d7-aeea-4f5d-990e-a492ee8ec103","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2505.02166","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:40ae208cb727d973838fb831604f164afeb0ebca3d4404129ac3aba07bfadaa9","observation_id":"5724532d-63a9-4b65-81f3-4873ec79ff14","resolution":{"observed_at":"2026-05-22T05:31:07.996827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02166/citation-record","integrity":"/paper/2505.02166/integrity","json":"/paper/2505.02166/citation-record.json","paper":"/paper/2505.02166"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T01:07:35.126630Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.126630Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:743d4f72b82b9f952f0872a0798cdf23aaf9ac9b308f8701a284b358f8f50724","observation_id":"149a569b-af01-4ed9-844e-39c17f3230d7","resolution":{"observed_at":"2026-08-16T01:07:35.126630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-16T01:07:35.131633Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.131633Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:761ec0170798efae0f096f76d2381da81c49c83c567a8f5e26c41ab5dc9cff7b","observation_id":"cafd527c-69ef-48a8-abd2-88bd6f46f709","resolution":{"observed_at":"2026-08-16T01:07:35.131633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.479800Z","title":"Rgbmanip: Monocular image-based robotic ma- nipulation through active object pose estimation","venue":null,"work_id":"d6a8fb32-af6b-4bf5-bbf4-3c1a3939e800","year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.136133Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e00d4c82793fc0e57165ae7406ea79a6b6512d2c7776fb2aabded4d3a0d645a7","observation_id":"7188436a-2f6d-48b0-a1a2-4d280e77feb9","resolution":{"observed_at":"2026-08-16T01:07:36.488881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.464167Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":"f572e6da-c3f0-4e70-88fe-3aa6aecf91e5","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.141145Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:1bc6a2fdb9a7075729c7f63d470b32fb8826c22db3fe568e41c10713d4061818","observation_id":"4e711a6a-0e03-4dc9-843f-3ea5df4da4f8","resolution":{"observed_at":"2026-08-16T01:07:36.469049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-16T01:07:35.145605Z","title":"Rt-h: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.145605Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:52e17577f043bc66eddb3ae08084cbc955a175698cf910116efc13b296923067","observation_id":"fc9eb02c-b355-4af0-b1bf-65c2f83c7758","resolution":{"observed_at":"2026-08-16T01:07:35.145605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-16T01:07:35.150528Z","title":"Zero- shot robotic manipulation with pretrained image-editing dif- fusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.150528Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:af804a8266a37a64196ee504b071bd4e5c7a58adc3f7ef1a1d1cc96d0d603e5d","observation_id":"fb27b0b9-b5f2-413e-8a87-a169fa01260e","resolution":{"observed_at":"2026-08-16T01:07:35.150528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-08-17T17:11:08.085240Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-16T01:07:35.155195Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.155195Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:2cced75a747106fb9a0697c9d455aac878bf103133630211c726ef1662f5c767","observation_id":"9d2d146d-9c51-430f-96de-23a1a7c99e8c","resolution":{"observed_at":"2026-08-16T01:07:35.155195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-16T01:07:35.160529Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.160529Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b5ac5bf3761d9a937020bd13b4cf1020dbebb7d452c2a8e0cfdc5d7fe66daddf","observation_id":"2910a782-760d-4c34-8932-5c32285f7682","resolution":{"observed_at":"2026-08-16T01:07:35.160529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-16T01:07:35.164782Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.164782Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:176731db40d1235f9f0218f9316314a9215f9a0bcae16788d1762316ccb1a7fb","observation_id":"dbf9e7bf-de14-4dc5-bad1-eaa521c79943","resolution":{"observed_at":"2026-08-16T01:07:35.164782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.450147Z","title":"Learn- ing video-conditioned policies for unseen manipulation tasks","venue":null,"work_id":"e4878250-2adb-4a32-bc7a-1e472f9fce6d","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.168925Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:4e9ea5805225f0c674aaf61117a18c342954660dd360e8f76f27c375969b1bee","observation_id":"21d186c3-6e44-4105-bce6-7b73dfac9a7f","resolution":{"observed_at":"2026-08-16T01:07:36.454661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-16T01:07:35.173309Z","title":"Diffu- sion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.173309Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:143886d47f573808c8617ddf7c551ea7f8e834538df99fc0bdf72e8b439388e9","observation_id":"c1ed4c0e-aa83-4a38-bd77-c34491eab921","resolution":{"observed_at":"2026-08-16T01:07:35.173309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-16T01:07:35.177187Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.177187Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e58fa5b92204db610165418846382e0428ff967e4870c39e76c1b9c45fdf7d3a","observation_id":"5963346b-1692-42c3-9918-3483dea17c5e","resolution":{"observed_at":"2026-08-16T01:07:35.177187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-08-16T14:51:40.234732Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-08-16T01:07:35.181199Z","title":"Video language planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.181199Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:375537a866eec5560751c69ffa9516dfd28aec005415601cf33378dc4c7b2e6d","observation_id":"d43521d7-4bb5-42e0-bb24-888acee1989d","resolution":{"observed_at":"2026-08-16T01:07:35.181199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.435757Z","title":"Learn- ing universal policies via text-guided video generation","venue":null,"work_id":"4733b6aa-4b2c-4b4b-91c5-1634ddef8004","year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.185082Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:deb89849b9f294715862efc940d35e4901dd0030e4b96b91740bba4d28cdebe2","observation_id":"7046bf35-aa0f-4ab3-9900-9807969bfc0e","resolution":{"observed_at":"2026-08-16T01:07:36.440876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04382","last_updated":"2024-05-02T16:17:25Z","snapshot_observed_at":"2026-08-16T17:01:35.444955Z","submitted_at":"2022-05-09T15:35:33Z","title":"FlowBot3D: Learning 3D Articulation Flow to Manipulate Articulated Objects","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04382","snapshot_observed_at":"2026-08-16T01:07:35.190252Z","title":"Flowbot3d: Learn- ing 3d articulation flow to manipulate articulated objects","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.190252Z"},"links":{"cited_paper":"/paper/2205.04382","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:1dbe1c222168471d05cc94ae7035fd1cceaf6ebcef67f5641ede4e59d758b008","observation_id":"75a1ed49-57b0-4b27-9547-4be82fda2325","resolution":{"observed_at":"2026-08-16T01:07:35.190252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.420446Z","title":"Anygrasp: Robust and efficient grasp perception in spatial and temporal domains","venue":null,"work_id":"c53575f1-5f7b-40bb-b32a-79d210af5762","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.195084Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e76f6d51517fe391a50794a0002746de32bfad198d91e2f6877f6bade1c1ecdf","observation_id":"e8381c6f-c703-4490-a06c-efcf8c2e8356","resolution":{"observed_at":"2026-08-16T01:07:36.426710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.405285Z","title":"The loss of orthogonality in the gram-schmidt orthogonalization process","venue":null,"work_id":"efabd151-be82-43b4-ae17-a5834935a32d","year":2005},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.199432Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e4793059ecfb464358b16a378cbaf28019c1c1250f7b566276254a05104f7aaa","observation_id":"1b291b9d-6d36-4b4d-90ec-25c74d304061","resolution":{"observed_at":"2026-08-16T01:07:36.411000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:35.203581Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.203581Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e4d73212fb78232e4af1b2e9575208514991dcc199f6a53e16c949670122cff7","observation_id":"419d24ee-a5c2-49e0-b696-e9e7aafc89e2","resolution":{"observed_at":"2026-08-16T01:07:35.203581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-08-16T13:43:37.560927Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-08-16T01:07:35.207771Z","title":"Rvt-2: Learning precise manipulation from few demonstrations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.207771Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:e4d60778626fd0cbf13fe15fcb69ee6f92634e78be7971b903a4af0f181487e1","observation_id":"40cdb43f-b7e8-42e4-b2e3-8c0d533e02e4","resolution":{"observed_at":"2026-08-16T01:07:35.207771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01977","last_updated":"2023-11-06T05:53:08Z","snapshot_observed_at":"2026-08-16T14:46:11.532367Z","submitted_at":"2023-11-03T15:31:51Z","title":"RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01977","snapshot_observed_at":"2026-08-16T01:07:35.211653Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.211653Z"},"links":{"cited_paper":"/paper/2311.01977","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:7c6d2480340ac3e399b1488ff5028e1cb1d946651a447eea5460c13864d6262e","observation_id":"512f3712-147a-44da-ae93-130c623b0f62","resolution":{"observed_at":"2026-08-16T01:07:35.211653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T01:07:35.216288Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.216288Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b452e0655076c46f5d45dfb1284b77d5e9a5fb3f81408b81be59a59c91b1396c","observation_id":"1d880a73-4860-453a-bccd-c258cc4363cd","resolution":{"observed_at":"2026-08-16T01:07:35.216288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07549","last_updated":"2024-06-13T08:16:05Z","snapshot_observed_at":"2026-08-16T13:44:03.023258Z","submitted_at":"2024-06-11T17:59:55Z","title":"A3VLM: Actionable Articulation-Aware Vision Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07549","snapshot_observed_at":"2026-08-16T01:07:35.219922Z","title":"A3vlm: Actionable articulation-aware vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.219922Z"},"links":{"cited_paper":"/paper/2406.07549","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:7e2b193c60c242087490d26a3eb784e5681b911c8366bb181302ac8f649fbc3a","observation_id":"53e8052e-3c34-483b-98ee-7ebdac955436","resolution":{"observed_at":"2026-08-16T01:07:35.219922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11289","last_updated":"2024-08-22T13:58:56Z","snapshot_observed_at":"2026-08-16T14:09:02.070073Z","submitted_at":"2024-03-17T17:59:59Z","title":"ManipVQA: Injecting Robotic Affordance and Physically Grounded Information into Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11289","snapshot_observed_at":"2026-08-16T01:07:35.225603Z","title":"Manipvqa: Injecting robotic affordance and physi- cally grounded information into multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.225603Z"},"links":{"cited_paper":"/paper/2403.11289","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b7262e88e8c721159309d5341c49236d9d958d6f80d9c56e9861b529117124ff","observation_id":"3387ef3f-3795-44cc-a9ec-c32c97398095","resolution":{"observed_at":"2026-08-16T01:07:35.225603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-16T01:07:35.229698Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.229698Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:72fbe465051b8a0cbb234c818b60b9135232b82b262678596627ce6c16dfd6ac","observation_id":"be39af2d-7905-4cef-bc5b-b1cc929f7b50","resolution":{"observed_at":"2026-08-16T01:07:35.229698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18623","last_updated":"2024-12-14T18:38:03Z","snapshot_observed_at":"2026-08-17T15:33:20.353144Z","submitted_at":"2024-11-27T18:59:52Z","title":"Lift3D Foundation Policy: Lifting 2D Large-Scale Pretrained Models for Robust 3D Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18623","snapshot_observed_at":"2026-08-16T01:07:35.233645Z","title":"Lift3d foundation policy: Lift- ing 2d large-scale pretrained models for robust 3d robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.233645Z"},"links":{"cited_paper":"/paper/2411.18623","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b69cdd499eccf373a5d1ab9999f4b7ba5c9c6c47d88c72e330f5cf194980ccc8","observation_id":"20795b50-5080-4a3b-ae88-dd5b569e706a","resolution":{"observed_at":"2026-08-16T01:07:35.233645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-16T01:07:35.238423Z","title":"Vima: General robot manipulation with multimodal prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.238423Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:27406a21fb3785ccec79b01b9e06e1682816bca6e04a894c608f9393cbb408ef","observation_id":"ee134403-6dd6-4678-8e72-7e84d6e4391b","resolution":{"observed_at":"2026-08-16T01:07:35.238423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.382227Z","title":"Coarse-to-fine imitation learning: Robot ma- nipulation from a single demonstration","venue":null,"work_id":"78181d75-4b90-43ea-93de-e9cb40da92f5","year":2021},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.243113Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:98cbc48c3c7bf84914ec57cf535c54fa3760736e2bb1374b29436e0d7b7be09f","observation_id":"3c68e8c8-eab8-4d7d-bb35-09bb7b6a6d09","resolution":{"observed_at":"2026-08-16T01:07:36.387026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07487","last_updated":"2024-01-15T06:02:30Z","snapshot_observed_at":"2026-08-16T14:27:33.630761Z","submitted_at":"2024-01-15T06:02:30Z","title":"Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07487","snapshot_observed_at":"2026-08-16T01:07:35.248077Z","title":"Robo-abc: Affordance generalization beyond categories via semantic correspondence for robot ma- nipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.248077Z"},"links":{"cited_paper":"/paper/2401.07487","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:89b7098033e5b3364f2c3b7e69ee38e67c0c3f4aee62d656ae7294d516843e02","observation_id":"b215e8a4-1ea4-4a15-832f-bcb32abc63d1","resolution":{"observed_at":"2026-08-16T01:07:35.248077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-16T01:07:35.253811Z","title":"3d diffuser actor: Policy diffusion with 3d scene representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.253811Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b132b79f70f1dc369e42441cc5fba767ae5bd28c1c4d0e676aea6cb70b6bf2eb","observation_id":"9a9ea00a-9d81-47a7-b9e0-a965452a455c","resolution":{"observed_at":"2026-08-16T01:07:35.253811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-16T01:07:35.258200Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.258200Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:59b19e2e161eae8b34d6371814112e653533b2f8f48120b8ab4ac421eb63afd1","observation_id":"c099829a-3357-4b76-b693-18df7cf92dea","resolution":{"observed_at":"2026-08-16T01:07:35.258200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-16T01:07:35.262416Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.262416Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:62243e52c917cad6cc3d5c34a69d048c7bdd62fc4cbe34acefb21417f4e172db","observation_id":"3fac0265-74f2-453e-91cd-92bd669f6edc","resolution":{"observed_at":"2026-08-16T01:07:35.262416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.368114Z","title":"Manipllm: Embodied multimodal large language model for object-centric robotic manipulation","venue":null,"work_id":"af996971-b231-4372-92a3-54fd2a821e81","year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.266395Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:23a328c17f633968042f3b3b3736f5b5d1bc2ada03289b3a9db8ae907ceb2bad","observation_id":"02a51f70-9b6d-4cf2-b30f-44d193f3a556","resolution":{"observed_at":"2026-08-16T01:07:36.372556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-08-08T19:05:01.694808Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-16T01:07:35.270105Z","title":"Hamster: Hierarchical action models for open- world robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.270105Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:77e65cd3c47900d47a3ad2f35f398298808f8b7d5f534d31550e0e345da44d00","observation_id":"1566ca6a-f171-4557-b65b-5ab1b4f43d54","resolution":{"observed_at":"2026-08-16T01:07:35.270105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.353462Z","title":"Code as policies: Language model programs for embodied con- trol","venue":null,"work_id":"74bc1ece-aa8e-4b1e-b8ba-df52dd11a49f","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.274392Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:44e0f152f36c2dfcfe5751f0533b7f9d3aefa3c0ca795672fb49aa1201fe5b12","observation_id":"c0e6d8e9-c1e0-4dd3-9c9f-855c7f6c18b9","resolution":{"observed_at":"2026-08-16T01:07:36.358137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-08-16T14:12:33.532936Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-08-16T01:07:35.278351Z","title":"Moka: Open-vocabulary robotic manipulation through mark- based visual prompting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.278351Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:d8f0fc9d336aa8e3c56fc73922d490b51b6365d08424d5ede7b1cc0a2fc2fcab","observation_id":"89dbd810-b2e4-4125-9901-5c6ff8836cc2","resolution":{"observed_at":"2026-08-16T01:07:35.278351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04339","last_updated":"2024-12-14T18:41:03Z","snapshot_observed_at":"2026-08-16T13:45:24.500059Z","submitted_at":"2024-06-06T17:59:47Z","title":"RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04339","snapshot_observed_at":"2026-08-16T01:07:35.282918Z","title":"Robomamba: Multimodal state space model for efficient robot reasoning and manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.282918Z"},"links":{"cited_paper":"/paper/2406.04339","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:d0e38668009cf59f09df96535b92f0d0d285ada4e47f3ea1a6e6fe291aa05dd5","observation_id":"04562526-a3f1-4989-8afb-14fc296782a2","resolution":{"observed_at":"2026-08-16T01:07:35.282918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-08-16T10:00:51.789693Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-16T01:07:35.287180Z","title":"Hybridvla: Collaborative diffusion and autoregression in a unified vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.287180Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:06be547f0b442ed23709295f8ec7afbac25452f11636d72d0378aaf1b590bdca","observation_id":"b1ac530c-dc2f-4d19-a25d-62e7b95dc98d","resolution":{"observed_at":"2026-08-16T01:07:35.287180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T01:07:35.292014Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.292014Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:7ac10d3a36c89dd62d6c4fcb52c0bf95d3214e9e56adb7be21870848b0b5a21b","observation_id":"28aea292-1a0e-4957-b264-d8c07c2543f3","resolution":{"observed_at":"2026-08-16T01:07:35.292014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16013","last_updated":"2025-03-20T09:13:10Z","snapshot_observed_at":"2026-08-16T14:23:43.759515Z","submitted_at":"2024-01-29T10:01:10Z","title":"SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16013","snapshot_observed_at":"2026-08-16T01:07:35.295577Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.295577Z"},"links":{"cited_paper":"/paper/2401.16013","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:c8310e84c63ae8bbfada96e36503133c239411a5e9edc4cf3d1a00dc78d06e0f","observation_id":"c4b565ab-2eb7-4eeb-994c-d35f458e15e2","resolution":{"observed_at":"2026-08-16T01:07:35.295577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-17T17:21:25.156248Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-08-16T01:07:35.299878Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.299878Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:be5cb12d928482a1746589f3b51b26394c0e38d1921a7ffb88838ce8c04d1374","observation_id":"5b47ae7f-9ee8-49d6-8989-9f2a321aa454","resolution":{"observed_at":"2026-08-16T01:07:35.299878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.339974Z","title":"Learning latent plans from play","venue":null,"work_id":"c7bc5007-837a-4cda-b02f-f35417f96dba","year":2020},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.303994Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:f2f046a541b3bc7add661979af447e8fe57e753c8c5d3168b02abb75a1c51d16","observation_id":"8641a92a-320e-4975-8dfb-ee076663109b","resolution":{"observed_at":"2026-08-16T01:07:36.344518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.323914Z","title":"Where2act: From pixels to actions for articulated 3d objects","venue":null,"work_id":"b9ab525e-7c9a-4dcd-83cc-23ba8f373ca2","year":2021},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.309024Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:2993181813a16dd96e810d1ee681edcb9779ecb4078df6665bb968c21eb12f08","observation_id":"7c742dca-8b69-49e1-85d8-2d96bef0fb71","resolution":{"observed_at":"2026-08-16T01:07:36.329710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.308638Z","title":"Learning language-conditioned robot behavior from offline data and crowd-sourced annotation","venue":null,"work_id":"95a683f9-c9d5-499c-bdc2-a2c3cba7cabe","year":null},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.313893Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:f3e192aca81494e7f955780dc191bb70f9cd32592281efd31741c540da0f9e09","observation_id":"a0d1f628-694a-4a2c-8e1d-07c7070e18e3","resolution":{"observed_at":"2026-08-16T01:07:36.313634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-16T01:07:35.318012Z","title":"Pivot: Iterative visual prompt- ing elicits actionable knowledge for vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.318012Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:0ae6bf8fe5e29cf93c34326d6503e516c7e42e7431d9442d920edba1e3a6c0e0","observation_id":"5d6588cb-0c37-4de2-ab3c-f02932a10a9e","resolution":{"observed_at":"2026-08-16T01:07:35.318012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.294277Z","title":"Review of deep reinforcement learning for robot manipulation","venue":null,"work_id":"99e31545-87a8-4105-91f7-7d504bfa06b9","year":2019},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.323198Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:af9d41b0249996f8c2d49511cb73ec5b7f233276986c8b0d02b1cf670cbf36ab","observation_id":"da29a8c2-eb90-4a24-93b1-aae4176697aa","resolution":{"observed_at":"2026-08-16T01:07:36.299626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:35.327247Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.327247Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:d51e991d05fbdb9f86cd7c74529931741a58aa1638d7509a8ebfe08f9502e2b3","observation_id":"9ac2ea7d-d20a-4513-9dee-b5589bc27a84","resolution":{"observed_at":"2026-08-16T01:07:35.327247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:35.331567Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.331567Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:cce4b0e5467364a33ed66a943f08218f7decc09326d05252e99aeabb6b6471ce","observation_id":"8209f9a8-1c32-475c-af83-a8cab96937e1","resolution":{"observed_at":"2026-08-16T01:07:35.331567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.262273Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"f5a2d0d6-fded-42a3-8efc-749b7ef3475d","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.335637Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:85e3263f665d36d42487e78cebd5024d72d7d1aa9b1405bfd37911566224130b","observation_id":"e353d407-2c3a-49ad-9822-b9dc662ca94f","resolution":{"observed_at":"2026-08-16T01:07:36.267077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-08-16T15:51:32.614520Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-16T01:07:35.339501Z","title":"Open-world object ma- nipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.339501Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:cff10ca5ae23e1f7c4dea82189ed6c042b9c2d2da6794302b801bb1910028b84","observation_id":"6a47ccc6-5063-4120-82c2-592f9f672f0e","resolution":{"observed_at":"2026-08-16T01:07:35.339501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.246111Z","title":"Curobo: Parallelized collision-free robot motion gener- 10 ation","venue":null,"work_id":"226375e2-44ed-4811-8de4-097ee21afd7f","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.463721Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:ab4cb5503ae1227ad5af07ea72a3a9a8e33abd0af6ce6816ed5435cc2d937366","observation_id":"7420eb5e-d98a-4d61-a5ab-fd1d99439ac7","resolution":{"observed_at":"2026-08-16T01:07:36.251139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.231958Z","title":"Rt-sketch: Goal-conditioned imitation learning from hand-drawn sketches","venue":null,"work_id":"d377009b-2de6-495b-b71b-b0545ac10ae7","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.467904Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b067536d924f5a6b7e11d20e0553e4a6e43745cabddfebe542ad83c9e27d27fa","observation_id":"87521645-c0ae-4c13-8fbd-2ce83a7bc546","resolution":{"observed_at":"2026-08-16T01:07:36.236232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T01:07:35.472078Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.472078Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:a043b946cf3f327f386f443821a5a62894992037430fc40fbdf136693930a1fc","observation_id":"76f862e9-26e5-406e-9932-225a79cf0eb4","resolution":{"observed_at":"2026-08-16T01:07:35.472078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T01:07:35.476462Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.476462Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:dd0487faac111c8299ad283f4f2c69b86b0b3872a5e7dd7c53b656b46dc46e23","observation_id":"e66015a5-5432-46b3-8376-4f8947683e94","resolution":{"observed_at":"2026-08-16T01:07:35.476462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-16T01:07:35.480477Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.480477Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:f76461b6aa9b3137ffef19415e7de8dd47cfcf82cffcab1dcd0e7fb543fa77ad","observation_id":"53ba562b-7a78-42fe-bdf3-58199180b48e","resolution":{"observed_at":"2026-08-16T01:07:35.480477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.218187Z","title":"Chang, Leonidas J","venue":null,"work_id":"0f17b6e6-435c-4370-a139-19c75373cf05","year":2020},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.484967Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:c7d9325e8ff2b6f4400d188204d414a17a8c0992fd43272037ce23f3c35f4782","observation_id":"9771e031-8b41-4c7a-8962-61032fb1224c","resolution":{"observed_at":"2026-08-16T01:07:36.223174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11736","last_updated":"2023-07-01T05:38:52Z","snapshot_observed_at":"2026-08-16T16:14:26.097366Z","submitted_at":"2022-11-21T18:56:00Z","title":"Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11736","snapshot_observed_at":"2026-08-16T01:07:35.489407Z","title":"Robotic skill acquisition via instruction aug- mentation with vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.489407Z"},"links":{"cited_paper":"/paper/2211.11736","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:7a4b4432778bfa1215e65a4b29c88238fb7215f9380b028dc6706924fe57f3a0","observation_id":"19924dc0-9ceb-4302-8ec0-e2b42f218390","resolution":{"observed_at":"2026-08-16T01:07:35.489407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11548","last_updated":"2024-11-16T07:31:18Z","snapshot_observed_at":"2026-08-16T13:42:15.527354Z","submitted_at":"2024-06-17T13:44:53Z","title":"AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11548","snapshot_observed_at":"2026-08-16T01:07:35.493872Z","title":"Aic mllm: Au- tonomous interactive correction mllm for robust robotic ma- nipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.493872Z"},"links":{"cited_paper":"/paper/2406.11548","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:4c37a463323ca37a33a24db1a7735e7bdc05e54d2e7f05aee6fb64035a9c26c2","observation_id":"10e15186-8752-4281-9942-41e2b490d81b","resolution":{"observed_at":"2026-08-16T01:07:35.493872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.204912Z","title":"Universal manipulation policy network for articulated objects","venue":null,"work_id":"4d52cf74-3ea3-42bb-80d0-a6b55a91f8ad","year":2022},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.498881Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:7b368f68901045931bcea8bd85ef33ad81f67f699ece0a21fc3548cc898a613b","observation_id":"b8d67bd2-881f-45be-ac0d-c4eb4ed456c3","resolution":{"observed_at":"2026-08-16T01:07:36.209142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05716","last_updated":"2025-02-07T14:58:32Z","snapshot_observed_at":"2026-08-16T15:25:15.660951Z","submitted_at":"2023-06-09T07:22:12Z","title":"Transferring Foundation Models for Generalizable Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05716","snapshot_observed_at":"2026-08-16T01:07:35.502912Z","title":"Pave the way to grasp anything: Transferring foundation models for universal pick- place robots","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.502912Z"},"links":{"cited_paper":"/paper/2306.05716","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:8eb810b80759483d2afb77ece0242ed679f995c98491f571811eb499f3709fe2","observation_id":"f34b6cf2-c1d6-4b09-b634-81236354e53f","resolution":{"observed_at":"2026-08-16T01:07:35.502912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06114","snapshot_observed_at":"2026-08-16T01:07:35.507787Z","title":"Learn- ing interactive real-world simulators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.507787Z"},"links":{"cited_paper":"/paper/2310.06114","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:9c187518d435538d70a429474c673422679080903bfbea324c2bc2c1bfc537cb","observation_id":"44a2708f-6828-42cf-b414-4847988f5b3e","resolution":{"observed_at":"2026-08-16T01:07:35.507787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.192008Z","title":"M2t2: Multi-task masked transformer for object-centric pick and place","venue":null,"work_id":"560bad90-1326-426f-930d-10eed17c87ce","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.512482Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:10c7e34f4b7bd47f218429e523dfa0b7b5826bbbcd7dced4e22068724b3eee73","observation_id":"93487744-6e37-4959-8256-8abf4089c0fe","resolution":{"observed_at":"2026-08-16T01:07:36.196422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-08-16T13:42:40.054113Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-16T01:07:35.516610Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.516610Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:c1c433be156ebd098e4c0bfaaa82b463afaff3df22d29b1f15cfd85c0acac88e","observation_id":"18a9aea2-11bc-47c2-a9a4-3db97b8b70a3","resolution":{"observed_at":"2026-08-16T01:07:35.516610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-16T01:07:35.520721Z","title":"3d diffusion policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.520721Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:b09ccba1a2c56d26e570f6c99ff3921319439cbcb3caab680c500e050fe8ed2d","observation_id":"32698faf-be29-4c0a-be09-1b7c8a0b4806","resolution":{"observed_at":"2026-08-16T01:07:35.520721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T01:07:36.176116Z","title":"Predict the contact point and orientation for manipulating the object. The hints in the image include the contact point with a blue dot. Specifically, the contact point is atap 0","venue":null,"work_id":"d3409e06-454e-43e0-ac5b-33271cb80c13","year":2023},"citing_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T01:07:35.526355Z"},"links":{"citing_paper":"/paper/2505.02166"},"observation_digest":"sha256:fc919be0d5c0910235c909d112502c8ee2dd057531171ca80467228103fb9bbb","observation_id":"79ff5ae6-0f64-47c3-8e77-33ac2136edef","resolution":{"observed_at":"2026-08-16T01:07:36.182953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2505.02166."}