{"as_of":"2026-08-20T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf211fc0ada4ffa97aae61a6f984066ddba1ecf9d309e6e455cbe1907f5c598d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:28.461260Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:56:22.911558Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:28:16.078786Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"cited_work":{"arxiv_id":"2505.11214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11214","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling the potential of vision-language-action models with open-ended multimodal instructions","venue":null,"work_id":"01b4dc21-8b5b-4a65-8cbe-2338009f4336","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.11214","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:fbf74dc5ad3afebc58a5ac42b35c41185d3ba0ea5cca19f38163d9f3f4bc9580","observation_id":"a2730981-4504-4ffa-9c78-9c5e3e9f836d","resolution":{"observed_at":"2026-05-17T20:28:16.081523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11214","snapshot_observed_at":"2026-08-15T15:56:22.911558Z","title":"Unveiling the potential of vision-language-action models with open-ended multimodal instructions.arXiv preprint arXiv:2505.11214, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14143","last_updated":"2026-05-29T18:22:21Z","snapshot_observed_at":"2026-08-18T00:56:45.584818Z","submitted_at":"2025-09-17T16:22:25Z","title":"CLAW: A Vision-Language-Action Framework for Weight-Aware Robotic Grasping","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:56:22.911558Z"},"links":{"cited_paper":"/paper/2505.11214","citing_paper":"/paper/2509.14143"},"observation_digest":"sha256:06b8a076c6a3673ece8c97615ebeaac36824e8e02093e4dbf0da1c0c11161669","observation_id":"e9948e22-77e3-4aba-b0a1-d6a0661eb9dd","resolution":{"observed_at":"2026-08-15T15:56:22.911558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11214","snapshot_observed_at":"2026-08-02T22:07:48.479937Z","title":"Vlas: Vision-language-action model with speech instructions for customized robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18020","last_updated":"2026-06-06T17:01:08Z","snapshot_observed_at":"2026-08-02T22:07:45.299955Z","submitted_at":"2026-02-20T06:22:21Z","title":"UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:07:48.479937Z"},"links":{"cited_paper":"/paper/2505.11214","citing_paper":"/paper/2602.18020"},"observation_digest":"sha256:3121e0f5371733240b6ff4359b3d174db9cbf2b6a99f001e2705361b76329652","observation_id":"904c3149-d11a-41bc-9d72-902213218bb8","resolution":{"observed_at":"2026-08-02T22:07:48.479937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11214/citation-record","integrity":"/paper/2505.11214/integrity","json":"/paper/2505.11214/citation-record.json","paper":"/paper/2505.11214"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-15T21:01:28.286575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.286575Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:4aecd4333e20d7289bde24e981c382f9c87e648b5ab7a7a97ba177db957d5c00","observation_id":"c2d23df2-6129-4393-ac16-292debc961be","resolution":{"observed_at":"2026-08-15T21:01:28.286575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T21:01:28.292368Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.292368Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:b1ab48d6e5f9b514d4a0ef1739b1f8a6e83a62041ba75c57d9fbf0e25268d640","observation_id":"86cc614d-4ae6-4aea-a45b-8b0db30e8e83","resolution":{"observed_at":"2026-08-15T21:01:28.292368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T21:01:28.297376Z","title":"Gemini: A Family of Highly Capable Multimodal Models , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.297376Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:b7fbd26d5d15579c50c454380a28e0f3338cd88047e97038d2c75d6d746d4c4e","observation_id":"9837886e-a052-44b9-884f-cfd8efcfc023","resolution":{"observed_at":"2026-08-15T21:01:28.297376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.140968Z","title":"Visual Instruction Tuning","venue":null,"work_id":"c86f643c-930c-4303-8477-8a5325d2ad70","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.303202Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:ea3bb8f94dab4aed358d023fb6d82b5535af057ec84a26f9388234b3e87eda35","observation_id":"51b3bb3a-32b5-4421-9783-798e0704ef5a","resolution":{"observed_at":"2026-08-15T21:01:29.145766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.126217Z","title":"BLIP -2: Bootstrapping Language - Image Pre -training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":"12ac31b9-e389-4aa9-85a2-f24ae4a59fcc","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.308402Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:bd160daa8a920d5d8f3ceadfb03de8fefebd9a267f19b62be13aed3f66f3e7d4","observation_id":"75a71d25-1387-4dfc-9d95-8b5bb733ce80","resolution":{"observed_at":"2026-08-15T21:01:29.130979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-15T21:01:28.313787Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.313787Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:c19524918938457790cd362e854ef1cef8910aec9a41ff5b69fa1f14fe00a646","observation_id":"67836b1e-f353-4f6f-b6ee-27d5906336a7","resolution":{"observed_at":"2026-08-15T21:01:28.313787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.110383Z","title":"Prismatic VLMs : Investigating the Design Space of Visually - Conditioned Language Models","venue":null,"work_id":"953c2dcb-8e38-44e8-b5cf-f500651eb352","year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.319334Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:19740d7cceb1709bb8837d188cbb92c18ba97b812b87eab95c626efb9d78299e","observation_id":"895c3502-6c74-4c1e-96ed-243edc68a864","resolution":{"observed_at":"2026-08-15T21:01:29.115683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.094885Z","title":"LL a MA -adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":"371bdb83-f9c0-416a-99ca-08dcdac57dce","year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.323996Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:028c2e4081ed6a7b87672e51d6bc5081da6c136e078bb63a15f6ea99979b2b05","observation_id":"5f536b50-b7c1-4291-a734-6928c560abe1","resolution":{"observed_at":"2026-08-15T21:01:29.099786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.079211Z","title":"Sanketi, Grecia Salazar, Michael S","venue":null,"work_id":"9f810e10-0f58-4d6e-acce-1f23aa12ecc3","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.328677Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:eb60636541e6264c46dc2a07b3a98451fecec9ec8d67c2f037124088816d963e","observation_id":"a2129233-259e-4803-8872-3cfcd773837a","resolution":{"observed_at":"2026-08-15T21:01:29.084252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-15T21:01:28.334351Z","title":"Sukhatme, Gautam Salhotra, Ge Yan, Giulio Schiavi, Gregory Kahn, Hao Su, Hao-Shu Fang, Haochen Shi, Heni Ben Amor, Henrik I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.334351Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:0f4547c45cc07bb2583b0ebb88a778f18486cf25ae6388c6a82916725d3e0bb0","observation_id":"b2297c5f-afdc-4902-97ae-1f19e6aa7f4c","resolution":{"observed_at":"2026-08-15T21:01:28.334351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T21:01:28.339447Z","title":"OpenVLA : An Open - Source Vision - Language - Action Model , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.339447Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:bd4e7f4e6b3e9d3f1abc9591e2a4f4f0fd83c911bca15523e10ef71a4d6cc248","observation_id":"62778bcf-76fa-4b56-b216-7f24a0b45018","resolution":{"observed_at":"2026-08-15T21:01:28.339447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.344595Z","title":"RT -1: Robotics Transformer for Real - World Control at Scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.344595Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:8afedcda9e3408668cefaea8dcfad52c864faf47fbb29698f6cfded0f6bdd833","observation_id":"42e2d3e5-449b-4db8-835b-5c6554cb432c","resolution":{"observed_at":"2026-08-15T21:01:28.344595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.348934Z","title":"Language Conditioned Imitation Learning Over Unstructured Data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.348934Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:2d61aa7ee39557213960f7362309a3e1c62e3be3a3811ee4bc4df85e9619c5d9","observation_id":"d59a5527-a746-42fc-a6ec-037925766b08","resolution":{"observed_at":"2026-08-15T21:01:28.348934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.053178Z","title":"Vision- Language Foundation Models as Effective Robot Imitators","venue":null,"work_id":"453f4390-e44b-47b5-949b-954775a3dae4","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.353405Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:40920c7f1519d12333e3d70857ee2e16045396998084721883e58a51be06709f","observation_id":"f9e5cd03-7cfa-4a63-bf53-636ac935f2f2","resolution":{"observed_at":"2026-08-15T21:01:29.058706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-15T21:01:28.357831Z","title":"CogACT : A Foundational Vision - Language - Action Model for Synergizing Cognition and Action in Robotic Manipulation , November 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.357831Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:a4d5c5252c20fc13edeb26160ec2a2bcdce482c9c3fbc04e795722481a9ddbe2","observation_id":"74e367ab-0ddd-42bc-a9ba-b650cf217d50","resolution":{"observed_at":"2026-08-15T21:01:28.357831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.037172Z","title":"RDT -1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":"e1db5373-427f-4551-bdc9-2d262f9526a9","year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.362736Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:8cda3075bb66dd8d2e7aae89b803e0673561715fa13ca770cafb52c3285dbd01","observation_id":"35913785-6f73-4528-b94a-e1c861a9f75f","resolution":{"observed_at":"2026-08-15T21:01:29.042062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14058","snapshot_observed_at":"2026-08-15T21:01:28.367229Z","title":"Towards Generalist Robot Policies : What Matters in Building Vision - Language - Action Models , December 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.367229Z"},"links":{"cited_paper":"/paper/2412.14058","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:2852f3874a70cbe35ec36c050c904e1992b9053cbd7deb7a05edde89587d0cf5","observation_id":"6d0cbb99-6dac-4f1f-a239-d73381e74d3c","resolution":{"observed_at":"2026-08-15T21:01:28.367229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-15T21:01:28.371944Z","title":"TinyVLA : Towards Fast , Data - Efficient Vision - Language - Action Models for Robotic Manipulation , May 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.371944Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:737062ad31d3f6ee3432c9c977358171bf8a92f94148da5e9850d0d942b87919","observation_id":"0fee3452-f08e-4d51-9183-496992f53f19","resolution":{"observed_at":"2026-08-15T21:01:28.371944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03293","snapshot_observed_at":"2026-08-15T21:01:28.377189Z","title":"Diffusion- VLA : Scaling Robot Foundation Models via Unified Diffusion and Autoregression , May 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.377189Z"},"links":{"cited_paper":"/paper/2412.03293","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:ad742b3dedba7a2213adc98ee06d0f3b53c46ffea5d727366fc8efd139f818cd","observation_id":"21a7a0a9-4637-46e2-9892-ee2983bb4cba","resolution":{"observed_at":"2026-08-15T21:01:28.377189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.020153Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"fcbc0b5d-6588-4a94-aa77-5261b7a8dfbd","year":2017},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.382672Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:c67169ddc0b9cb8d1eadffb80ba680a2a7513bbb03558fa927ba3725bb754f45","observation_id":"705c1280-a39b-4398-a971-5b54c75c5ba9","resolution":{"observed_at":"2026-08-15T21:01:29.025582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.387297Z","title":"Diffusion Policy : Visuomotor Policy Learning via Action Diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.387297Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:be0fdcf2d005d83be24aaecb125c396f068c377ae0076277bcd323ffbf1715ba","observation_id":"663d3148-ceb7-48e1-8f76-4a48bfcdec63","resolution":{"observed_at":"2026-08-15T21:01:28.387297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T21:01:28.392029Z","title":"\\ pi\\_0\\ : A Vision - Language - Action Flow Model for General Robot Control , November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.392029Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:d9a5e6e54bcb8a83dad81decd35d41793dc3de06165104a4370bb4a3e95cd339","observation_id":"91034c97-c35a-454e-82bb-a6b3caef9dd0","resolution":{"observed_at":"2026-08-15T21:01:28.392029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:29.003461Z","title":"3D - VLA : A 3D Vision - Language - Action Generative World Model","venue":null,"work_id":"7c00ff56-4451-4824-9812-b3b74d6dcf63","year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.396975Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:64919877917a451d5bf4735635346bc2bd9a12c28f8c93167f2ffe240e393c98","observation_id":"e38d7c17-ca60-473a-ab00-33601141c25b","resolution":{"observed_at":"2026-08-15T21:01:29.008180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.987586Z","title":"Dream to manipulate: Compositional world models empowering robot imitation learning with imagination","venue":null,"work_id":"a0bc85c0-8fd9-473c-9386-e0468391420a","year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.401842Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:664327b029ad782800c43aacbfa64ed6a4649c83a02d86a47cbb5e1ee670d907","observation_id":"504d44d2-dd21-4996-ad3c-eb1fd027f004","resolution":{"observed_at":"2026-08-15T21:01:28.992785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-15T21:01:28.406539Z","title":"GR00T N1 : An Open Foundation Model for Generalist Humanoid Robots , March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.406539Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:d7b43ef35ad1bac3071692532eae23db788b0d6f6e36c1534b8fa3a1d53aab93","observation_id":"d92e8050-a612-454c-88e3-0b9330c8fa52","resolution":{"observed_at":"2026-08-15T21:01:28.406539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-08-15T21:01:28.411354Z","title":"RT - H : Action Hierarchies Using Language , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.411354Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:e83efe25dc3e044f0977fab56d4e5e01a9e2b6330520fa49be079ff060c6e3d0","observation_id":"140de4da-d8d0-4176-9040-ba8267deab69","resolution":{"observed_at":"2026-08-15T21:01:28.411354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.971944Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"93b6d284-7e35-43ef-80e7-eec0e4f13ca8","year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.416183Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:349691bb0d8531f2edd33a86509af5066ac2a07c7bc7a90709c2f8e9b8ff47ff","observation_id":"6f229904-50ff-4ba9-a486-c6d94f54e345","resolution":{"observed_at":"2026-08-15T21:01:28.976982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.956978Z","title":"DayDreamer : World Models for Physical Robot Learning","venue":null,"work_id":"38b1b3bc-36cf-4d98-896c-bdbed2ed64bc","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.421139Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:894a48670321088450c39185b7bbce67d5db95aab1fa15e5ee2fbded73452143","observation_id":"02fe49ba-6f9b-4a6c-a2af-a7bb1b3a62d2","resolution":{"observed_at":"2026-08-15T21:01:28.961902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.939551Z","title":"VIMA : Robot Manipulation with Multimodal Prompts","venue":null,"work_id":"f537bad1-80d3-4d71-bf49-ab0dd12e852c","year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.425661Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:a8de3b66f855a2f27efe511ea60ee2846d2e90c814e30f14323124b874572d78","observation_id":"537c13e6-b982-4f62-b34a-a0fd35f8243b","resolution":{"observed_at":"2026-08-15T21:01:28.946233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.430149Z","title":"Interleave- VLA : Enhancing Robot Manipulation with Interleaved Image - Text Instructions , May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.430149Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:f8d37b46a9feef869ce4984c1c47258a104f967899c7331af8d21c8d1d2515e8","observation_id":"7e67f5d9-f7d3-4871-a214-97dd0b4c2fc2","resolution":{"observed_at":"2026-08-15T21:01:28.430149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-15T21:01:28.435690Z","title":"LLaVA - NeXT - Interleave : Tackling Multi -image, Video , and 3D in Large Multimodal Models , July 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.435690Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:e15211ad374b64be77f27610c1d1035483382b10b40a0d95fee23cbe1d7a3024","observation_id":"e1d33075-eab2-4d16-8742-9deac8a80318","resolution":{"observed_at":"2026-08-15T21:01:28.435690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.440856Z","title":"Sigmoid Loss for Language Image Pre - Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.440856Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:900b67c0e837c402da812f0fc04d3710790dd5c30c11bf5dd4df2d63c9b19f7f","observation_id":"464a12f3-9d26-428f-8762-c3b071891814","resolution":{"observed_at":"2026-08-15T21:01:28.440856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:28.445519Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.445519Z"},"links":{"citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:f3b362fad3694d6bf13e7670bee9789a98feac8fa62f0032df309e44ef5d82c5","observation_id":"f6fb430f-7cde-4909-b37e-648acbc336c9","resolution":{"observed_at":"2026-08-15T21:01:28.445519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T21:01:28.450294Z","title":"Qwen Technical Report , September 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.450294Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:1b3edbc93235d097f8109608e7979cc80bd8287af85f5b7582c04a07b8705d58","observation_id":"2355a54a-c018-4b16-8638-10958b256fa3","resolution":{"observed_at":"2026-08-15T21:01:28.450294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-08-16T02:17:24.127148Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05767","snapshot_observed_at":"2026-08-15T21:01:28.455317Z","title":"Migician: Revealing the Magic of Free - Form Multi - Image Grounding in Multimodal Large Language Models , January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.455317Z"},"links":{"cited_paper":"/paper/2501.05767","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:9e673a9015803f76bd307e9d7b0274182c8d52af4d6b0ee8f55a3fda554cd6b3","observation_id":"0e364c4d-9564-4082-bdab-640e6b79ba5c","resolution":{"observed_at":"2026-08-15T21:01:28.455317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03227","last_updated":"2022-07-13T12:15:04Z","snapshot_observed_at":"2026-08-18T12:54:44.937877Z","submitted_at":"2021-12-06T18:37:33Z","title":"CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.03227","snapshot_observed_at":"2026-08-15T21:01:28.461260Z","title":"CALVIN : A Benchmark for Language - Conditioned Policy Learning for Long - Horizon Robot Manipulation Tasks , July 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:01:28.461260Z"},"links":{"cited_paper":"/paper/2112.03227","citing_paper":"/paper/2505.11214"},"observation_digest":"sha256:ab340e6691b7b5052477af509fa348817d065fb68c5e166102af185707e44895","observation_id":"d05ca3a6-9c4e-41f1-b1f9-5f3e2a272c95","resolution":{"observed_at":"2026-08-15T21:01:28.461260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11214","last_updated":"2025-05-16T13:12:08Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T02:18:11.826003Z","submitted_at":"2025-05-16T13:12:08Z","title":"Unveiling the Potential of Vision-Language-Action Models with Open-Ended Multimodal Instructions"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2505.11214."}