{"as_of":"2026-08-19T18:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70ba95d8ad26e0aa578adbea3308504cb68db91be8972066b9bd9767ccf4eced","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T05:26:55.722814Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:36:28.020890Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22183","snapshot_observed_at":"2026-08-02T06:36:28.020890Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12356","last_updated":"2026-07-16T05:52:45Z","snapshot_observed_at":"2026-08-17T08:00:43.660443Z","submitted_at":"2026-07-14T05:08:50Z","title":"VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:28.020890Z"},"links":{"cited_paper":"/paper/2605.22183","citing_paper":"/paper/2607.12356"},"observation_digest":"sha256:f7ee9b4ef3b0a5b02f18566b3172b6d494c323b23c377b16549982c91c5edf9b","observation_id":"374d8661-814f-40ec-b1c2-2dd2de87bcf3","resolution":{"observed_at":"2026-08-02T06:36:28.020890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.22183/citation-record","integrity":"/paper/2605.22183/integrity","json":"/paper/2605.22183/citation-record.json","paper":"/paper/2605.22183"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:a814771a1d387772521ee7a4d3f7ab71d93845275d92e70eba3614b31bf4dd5d","observation_id":"9c2219a6-8813-4352-87ac-15de83e743e6","resolution":{"observed_at":"2026-05-22T05:31:08.107209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:145ddf8ee72112b48beb6d03d6c3961188007c04dfb1625fb4b75ee9e632e2db","observation_id":"c80375f3-6376-4c18-bb32-882db7a75901","resolution":{"observed_at":"2026-05-22T05:31:08.100163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:a173252188c6b0a7e80e51738e8fd202adf55215745002da6f3908517f297152","observation_id":"ac06387b-904e-4b19-a2df-5e9ab0659af7","resolution":{"observed_at":"2026-05-22T05:31:08.035463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:a670bf5ea94297c838a491081825e2539f948393af40f9f33eb6fa83b8fc8ba8","observation_id":"201d4021-2e41-424d-a8d1-e8799982bbe6","resolution":{"observed_at":"2026-05-22T05:31:08.040865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-08-14T08:22:11.295012Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:35b2ae8670cca521511bd18f8735d742dee84399486e249f4eebb531d63bb136","observation_id":"8ca54361-1a53-46d2-acfe-1014a844212f","resolution":{"observed_at":"2026-05-22T05:31:08.024464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:17e7f40eb08da60cf920dba2c846fc236c08bccf613133071635a85283e22907","observation_id":"b341e1b7-c2a2-46c8-898b-bbb6a2b1e15c","resolution":{"observed_at":"2026-05-22T05:31:08.079597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:03094f86fb59865ff5344fcb5d48bd92de45bf16e9fb68d54b6d5a7b753586d7","observation_id":"ac534265-0617-44f7-9020-9dfbd4aaef98","resolution":{"observed_at":"2026-05-22T05:31:08.046556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:17:56.175924Z","title":"Walke, K","venue":null,"work_id":"712896ae-681b-4f7f-92ce-e8b078d273fb","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:79ad2cc0e379b9b4f5629eaacd219b622cf05f754d56831baa7617db6ca94457","observation_id":"679df4ea-e655-48b8-a82f-67a64becc654","resolution":{"observed_at":"2026-05-22T05:36:08.408336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18904","last_updated":"2025-04-26T12:31:04Z","snapshot_observed_at":"2026-08-17T22:01:01.027814Z","submitted_at":"2025-04-26T12:31:04Z","title":"RoboVerse: Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning","version":1},"cited_work":{"arxiv_id":"2504.18904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.18904","snapshot_observed_at":"2026-07-09T10:26:11.046555Z","title":"Roboverse: Towards a unified platform, dataset and benchmark for scalable and generalizable robot learning","venue":"cs.RO","work_id":"4fbf5a8a-1435-4fdf-a524-1061b69ddff0","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2504.18904","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:6ea1ad4473d8e6e8af65178764c9e8d3534cd25e277a366a4455fbede738002b","observation_id":"ef426bcf-6ff1-48ea-bfb2-639ff7a7706b","resolution":{"observed_at":"2026-05-22T05:31:08.064923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:56:38.660516Z","title":"Zitkovich, T","venue":null,"work_id":"6be409d8-4b4f-4ba6-8d26-6972a8b711c3","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:f3e750bd0d239a6e2cdcf43ceca6bb8ea5f88d5eb75ef571c23f72a08697c905","observation_id":"ecda8d99-0249-4c68-ae19-73f5f4f50414","resolution":{"observed_at":"2026-05-22T05:36:08.404963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2601.03309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03309","snapshot_observed_at":"2026-07-04T11:19:48.912353Z","title":"Zhang, X","venue":"cs.CV","work_id":"02ccd335-a745-48b8-bacf-fa8fc7fbb688","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2601.03309","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:66864d44630772fd382ca63915edb7c5244591af36715e71a8b604c30a483c7e","observation_id":"ecfafcda-8e8c-43b1-a90e-81137c971f44","resolution":{"observed_at":"2026-06-02T02:03:37.239527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:09:58.511106Z","title":"Kachaev, M","venue":null,"work_id":"242e78f9-97b0-4023-be20-5d0cdcec310d","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:4b4658efbfeca399de1c0a17b042a173ad3070dfdaf6fd20924563be59e64326","observation_id":"865aa20a-7832-4a17-9987-8e0f3da63a87","resolution":{"observed_at":"2026-05-22T05:31:08.051621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:19:48.924000Z","title":"Ac- tions as language: Fine-tuning vlms into vlas without catastrophic forgetting","venue":null,"work_id":"a8b7692b-84b1-4310-984e-5a3de309c6a0","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:1ec64193ef6dac74e055111d9acf05b65aa11eaef0a4af610d403f22d0a5b84e","observation_id":"e5d81aae-4026-45a3-a71b-61037fcd3fb2","resolution":{"observed_at":"2026-05-22T05:31:08.094132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":"2403.01823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-07-10T14:37:16.092859Z","title":"RT-H: Action Hierarchies Using Language","venue":"cs.RO","work_id":"ecf7cf18-c1a8-4a6b-bc2a-fb165643aa0d","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:cb3bc92b92d60f248669f2b5f931f7bd5e4077f9d2a3aab3f0a855f3ea17f875","observation_id":"7d750c11-1fcc-46f2-9bb0-f27002834235","resolution":{"observed_at":"2026-05-22T05:31:08.073565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:4aaa59a3a5ae238e2c3f714a3e6a421b7e2e20822b38737745907b15bc680574","observation_id":"a4f803d9-cfcf-4bf1-939a-a1b638b79833","resolution":{"observed_at":"2026-05-22T05:31:08.115243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-11T15:03:01.640683Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":"2604.15483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-10T19:47:32.631418Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","venue":"cs.LG","work_id":"7391297f-4dff-465c-9790-cb760a2c0542","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:f06c8cf9413103e0ec4c84268e195a97e57c2ebd8021af05ceee1782ffdb388d","observation_id":"d40a8543-9797-45e5-a69a-ee0055a5ddb2","resolution":{"observed_at":"2026-05-22T05:31:08.057225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-16T13:48:56.802800Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":"2405.17398","doi":"10.48550/arxiv.2405.17398","metadata_source":"pith","pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability.ArXiv, abs/2405.17398","venue":"cs.CV","work_id":"5b3a684a-050b-4b16-8947-68ba838ba187","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:f4fef12c1fe017eab730d5c4a74837b4afe5d55ab57493c4bf88aa94a58e3332","observation_id":"21dab57a-3b9d-45bc-8b77-312b3702150b","resolution":{"observed_at":"2026-05-22T05:31:08.030793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-15T14:30:41.084242Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:a8a9a58c263f836d087e4e904d81f350d917eb9e1912af5708098489523d3404","observation_id":"f193b8b2-3c19-4e9f-ba7c-f969b89d8965","resolution":{"observed_at":"2026-05-22T05:31:08.019015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:48:32.854377Z","title":"Point what you mean: Visually grounded instruction policy","venue":null,"work_id":"743162b0-2d8c-4c05-b372-b2af9d2db447","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:ff3e81d603c965a3a65028011eed2ed21e2128f86439b13d7c70262e1185d8d2","observation_id":"78e2ca3d-685c-46f5-9fb7-9f06cb731cd3","resolution":{"observed_at":"2026-05-22T05:31:07.976747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22003","last_updated":"2026-05-09T06:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-23T14:08:58Z","title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2603.22003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.22003","snapshot_observed_at":"2026-07-04T20:00:08.779598Z","title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","venue":"cs.RO","work_id":"30333408-da87-44c4-a7b2-4e7dce74a581","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2603.22003","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:b075572d477fc60d79a38c8e66cef0f5efce039ca1f709041f9082d6832514c1","observation_id":"e6cb6016-594c-42ad-9e92-3c5cf079da9c","resolution":{"observed_at":"2026-05-22T05:31:07.991337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":"2412.10345","doi":"10.48550/arxiv.2412.10345","metadata_source":"pith","pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","venue":"cs.RO","work_id":"56a1dd5b-7094-408b-8742-b80a424a62bb","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:71b6cbe91b640d4fe84f26b9f8e28efdd1672dda9f1efae591d593cbcf65f689","observation_id":"c03c2516-f793-4f35-93f1-639370ad4df9","resolution":{"observed_at":"2026-05-22T05:31:08.008286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"39e9d4ae-1733-4404-add7-2b53eb675096","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:3d9f06d84a20fdcdcd07e97a10cd1e6ba27d6fefed451aa462e06e6682af9061","observation_id":"285f02cd-8199-483b-92c3-622abfe45b1c","resolution":{"observed_at":"2026-05-22T05:36:08.401845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:f9ba4da766c7aa48454d185891d048a0c34ccb8a4a8d00a4ea0b650ae8cb6d04","observation_id":"802a53c7-6813-4fa8-b47f-ba70079a3363","resolution":{"observed_at":"2026-05-22T05:31:07.956335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:68a48d5e7e0008162fad6257b8cef602c4c8e68e5918be2ab9f9578ed4c0d3c5","observation_id":"039a26b0-f02a-4136-af11-5ea24230d9ec","resolution":{"observed_at":"2026-05-22T05:31:07.981436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":"2507.15493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-07-10T04:16:48.751910Z","title":"GR-3 Technical Report","venue":"cs.RO","work_id":"7f3b800b-0146-4c37-b178-0801cd4270db","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:f09f3f5ef5106f3ef370955c9c831bcc37cec294cfb86bc150126a16fc664a46","observation_id":"6b265a3d-85be-43b4-bc1c-319c77609ecc","resolution":{"observed_at":"2026-05-22T05:31:08.013331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:56:20.105183Z","title":null,"venue":null,"work_id":"b46a2e4c-0e44-4478-8fb1-c0032f56918d","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:c58895f592e703cf71153b05653452e9a4ec085a23754713da95d4fbd8e5a38e","observation_id":"0e1a9a18-baab-4874-9c45-2af5e57cdd28","resolution":{"observed_at":"2026-05-22T05:36:08.398742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:44.136249Z","title":null,"venue":null,"work_id":"4a733798-b107-4c78-9e97-b85a735a9cfd","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:3a858d7923cbae9be16e1d3722fb1073a4122daf88d2a4eff3715bd7728aa94c","observation_id":"ccdb12fd-1457-49e2-96f6-9e95b40694a7","resolution":{"observed_at":"2026-05-22T05:36:08.394347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:57.896913Z","title":"Yu et al","venue":null,"work_id":"badb556f-2dc3-48c8-adac-b0972af7ab19","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:23c1033275df7ad2cb99885108eb900b7908082317b014d565a805717ea0a0ad","observation_id":"9065a5bc-694a-4060-9b51-5cd42a0f5bd3","resolution":{"observed_at":"2026-05-22T05:31:07.946010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"cited_work":{"arxiv_id":"2602.12215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12215","snapshot_observed_at":"2026-07-09T22:16:36.379086Z","title":"Chen et al","venue":"cs.RO","work_id":"3871a208-87bb-40c9-922d-9203ad3a857f","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2602.12215","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:473105d4726bdcd3ba319278e1f295bcc84ee82084d77842f296721fa5d02707","observation_id":"8b5e1a92-777a-48d7-884b-afc4144490e1","resolution":{"observed_at":"2026-06-04T02:07:08.962760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.00416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.614921Z","title":"Evo-0: Vision-language-action model with implicit spatial understanding.arXiv preprint arXiv:2507.00416","venue":null,"work_id":"d1204baf-ba9c-4c49-a595-132c514f7fde","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:2980baaecd479f09651675fd1cf9e6e1cf1c5d0ec3678e1910ec091f5c466aa0","observation_id":"f00af313-b15e-46b7-8453-dd350a8d66ef","resolution":{"observed_at":"2026-05-22T05:31:07.966330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:1b37409f56986aef88dc3dfb647918656ed7a234896f810e6dc3dc8fba72cc97","observation_id":"cef54000-5c93-4d58-af0b-990bc5452eec","resolution":{"observed_at":"2026-05-22T05:31:07.916410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:d19eeff91e6238eb15980339c94abe9a2617478b787e30325d652abd9f265313","observation_id":"d2a6fc74-dcc9-444f-9532-58f6e9589845","resolution":{"observed_at":"2026-05-22T05:31:07.951707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:8c39467c18bb0d1858643ee804cbf2bf651a0a92635748145a6e3edba0a9a637","observation_id":"33e0a215-f637-4466-a354-1dc414125d1b","resolution":{"observed_at":"2026-05-22T05:31:07.906937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:da3f9525d6ea290d583345c32f83bb49659745498d111299338966d5fdee899e","observation_id":"56fbf6c2-eae6-4bad-a7a8-8d7d541bc1d2","resolution":{"observed_at":"2026-05-22T05:31:07.911468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:2e457ed445fe8ed0d8587bc98fd13f3d628d6936f3d2964ae0267994145e0220","observation_id":"fb546123-39ab-4148-8813-174612dd32e7","resolution":{"observed_at":"2026-05-22T05:31:07.940275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:6cdae6524ece0338f1e1f67e32f6ed33f4733ee30cc2e81ae580cfff0fe3dc3a","observation_id":"f1232b0b-c5c7-49c0-8c88-c3a558009356","resolution":{"observed_at":"2026-05-22T05:31:07.960837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"77525746-881d-4c55-bef3-b7e1594324bd","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:3f3589ad6bdf8a41e96bdcd60f1583da571a331a99ac693bb19801856a998c8d","observation_id":"1adf1113-343f-495f-b7b2-54c6f446b331","resolution":{"observed_at":"2026-05-22T05:36:08.390750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85888950-2926-4dc2-ad85-23a91af30676","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:d24563fb7e3d5a298a041d6524a818d2970cc207f102c9d1547b93d783c6bb34","observation_id":"4420f193-103f-4d8c-af71-be52ecf4920b","resolution":{"observed_at":"2026-05-22T05:36:08.387116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02166","last_updated":"2025-05-04T15:58:14Z","snapshot_observed_at":"2026-08-16T14:27:51.706482Z","submitted_at":"2025-05-04T15:58:14Z","title":"CrayonRobo: Object-Centric Prompt-Driven Vision-Language-Action Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2505.02166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02166","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"18ba11d7-aeea-4f5d-990e-a492ee8ec103","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2505.02166","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:e107770da820e9f9c8b12750da77cf97e50614042bc0225a7117374f97daec8b","observation_id":"5724532d-63a9-4b65-81f3-4873ec79ff14","resolution":{"observed_at":"2026-05-22T05:31:07.996827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2409.01652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-07-04T16:39:58.441681Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","venue":"cs.RO","work_id":"c1f87e33-d716-44b5-ba00-98d693e65745","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:ce57a2470da5725c1f8b16f2c83e65ea09c215b0259c28a2ccaeba35c1adfb39","observation_id":"6b1b35f4-0e36-4d1b-ade6-6ba1fa3b910c","resolution":{"observed_at":"2026-05-22T05:31:07.971051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07549","last_updated":"2024-06-13T08:16:05Z","snapshot_observed_at":"2026-08-18T18:51:12.408199Z","submitted_at":"2024-06-11T17:59:55Z","title":"A3VLM: Actionable Articulation-Aware Vision Language Model","version":2},"cited_work":{"arxiv_id":"2406.07549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07549","snapshot_observed_at":"2026-07-01T09:25:41.561165Z","title":"Huang, H","venue":null,"work_id":"f8e8c244-b08b-44da-ab88-7921d87ddc3e","year":2024},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2406.07549","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:d831ee45fddf6a97eae9da5f6afb18b967d6ea3e86463e247fc6fab122c36d84","observation_id":"ad897b99-3318-4711-8225-62020b69ddb8","resolution":{"observed_at":"2026-05-22T05:31:07.921165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.13143","doi":"10.48550/arxiv.2502.13143","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sofar: Language-grounded orientation bridges spatial reasoning and object manipulation","venue":"ArXiv.org","work_id":"c763ea3a-4e23-4136-95e9-96c5fa5652cf","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:02f5fd03643869e4b4e7aeab953663f5222913899611a579611553d15e2a20e3","observation_id":"7bf4e6b9-f7ff-40d4-b673-ba1f8a125b34","resolution":{"observed_at":"2026-05-22T05:31:08.002642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d1e9bec-7cf3-4183-85de-0ad5a2f2f49e","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:c4275190d4991201c28a64df4c761c0d707bf7ca7842bf0790941d1390b7afe5","observation_id":"9b7624af-d98f-4ede-99dd-74b257996845","resolution":{"observed_at":"2026-05-22T05:36:08.383670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.09292","last_updated":"2026-05-30T16:07:44Z","snapshot_observed_at":"2026-08-15T13:29:59.304609Z","submitted_at":"2026-03-10T07:22:51Z","title":"See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2603.09292","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.09292","snapshot_observed_at":"2026-07-03T15:28:34.755508Z","title":"See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation","venue":"cs.RO","work_id":"2a0ce473-8051-486d-a7fc-ee8eb1f8985d","year":2026},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2603.09292","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:4e3ce1df557d680a8c2abe788129c230637c7925dd9ed9562963ca1ddc9adae3","observation_id":"6de0b034-d246-48b8-aaa4-5591af29bbb8","resolution":{"observed_at":"2026-06-02T02:03:42.139620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00693","last_updated":"2025-07-27T09:58:24Z","snapshot_observed_at":"2026-08-18T11:59:01.579843Z","submitted_at":"2025-05-01T17:55:05Z","title":"Robotic Visual Instruction","version":3},"cited_work":{"arxiv_id":"2505.00693","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00693","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4836824c-9b39-40c0-b765-439cbd6effa4","year":2025},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2505.00693","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:96f3037634808cde7aed81038fc52e55bf7ef06e2c885d373c7d1f24bbc8c878","observation_id":"d6c68e6f-255c-4875-8dff-e53464f1ccd1","resolution":{"observed_at":"2026-05-22T05:31:07.986405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T05:26:55.722814Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2605.22183"},"observation_digest":"sha256:d0eaee07622fc9cca2646a4150c0b27ef5d326980b1b179fed64af90ff6dd4a6","observation_id":"32a3996b-44e4-4cc7-8abd-4e469a53bff8","resolution":{"observed_at":"2026-05-22T05:31:07.930649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22183","last_updated":"2026-05-21T08:52:47Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T01:47:38.877766Z","submitted_at":"2026-05-21T08:52:47Z","title":"Action with Visual Primitives"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":38,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2605.22183."}