{"as_of":"2026-08-06T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:064be65e2010ed1a808fdc457113b30c32c009917ed2a790d457541f28adbedc","coverage":[{"denominator":169,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:46:35.942338Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":938,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:03:07.679371Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":36,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:5053571f23ecfe0f26d485288303e65936d60b8e21193d37ac71b3654988504d","observation_id":"3f406a7d-c8c8-40eb-a063-18445a566956","resolution":{"observed_at":"2026-05-24T01:25:54.395236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:b2b55d58ef3de5b3111266b48b10eb0537df0c293ef25be2617d4ac346e01692","observation_id":"d0a3f88f-dc44-4ec2-908e-15fb29196fa6","resolution":{"observed_at":"2026-05-15T12:17:01.351949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:ae93408bf098b0c4b8ec751ed7bfbad2b82f8266d3c58a223cf7ae25aa171c26","observation_id":"bc03956f-270b-43af-ad25-83488161bcde","resolution":{"observed_at":"2026-05-12T01:09:33.815304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.06355","last_updated":"2026-05-08T17:50:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-08T20:46:39Z","title":"UNCOM: Zero-shot Context-Aware Command Understanding for Tabletop Scenarios","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T19:17:12.954354Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.06355"},"observation_digest":"sha256:1b186cac0692a7343328f206090b1198dca42179aff65ddf5152bd7e3afe08c1","observation_id":"968342de-621c-46a2-9d39-07384a0383f9","resolution":{"observed_at":"2026-05-23T19:18:20.642115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T07:46:30.553633Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.07864"},"observation_digest":"sha256:adc3c4e688faa65ac807fa9fea1f0d0bad4ef3cce9945c48e01807d9ad1a1a9c","observation_id":"d841886e-8292-4ba3-b8b9-8489f6aae43e","resolution":{"observed_at":"2026-05-11T07:46:30.628345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.14022","last_updated":"2026-05-10T15:05:10Z","snapshot_observed_at":"2026-08-04T21:08:09.728916Z","submitted_at":"2024-10-17T20:49:45Z","title":"Language Conditioned Multi-Finger Dexterous Manipulation Enabled by Physical Compliance and Switching of Controllers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T19:06:58.600946Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.14022"},"observation_digest":"sha256:12b9110d0f9ca2e745070ce7e4acab19e1423af1e945e86d37d8f78dca9e125b","observation_id":"afbec97e-2146-4bd1-bcb4-7927f90a864c","resolution":{"observed_at":"2026-05-23T19:08:21.019878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:57be90231416fdc1d23a5e8c9af740e9b2d1573f4515358377d2073fb840f150","observation_id":"0ed1f587-1829-415d-87ee-b0d6b91a5e2c","resolution":{"observed_at":"2026-05-10T14:46:37.168344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:7b3273b5b927ea05448c5ece2cf6ddad04cb0b0ae29d7eaaf8edb4b83771c352","observation_id":"21a8ddec-88b3-4905-af0f-0d39e0f187e7","resolution":{"observed_at":"2026-05-12T07:33:25.590628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2412.02125","last_updated":"2026-05-01T15:42:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-03T03:27:48Z","title":"Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T08:20:05.898025Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.02125"},"observation_digest":"sha256:509d84ed0ab7b7f5900aa0283a0825051bc92554de9136c61ea28fa35ede5583","observation_id":"e7f02a5a-bf86-4481-a734-3c5782f024e2","resolution":{"observed_at":"2026-05-23T08:22:44.306990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:21c7f20c749dcde2a4062da0cf22bf6abfecad58b9e31110f61340e83c748515","observation_id":"8068490f-d3d8-4930-90a2-bec68d52bac5","resolution":{"observed_at":"2026-05-15T18:27:22.954766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:3f5c250cdae31772400108f196695e8b84189db5f062f098e8537f8b781f3ea9","observation_id":"042a928e-46ca-4f70-822b-68c8bad0a779","resolution":{"observed_at":"2026-05-17T21:37:50.861026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:3a27507bcf2810f01b470360ccabae7e1f7fb226741ee2b255f248a9e896a447","observation_id":"3a37d60b-a269-4386-82de-9d0ba9b10294","resolution":{"observed_at":"2026-05-12T18:38:11.261735Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:9707e7c1034afc8c46158f2e5fa71c68ea78b579349b5c6765f8a28e72f25856","observation_id":"752045ee-252c-4ac9-8516-4dccea3b3dc9","resolution":{"observed_at":"2026-05-10T23:38:45.595747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:dbbe1d9cfe29058d382b5e66a094e5d6691ad1512f3cbb4d03af6db2634eeb42","observation_id":"88da5c10-2c5c-450b-adec-a4abfa1220ff","resolution":{"observed_at":"2026-05-11T08:52:32.015560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:9c1b03912e6811c7bf12d8cef6ae33ca76da689b3be67b3bf395d8a5d2c4f18c","observation_id":"cbfa3c7d-53b8-4532-81c3-e07f6216e8f7","resolution":{"observed_at":"2026-05-12T06:12:19.954295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2502.03814","last_updated":"2026-05-03T03:24:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-06T06:52:14Z","title":"Large Language Models for Multi-Robot Systems: A Survey","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T04:32:05.138744Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.03814"},"observation_digest":"sha256:aac040dc648781e19d0319ce6e8ca5fdeac4178538ccda79de9819d0dd159c0f","observation_id":"d0930179-e240-4fb7-9590-621e177cd281","resolution":{"observed_at":"2026-05-23T04:32:32.337432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:144dabfd98e126bfd4b798433e71f8012db27fd07a57c3b05fc1e5d89d776fc2","observation_id":"418a98d6-c4c8-4bf1-87cc-6c240f08a799","resolution":{"observed_at":"2026-05-14T19:48:48.950588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:617b0485faa46cfea530487ad1b07f403991dba3e24bfa5082be71e8f3e15fc7","observation_id":"99c0666b-25f3-436a-987a-25319cdc5d3f","resolution":{"observed_at":"2026-05-15T22:53:37.371736Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:44448a3399a8fe24a66f5972751db525acec8e05f68336b3513aa457485a79b5","observation_id":"59e936ed-6448-49e4-98ff-08171fb18625","resolution":{"observed_at":"2026-05-11T04:35:32.596698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T17:50:29.675358Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.00200"},"observation_digest":"sha256:81cf2239fac9221b8e40958449abf600bd8fcde0ac07db03524ba878ab51b66a","observation_id":"7ce638f1-12b8-468e-ac71-cb5764501101","resolution":{"observed_at":"2026-05-13T17:50:29.748845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:96e4a068118088473046a442e2d7ff09b1eab39aac0e094c339382242d557458","observation_id":"a9bd48d3-4443-400a-a148-a63b1247b623","resolution":{"observed_at":"2026-05-23T01:32:22.559623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.07608","last_updated":"2025-03-10T17:59:42Z","snapshot_observed_at":"2026-08-01T16:55:41.453922Z","submitted_at":"2025-03-10T17:59:42Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:27.136345Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.07608"},"observation_digest":"sha256:3b8a204cd11b54fdc4a641a6824b42fccbb87ae6395ca812a122fd7af513430d","observation_id":"b678919d-2c20-41c1-8a23-e4203be5e326","resolution":{"observed_at":"2026-05-16T20:06:27.213596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:82078e95d818bc1a30ceb03853e36138cc95d7552d520b9cb0dee23b433c3394","observation_id":"d55d4bfa-6501-4b5e-a705-dbb4c9c2b1f3","resolution":{"observed_at":"2026-05-15T22:00:49.008387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:4010230fc6aea8afe1e6ce76bf5898161312d398b2ed3599a5ebc877a415e6fb","observation_id":"7be27480-b84c-4626-8665-b1f824a6270f","resolution":{"observed_at":"2026-05-23T00:02:17.849713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:beb42c5eac166a26e96a2b7691fabe1c6c0094c8a6dc6c223783979acd66759f","observation_id":"5e67bf7b-9dd9-4ddc-bb22-a27dd3124858","resolution":{"observed_at":"2026-05-10T19:09:10.219102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T12:47:10.146795Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.15558"},"observation_digest":"sha256:194e6b2882ea9d3cbcb2d9cb6247bf48cb9f940da153080477633999244563f5","observation_id":"e49d3dda-a5dd-47e6-bcd9-9d1d610871ab","resolution":{"observed_at":"2026-05-16T12:47:10.229628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:2eb0b6ed8c6945eada251dd9d87a20068cff093de555b852a3a136549fcab76a","observation_id":"a44e3e2e-54d5-4976-a7f0-a46b0d476789","resolution":{"observed_at":"2026-05-16T05:21:45.055362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T16:25:00.365534Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2504.02792"},"observation_digest":"sha256:65c09e2459d166fff086d560e98adb6150282230bd5406f96ef83b03ab1252a0","observation_id":"4165981b-6ef7-4708-b7ba-05cb1053c4ef","resolution":{"observed_at":"2026-05-13T16:25:00.430282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5956ed277faca7366847eae98498f9f136deb31c4accf826f7822233a8486829","observation_id":"24e088ea-b9ca-4b63-bfa1-28a8ce078cbd","resolution":{"observed_at":"2026-05-22T18:05:00.928639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.00306","last_updated":"2026-04-19T00:13:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-01T04:58:50Z","title":"J-PARSE: Jacobian-based Projection Algorithm for Resolving Singularities Effectively in Inverse Kinematic Control of Serial Manipulators","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T18:28:26.116236Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.00306"},"observation_digest":"sha256:992ccac665b5d63d7c25ca20f888520ba6332c4f1d938520aaf5a3e7a2471794","observation_id":"650932f2-53b1-4bb8-a3eb-3db3413083f2","resolution":{"observed_at":"2026-05-22T18:31:55.851956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:8efa414374cf987ea44179c36cc05aba2cebe983c6e01187186fafa37b7da0c3","observation_id":"8630e196-1379-42f8-996c-c1a127e1f775","resolution":{"observed_at":"2026-05-17T20:55:52.167894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.03500","last_updated":"2026-05-01T03:34:16Z","snapshot_observed_at":"2026-08-02T10:57:11.334123Z","submitted_at":"2025-05-06T13:05:04Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T16:46:05.993833Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.03500"},"observation_digest":"sha256:ce8b7ec51299f0c6c53ab43059bbb48e92785a8325eb90bcfd18651f42c30de5","observation_id":"5c6a2c5c-3b48-4f53-bc58-b6edbf668bfe","resolution":{"observed_at":"2026-05-22T16:46:47.449352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.07813","last_updated":"2026-05-17T22:14:58Z","snapshot_observed_at":"2026-07-06T21:22:45.982350Z","submitted_at":"2025-05-12T17:59:05Z","title":"DexWild: Dexterous Human Interactions for In-the-Wild Robot Policies","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T15:21:21.778285Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.07813"},"observation_digest":"sha256:daa8592e1938020d2f4c80cc3fb4ad6a5ea949de30ff79d671ffb7fd34ccd5cd","observation_id":"afbfd4b5-3801-4611-9780-aa4725fde2fe","resolution":{"observed_at":"2026-05-22T15:21:44.582080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.13255","last_updated":"2026-04-24T03:20:34Z","snapshot_observed_at":"2026-07-06T21:26:20.811742Z","submitted_at":"2025-05-19T15:39:08Z","title":"Policy Contrastive Decoding for Robotic Foundation Models","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T14:09:48.762737Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.13255"},"observation_digest":"sha256:3757fc6c45ab5d2ec34fc0ebbaad2e04bd7be3a3c43491edbcdecca5026af0b5","observation_id":"3e4575df-3465-4024-b0b8-5cd226f59c67","resolution":{"observed_at":"2026-05-22T14:11:38.482428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:783cf62b5c4fb2acdf107dd1b62d33661046bf47e2d105d39fcfedb5720d13ec","observation_id":"20b8b037-ef86-41b5-a05b-99056ab48ae2","resolution":{"observed_at":"2026-05-17T15:59:08.990825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.16278","last_updated":"2026-05-18T09:58:49Z","snapshot_observed_at":"2026-08-01T11:49:26.764186Z","submitted_at":"2025-05-22T06:23:04Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T14:30:47.787654Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.16278"},"observation_digest":"sha256:0b2a74aa1067fc3a8bef73594edc5eca559fa47c17641942c15ae2f314e917fb","observation_id":"f5ec679f-64f3-4990-82d8-d5207121d771","resolution":{"observed_at":"2026-05-22T14:31:40.673885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:18d7555938111452c0c1ef20350fc607648454f925a5dda75f6fc66902a1be48","observation_id":"e074ba19-1be5-41fc-8671-34b34d1ae0cd","resolution":{"observed_at":"2026-05-16T12:55:40.438028Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:2b18bb6b0d3d987dd0771d8efd7169ee32adf9918d350f2b34eb955d0b2b3d37","observation_id":"cae7ed7a-5a31-4b4d-be7f-bc699718442c","resolution":{"observed_at":"2026-05-15T14:18:51.751407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:dfd06b948ab696bf1caecf99dec161d04359336dd28d9b15dbf860015b7ad088","observation_id":"dee87fdd-3f34-4d1e-919a-a6fce3010e77","resolution":{"observed_at":"2026-05-11T00:33:50.935341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.10137","last_updated":"2026-04-19T14:49:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T19:32:41Z","title":"Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T09:15:45.511104Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.10137"},"observation_digest":"sha256:0ddac36aebf09061d9ad3eefc94ce42a4a13d0298b0612b2ab3eb2e5b2ab904e","observation_id":"3af473aa-ab83-4830-847c-e424b3611a52","resolution":{"observed_at":"2026-05-19T09:17:14.100488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.13456","last_updated":"2026-05-13T10:49:00Z","snapshot_observed_at":"2026-07-06T21:42:54.033751Z","submitted_at":"2025-06-16T13:14:58Z","title":"Block-wise Adaptive Caching for Accelerating Diffusion Policy","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T09:36:09.790248Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.13456"},"observation_digest":"sha256:6a2d26c296248db235cfb627d6d7b41fce7c5b06faee9109c70238d0fc7048b6","observation_id":"88dc24c7-6d77-4093-9a38-816c681ac6bd","resolution":{"observed_at":"2026-05-19T09:37:13.997104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:46:43.955825Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.13757"},"observation_digest":"sha256:61573de4e6317c6e66e49d88aecd700629414ec638d309ab8a89ceab91c1ba1d","observation_id":"7d15c4e1-e281-4b51-9009-ac33ff0c234b","resolution":{"observed_at":"2026-05-14T21:46:44.030959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.14009","last_updated":"2026-05-15T20:28:32Z","snapshot_observed_at":"2026-08-03T04:25:49.365460Z","submitted_at":"2025-06-16T21:12:27Z","title":"GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T00:26:28.696429Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.14009"},"observation_digest":"sha256:79f79a1c9407fd968563f4f75db3b82a0807b808e12ace31d4ca17b89cdb1e89","observation_id":"fe37133c-64fe-4dcd-9ea3-4d9f5f46f169","resolution":{"observed_at":"2026-05-22T00:30:49.362170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:44b7cde41ae4e666b15aff7b2628234e1100378be998480e3092c6965008e57c","observation_id":"b09543bd-fd28-4c31-bee8-f0061bbfde3e","resolution":{"observed_at":"2026-05-17T21:55:46.446400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:c93d2755e13d9be7996683e3c3bbec5ed6911b7ed3ebe1c4b88a26c349a21d9b","observation_id":"ae0faf98-f20f-4cf5-bcbf-3531098ac7c0","resolution":{"observed_at":"2026-05-11T22:57:08.177050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.00435","last_updated":"2026-05-04T20:30:13Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:33:16Z","title":"RoboEval: Where Robotic Manipulation Meets Structured and Scalable Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T07:19:07.662487Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.00435"},"observation_digest":"sha256:9fdead06f111273cf5312ce60f2626ccb555e903f8296400178f1a4eec143e76","observation_id":"4bb4f0b6-434f-4323-973a-cb532b45933f","resolution":{"observed_at":"2026-05-19T07:22:09.311532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:48446535d92927727abdcaff008172a16028af6be5e1a518b25f49f3c8366711","observation_id":"3130f410-b9f2-480c-be85-96f0d04d0414","resolution":{"observed_at":"2026-05-16T15:42:41.478969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T04:32:56.397350Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.05331"},"observation_digest":"sha256:5970089267ab80d7b0f18b5437df0b20d60dc3363690ce2d392cd6e139a0f258","observation_id":"54ea1e18-c118-4077-98f5-40bdca25bdac","resolution":{"observed_at":"2026-05-25T04:32:56.675763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-03T01:37:13.706745Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:705c83ecf58af2684da244113c5fa3f01215252f224365c7bbfbe520486dfcdf","observation_id":"f84b2d9b-4b3b-4716-acd2-ea32b5986814","resolution":{"observed_at":"2026-05-19T03:52:57.561589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:0056c287e70d9473e625c92c099489efc0aac5a12ea4628b5f8b2690944d5068","observation_id":"d01f0582-415e-41fc-9d1e-6e6308583684","resolution":{"observed_at":"2026-05-17T08:04:12.663710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T03:18:14.655384Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.16815"},"observation_digest":"sha256:c44c3b1c60c83e986de5166cfd04670e563e4991455594a3fde723177dac24a9","observation_id":"c7a6312a-da03-4a12-94de-0c9abb281b67","resolution":{"observed_at":"2026-05-19T03:22:01.051946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:a9bdf85f99b2ffd81955cb4bd2cc83ec8d56180dc2eee4705cf7c9e9ed2a867f","observation_id":"81d7c517-70aa-4b73-b302-2d84dbdbf141","resolution":{"observed_at":"2026-05-15T21:52:03.032150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T23:53:43.518630Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04681","last_updated":"2025-08-06T17:46:23Z","snapshot_observed_at":"2026-08-05T23:53:29.889889Z","submitted_at":"2025-08-06T17:46:23Z","title":"Perceiving and Acting in First-Person: A Dataset and Benchmark for Egocentric Human-Object-Human Interactions","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:53:43.518630Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.04681"},"observation_digest":"sha256:397412be565d2940e9e87d3bc6e939768710957a563e7461b27748a5f600a626","observation_id":"d38ec4df-1d52-4a30-bbdf-9b42b17424f1","resolution":{"observed_at":"2026-08-05T23:53:43.518630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:9a587437cba10b819b6a1fd5ec51c033047aaa75d3fd4921b3c8a9898e036869","observation_id":"d096f913-21b5-4b24-bc32-2e3a77b556d9","resolution":{"observed_at":"2026-05-15T21:28:42.033212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T23:17:30.780614Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05636","last_updated":"2025-08-07T17:59:59Z","snapshot_observed_at":"2026-08-05T23:16:26.510816Z","submitted_at":"2025-08-07T17:59:59Z","title":"FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:30.780614Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.05636"},"observation_digest":"sha256:5e85a916b95ca068e58f6eb3abe662a2658a44ddeaad72892b2931de9e0b8c9b","observation_id":"82a54b05-05b0-487e-baa4-a9bbeec5812f","resolution":{"observed_at":"2026-08-05T23:17:30.780614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T23:06:33.791412Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05941","last_updated":"2026-07-01T21:54:22Z","snapshot_observed_at":"2026-08-05T23:06:33.124821Z","submitted_at":"2025-08-08T02:07:08Z","title":"Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:06:33.791412Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.05941"},"observation_digest":"sha256:f90e40fb7ebf4c3767215a5482e910cdaff262af2236bf1fb51cd4437b9f0e5b","observation_id":"30600b73-715f-4fdc-a488-f939addee4f9","resolution":{"observed_at":"2026-08-05T23:06:33.791412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T22:50:41.646627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-05T22:50:39.090909Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:41.646627Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:4fee75f57ec6f0d412dc22e718007085ceebd1b3c3ad7806fa3e3c84a681a3b8","observation_id":"49a755f2-9aa7-463e-aa7f-1faf2ce3f2b1","resolution":{"observed_at":"2026-08-05T22:50:41.646627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T22:46:40.228132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-05T22:46:26.310165Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:40.228132Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:05f0dd335241ca976a187e956ce27aa088fba17fed61ab606bf801b3b0b6b3df","observation_id":"feb81f07-ebc6-4b07-a0b4-5e2740a02afa","resolution":{"observed_at":"2026-08-05T22:46:40.228132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T01:03:07.679371Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06547","last_updated":"2025-08-06T01:13:05Z","snapshot_observed_at":"2026-08-06T01:03:03.807616Z","submitted_at":"2025-08-06T01:13:05Z","title":"A tutorial note on collecting simulated data for vision-language-action models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T01:03:07.679371Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.06547"},"observation_digest":"sha256:25bb8c9fd3bcfca7b318d42e76f3389387c64e2f662430b3d1f73a236ba852db","observation_id":"1b63e7bf-a121-410b-a01a-a2b45fdd0a97","resolution":{"observed_at":"2026-08-06T01:03:07.679371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T21:59:01.879712Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-05T21:58:58.897913Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:01.879712Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:4b362aff0b2f706635f75abc8a59556dabc623b19ec03c969f93ad23c16b112d","observation_id":"cbf66c8f-7dff-4bcf-af3d-5e294652bcc7","resolution":{"observed_at":"2026-08-05T21:59:01.879712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T21:44:56.855979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08113","last_updated":"2025-08-11T15:53:23Z","snapshot_observed_at":"2026-08-05T21:44:53.988566Z","submitted_at":"2025-08-11T15:53:23Z","title":"AimBot: A Simple Auxiliary Visual Cue to Enhance Spatial Awareness of Visuomotor Policies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:44:56.855979Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.08113"},"observation_digest":"sha256:0fd174423e471c166eeb5fee922cb9cf57737cbfd3f3bf42f8de8dee75f82a10","observation_id":"8214d37d-5d1a-4ef6-853c-abe71676449d","resolution":{"observed_at":"2026-08-05T21:44:56.855979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T20:48:49.193322Z","title":"Openvla: An open- source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09960","last_updated":"2025-08-13T17:28:39Z","snapshot_observed_at":"2026-08-05T20:48:44.424968Z","submitted_at":"2025-08-13T17:28:39Z","title":"GBC: Generalized Behavior-Cloning Framework for Whole-Body Humanoid Imitation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:48:49.193322Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.09960"},"observation_digest":"sha256:03c0fc10543e937e236dc31b37af675fb5b92862e56eaae8e1c750627bc86864","observation_id":"57551115-7b26-4f82-8a3a-cd7cef3b5095","resolution":{"observed_at":"2026-08-05T20:48:49.193322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T20:35:44.968216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10257","last_updated":"2025-08-14T00:51:36Z","snapshot_observed_at":"2026-08-05T20:35:42.234950Z","submitted_at":"2025-08-14T00:51:36Z","title":"Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:35:44.968216Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.10257"},"observation_digest":"sha256:76259a893e7003bd2d0717107bf42692e99909111e4353617c7eb87898064ab9","observation_id":"b3e330cb-760e-4f48-9904-2c73fac37f73","resolution":{"observed_at":"2026-08-05T20:35:44.968216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T20:38:41.695214Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-05T20:38:36.897476Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:41.695214Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:e849e12f7d4c16f4f6b05cd9e27070fa5cacadcc65989f48654af881a6df362a","observation_id":"3b853cf1-eac7-4905-922f-a42a17d648a4","resolution":{"observed_at":"2026-08-05T20:38:41.695214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T20:31:43.751963Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-05T20:44:28.806636Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.751963Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:7a3c15886c345da0726b4bb3d22c3bc3a2ba65a7b0cf4548e7f0bf1f235018d3","observation_id":"ce2e3329-be43-4a10-98e2-70d9ae2aab20","resolution":{"observed_at":"2026-08-05T20:31:43.751963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T19:06:28.308450Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13446","last_updated":"2026-06-08T21:52:42Z","snapshot_observed_at":"2026-08-05T19:06:26.218978Z","submitted_at":"2025-08-19T02:01:06Z","title":"CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:06:28.308450Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.13446"},"observation_digest":"sha256:415b527c0fa672a0ca721949364f3517780691ab10f7450e781804c93622eb46","observation_id":"915e9a5c-cf35-48f0-a0bd-1b8ec90b93fd","resolution":{"observed_at":"2026-08-05T19:06:28.308450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2508.13998","last_updated":"2026-04-06T03:29:44Z","snapshot_observed_at":"2026-08-03T11:31:47.613184Z","submitted_at":"2025-08-19T16:50:01Z","title":"Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.13998"},"observation_digest":"sha256:60d33134bfaa7abbfb3871efd6df445185691d67f215520f4ec905c62de60b0e","observation_id":"8c62b9fb-624d-439b-a7ab-af0d464e74a4","resolution":{"observed_at":"2026-05-18T22:06:51.415288Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T20:43:24.417901Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.19236"},"observation_digest":"sha256:fe3bf8b80b36a3c221e2912de8b84e152dac592e64a24cd6092542e181076125","observation_id":"e5bc387a-7767-4703-a8b7-64d9c63ed8ab","resolution":{"observed_at":"2026-05-15T20:43:24.505762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T16:00:48.600967Z","title":"Openvla: An open-source vision-language-action model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-05T21:13:40.763863Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.600967Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:7671652d7af8200b53445db4e10b8ea01fe36c46d47c6159a95e77d67627071e","observation_id":"c57c35a2-60b8-4b69-a508-522b104c0dd3","resolution":{"observed_at":"2026-08-05T16:00:48.600967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T15:29:25.447330Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-06T03:15:06.738884Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.447330Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:5c15c5626cafcf6872ab5a8034a42dc6152b15f565fbec3b5f69721461540ad4","observation_id":"f11bd41e-26d7-4a8f-8b93-d4fabedd88c4","resolution":{"observed_at":"2026-08-05T15:29:25.447330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T14:42:32.646626Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.646626Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:c3b177b22460ba61f6ebdb7a8e501ef044e79070c90a06c76f1d54b0d33bc612","observation_id":"1103fbc3-cec6-4223-a35e-0632c19770d3","resolution":{"observed_at":"2026-08-05T14:42:32.646626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T14:39:58.543621Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21063","last_updated":"2025-08-28T17:59:05Z","snapshot_observed_at":"2026-08-05T14:39:56.796203Z","submitted_at":"2025-08-28T17:59:05Z","title":"Prompt-to-Product: Generative Assembly via Bimanual Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:39:58.543621Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.21063"},"observation_digest":"sha256:c2574bc2a37745d9f84b09851a08cc35e8eb3b6551798152c1be3caa520ea9f4","observation_id":"4f946d25-a9ea-4c18-a9fb-fda8d8cddf64","resolution":{"observed_at":"2026-08-05T14:39:58.543621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T14:20:39.593012Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21378","last_updated":"2026-07-21T12:16:52Z","snapshot_observed_at":"2026-08-05T14:20:35.593238Z","submitted_at":"2025-08-29T07:47:17Z","title":"RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:39.593012Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.21378"},"observation_digest":"sha256:7386c879ccf03f118cd3c9180d8122630e2310cbb72012cc6af51d0ba54062e7","observation_id":"6b8a8d33-813f-4fb5-87c4-a8b6f74c3485","resolution":{"observed_at":"2026-08-05T14:20:39.593012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T14:37:25.218750Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00117","last_updated":"2025-09-03T17:55:11Z","snapshot_observed_at":"2026-08-05T14:37:24.101020Z","submitted_at":"2025-08-28T17:59:07Z","title":"Embodied AI: Emerging Risks and Opportunities for Policy Action","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:37:25.218750Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.00117"},"observation_digest":"sha256:17f174ee81f663ea6caaaa3a2d32664751537ae95b7972be1650e6a3f4fb1242","observation_id":"fbf7261d-e799-4805-b0cc-b4f769de9386","resolution":{"observed_at":"2026-08-05T14:37:25.218750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T13:46:40.831539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00361","last_updated":"2025-08-30T04:53:32Z","snapshot_observed_at":"2026-08-05T13:46:39.182535Z","submitted_at":"2025-08-30T04:53:32Z","title":"Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:40.831539Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.00361"},"observation_digest":"sha256:9241cb4bb03c3e3643ea02ded145178f9fe61d5b9ffbb56f5bdd1cd7ea251c28","observation_id":"da4e8ebc-cbf2-489b-a368-29d1c68da847","resolution":{"observed_at":"2026-08-05T13:46:40.831539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T13:31:09.930395Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.930395Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:5436f9960c6c27699b22c0c0740afc2a0754a62c5d7fe633a647f751bda136b9","observation_id":"aa991821-8572-440c-addf-491c16a11ac4","resolution":{"observed_at":"2026-08-05T13:31:09.930395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T12:23:06.497905Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01658","last_updated":"2025-09-01T17:59:03Z","snapshot_observed_at":"2026-08-05T12:23:05.284702Z","submitted_at":"2025-09-01T17:59:03Z","title":"MoTo: A Zero-shot Plug-in Interaction-aware Navigation for General Mobile Manipulation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:23:06.497905Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.01658"},"observation_digest":"sha256:6da739b8f323a3039fe62329713b7a7d14a523d690836ba6b1f26bf87d390301","observation_id":"0dff23c8-0a76-4aeb-a336-18e97c2bc8e7","resolution":{"observed_at":"2026-08-05T12:23:06.497905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2509.01728","last_updated":"2026-04-16T14:35:52Z","snapshot_observed_at":"2026-07-06T22:21:53.366107Z","submitted_at":"2025-09-01T19:17:40Z","title":"Constrained Decoding for Safe Robot Navigation Foundation Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T19:07:18.832187Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.01728"},"observation_digest":"sha256:f9dd1419a44ec53ca6224e7574c1fc76dee0cca13770b4136a1b4e31af1be6cf","observation_id":"5a1259f7-480c-4312-902c-6c94a00623ec","resolution":{"observed_at":"2026-05-18T19:11:47.466013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T11:00:38.160847Z","title":"Openvla: An open-source vision-language- action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03383","last_updated":"2025-09-03T15:00:28Z","snapshot_observed_at":"2026-08-05T11:00:36.208558Z","submitted_at":"2025-09-03T15:00:28Z","title":"ANNIE: Be Careful of Your Robots","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:00:38.160847Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.03383"},"observation_digest":"sha256:9454481bb6d9fdf1ae9082fd047aa2eea1a86291ad6a5e348855f9c2be3355bb","observation_id":"b01682db-1b7f-4a9f-9553-d29fc0610ba2","resolution":{"observed_at":"2026-08-05T11:00:38.160847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T10:30:23.563766Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-05T10:30:18.189665Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.563766Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:b212a5940cd50d7da59373b4efe77a3ad3c3fe02d270f619b76eb4c788393c88","observation_id":"a8d857f0-8d2b-45f4-a6b8-b9b67151b6f9","resolution":{"observed_at":"2026-08-05T10:30:23.563766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T05:48:46.170479Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:46.170479Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:d08e1ccf4e7a6fc999a19e7300d18b83e8f966f17503e60f6650319c96f183ce","observation_id":"7cd4d753-902b-481b-8dd6-d8dbd936ab3a","resolution":{"observed_at":"2026-08-05T05:48:46.170479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T05:26:37.150691Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05513","last_updated":"2025-09-05T21:47:55Z","snapshot_observed_at":"2026-08-05T05:26:36.814805Z","submitted_at":"2025-09-05T21:47:55Z","title":"OpenEgo: A Large-Scale Multimodal Egocentric Dataset for Dexterous Manipulation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:26:37.150691Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.05513"},"observation_digest":"sha256:2f8dd27ddcfbcc139e767e8c4aead1197c6c609f6c1f7c77cabad64f1a953d78","observation_id":"815e5433-3c03-4c9f-b791-05573eef164c","resolution":{"observed_at":"2026-08-05T05:26:37.150691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T04:36:21.032619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06048","last_updated":"2025-09-07T13:15:24Z","snapshot_observed_at":"2026-08-05T04:36:19.131842Z","submitted_at":"2025-09-07T13:15:24Z","title":"Robotic Manipulation Framework Based on Semantic Keypoints for Packing Shoes of Different Sizes, Shapes, and Softness","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:21.032619Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.06048"},"observation_digest":"sha256:55b3c5ad64ebeeed57bc48c5d4b41f85be830fabb9a66925e46b5e76babf78a6","observation_id":"6cc2445e-0360-4447-b44f-6171d4118c90","resolution":{"observed_at":"2026-08-05T04:36:21.032619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T22:55:29.902536Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-04T22:55:29.306356Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.902536Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:15bf7c540ebb4816aa592bee9f8b4a4cb223e85cb4218b8b0480677329bcbdd1","observation_id":"49a66a05-45a4-48d8-8c9a-f22a3697f4a9","resolution":{"observed_at":"2026-08-04T22:55:29.902536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:42:46.978148Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.06951"},"observation_digest":"sha256:90016c06a6971067ab0e508adfe482309a7ccd74a8f7d47f529c5d89a5160eed","observation_id":"1a249ff5-b6db-4d83-ba40-88574676a8d2","resolution":{"observed_at":"2026-05-16T12:42:47.037713Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T21:32:57.877590Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-04T21:32:53.985511Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:57.877590Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:0f058192c9e3fcf8cc5c041ec8f7b194ccb7406c78f52d40f62dbc2f81825db2","observation_id":"d0d46be0-d879-43a7-b272-d6aba15e3973","resolution":{"observed_at":"2026-08-04T21:32:57.877590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T21:32:44.458803Z","title":"Openvla: An open- source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07957","last_updated":"2025-09-09T17:44:36Z","snapshot_observed_at":"2026-08-04T21:32:43.035369Z","submitted_at":"2025-09-09T17:44:36Z","title":"Graph-Fused Vision-Language-Action for Policy Reasoning in Multi-Arm Robotic Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:44.458803Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.07957"},"observation_digest":"sha256:3d279794daf7ff653ce2bc2af57a7281309c1f1e571edf6559fd9f6911620a49","observation_id":"f5a7ba6e-db87-464d-8ed6-85b575ccd268","resolution":{"observed_at":"2026-08-04T21:32:44.458803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T21:29:06.738070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:06.738070Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:041a44cbfe5be19926ba8fe7f38b92d9a22c4bf388883f1fcb4d2fdf45dcf55e","observation_id":"18c5445f-7d43-44f1-bfd4-8633ccd682bd","resolution":{"observed_at":"2026-08-04T21:29:06.738070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T21:31:07.692823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07978","last_updated":"2025-09-09T17:59:02Z","snapshot_observed_at":"2026-08-04T21:31:03.409786Z","submitted_at":"2025-09-09T17:59:02Z","title":"One View, Many Worlds: Single-Image to 3D Object Meets Generative Domain Randomization for One-Shot 6D Pose Estimation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T21:31:07.692823Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.07978"},"observation_digest":"sha256:1ea67db11d2ac8be4d09a11722b355cbf4fb1b14691aa2a5eb3a73a8fdf3d1fe","observation_id":"657a3e1f-053f-4ef7-a9f6-26e2e06b5005","resolution":{"observed_at":"2026-08-04T21:31:07.692823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T21:18:50.418258Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08126","last_updated":"2025-09-09T20:07:51Z","snapshot_observed_at":"2026-08-04T21:18:49.199973Z","submitted_at":"2025-09-09T20:07:51Z","title":"Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T21:18:50.418258Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.08126"},"observation_digest":"sha256:504ebf8adc0bdda3d064587e09290c199a31c07e94ffbb203f67812aa303f7d2","observation_id":"aec0dd06-a3f9-47a0-af39-5fed4c227fa8","resolution":{"observed_at":"2026-08-04T21:18:50.418258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T20:10:13.358029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-04T20:10:11.887304Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.358029Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:a5e5b620b7ca68d9139c9de23168f0fa6d9cb0e16a7c875eafddbaa02b0ef0e5","observation_id":"da9911b0-82a2-43de-85cb-588293248fd7","resolution":{"observed_at":"2026-08-04T20:10:13.358029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T19:47:08.791525Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-04T19:47:08.413522Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.791525Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:49454f300fc2b4211413ba08be197ac843c011542afcd128a57a9182b4638011","observation_id":"fe389765-247a-485d-a60f-eea2285a053d","resolution":{"observed_at":"2026-08-04T19:47:08.791525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T18:58:12.732914Z","title":"arXiv preprint arXiv:2406.09246(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09560","last_updated":"2025-09-11T15:51:43Z","snapshot_observed_at":"2026-08-04T18:58:09.658832Z","submitted_at":"2025-09-11T15:51:43Z","title":"Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:12.732914Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.09560"},"observation_digest":"sha256:e22283d0ce8f899c4e4522c1954598e6d01f673647e21695aa8d9e7584e190ac","observation_id":"d7401460-3f04-4a1b-948a-d15339d7748d","resolution":{"observed_at":"2026-08-04T18:58:12.732914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:58094a4fb8a098d7945ca611a0fa7d37d33f8efc64458c681fe44ed46370d748","observation_id":"37e67aa2-ff13-451b-a53b-d5cdc4a21267","resolution":{"observed_at":"2026-05-15T08:02:11.299684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2509.14787","last_updated":"2026-05-19T08:30:52Z","snapshot_observed_at":"2026-08-03T22:49:06.512364Z","submitted_at":"2025-09-18T09:37:24Z","title":"COMPASS: Confined-space Manipulation Planning with Active Sensing Strategy","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T22:05:55.494910Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.14787"},"observation_digest":"sha256:fc4bcda6506c6a7ad695e85b410689a54364df608ab95a98bc663eac3637f3fa","observation_id":"95aadfc7-5f90-4a04-a408-a1aa659cedcd","resolution":{"observed_at":"2026-05-21T22:10:42.640414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T15:34:52.225441Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.19658","last_updated":"2026-06-18T08:54:34Z","snapshot_observed_at":"2026-08-04T15:34:51.711587Z","submitted_at":"2025-09-24T00:26:15Z","title":"RoboSSM: Scalable In-context Imitation Learning via State-Space Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:34:52.225441Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.19658"},"observation_digest":"sha256:ac269463e3c30545cfdc7ee39c95b06e70ee45dc52d832a2a2bc957099deb68d","observation_id":"8bec39a7-d188-4970-8142-f4c7d9c9e2e7","resolution":{"observed_at":"2026-08-04T15:34:52.225441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T02:05:52.431747Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.24527"},"observation_digest":"sha256:0b90f41709f45dc41935821a46bd2e1baa092cb078e7bd56da858277110a7d79","observation_id":"9aa8cb66-2de4-4d6a-88b7-f5649d031956","resolution":{"observed_at":"2026-05-15T02:05:52.599228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T12:37:55.722549Z","title":"Open- vla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03142","last_updated":"2026-06-29T05:31:52Z","snapshot_observed_at":"2026-08-04T12:37:52.617412Z","submitted_at":"2025-10-03T16:15:09Z","title":"MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:37:55.722549Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2510.03142"},"observation_digest":"sha256:02977368594e6af392fb0499d05f358d8d260b72f8f9d036e0b4cf4c38de2f4a","observation_id":"69ff4193-5636-4dd7-bb66-c515479394df","resolution":{"observed_at":"2026-08-04T12:37:55.722549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-04T11:38:48.693484Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T06:20:01.885711Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:8a2516865c9c84c8617181a0ebbdbe8a1285b3af39567a9192d4c9721f56ca63","observation_id":"908c582a-9e6f-4a24-996e-2eca6a55c68d","resolution":{"observed_at":"2026-05-17T06:20:01.959642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T11:38:53.926844Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-04T11:38:48.693484Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T11:38:53.926844Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:cda44bc0c35f9d40248efa0d331a51604b144df8ec8382975b3018e0d8335b1d","observation_id":"df9463cd-a3a0-4c11-b176-be86bee0ebcf","resolution":{"observed_at":"2026-08-04T11:38:53.926844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.09246/citation-record","integrity":"/paper/2406.09246/integrity","json":"/paper/2406.09246/citation-record.json","paper":"/paper/2406.09246"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:76a20f1538924597a65d153502399a1a03b9763385a445945077871037ff94b0","observation_id":"db7afa79-75cb-4bea-8ad6-55086dbebe21","resolution":{"observed_at":"2026-05-11T17:23:25.503833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ee84cbf4-9aa2-48f2-a9c2-b0be054e568f","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5478e932b4cf09ab87499ef2072370374be83265d6b22dd72cbd66f2d018e3df","observation_id":"0cf51699-b079-4139-8d7a-f239c660d8f2","resolution":{"observed_at":"2026-05-10T14:46:36.942655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03659","last_updated":"2023-07-07T15:26:03Z","snapshot_observed_at":"2026-07-06T15:51:31.792957Z","submitted_at":"2023-07-07T15:26:03Z","title":"Decomposing the Generalization Gap in Imitation Learning for Visual Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2307.03659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03659","snapshot_observed_at":"2026-07-03T11:18:02.741752Z","title":"Decomposing the generalization gap in imitation learn- ing for visual robotic manipulation","venue":null,"work_id":"b65295bb-acdc-43db-815b-f4bc4933a453","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.03659","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:022b9eec29d1f5577858fcf5f585944efa5c43fa30431f06b95cce43fc666c0c","observation_id":"29d9c600-96c1-4df1-9998-d94d3ddb6a75","resolution":{"observed_at":"2026-05-10T14:46:36.255474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ghosh, H","venue":null,"work_id":"7a56d7dd-2735-4c8b-9abf-a8f2d457dfdf","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:7dd987db6f481c3f16f0854bee8c10555b28b5cd573b67faa84c2be5ba101424","observation_id":"6ac01f1a-dbae-4d18-8a42-75f11db5a2cd","resolution":{"observed_at":"2026-05-10T14:46:36.953364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Walke, K","venue":null,"work_id":"717120e7-d063-4056-b69a-2b88172ab4cf","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5de57616bfcefdf36ce070aa8e3c42bb789b3c157ebd058948e302b0f93d1ea2","observation_id":"d75a8661-170a-4b09-afb4-29c632c15f87","resolution":{"observed_at":"2026-05-10T14:46:36.955623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:dc21187f25aed09efc7ed09ddec0d558b3916a7d565bb03a66b38ae25aef0e5f","observation_id":"69f71b86-68fc-4236-957a-6ae74cb5af71","resolution":{"observed_at":"2026-05-10T22:36:04.729348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"8dd200a0-479c-4903-9314-79fb8cfb975d","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:a7adfc84234c9e24559890fc7e18feeea5415735bcd8967ec9326ce1c1a80a6d","observation_id":"7568ba38-931c-4aad-a0c2-3a2b3015bb24","resolution":{"observed_at":"2026-05-10T14:46:36.965065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"80982bac-48cb-4170-8005-c2a240c3af6b","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:ab268ba380a8cddbffd016955bb2d69e0b2ae1555e727dcb93527d076d252b2a","observation_id":"b9c7c7c5-49be-4dfe-bb00-253fcee1e577","resolution":{"observed_at":"2026-05-10T14:46:36.967033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f9a52a34a723431bf0058d1dcad19c5e015feddafe6ea977328c839d7c044e18","observation_id":"4bffcae9-0eaa-4633-81df-4bbe38fd6865","resolution":{"observed_at":"2026-05-10T14:46:36.267867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Khazatsky, K","venue":null,"work_id":"f089dcf8-8b68-4194-aeeb-ffe7c09c4d69","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b288973ae07e7c0a9f1d7bf45581268970ef670672b22b023452b1f88f12d3a7","observation_id":"8bc2094e-1075-49d3-9f81-3e9a2c14a309","resolution":{"observed_at":"2026-05-10T14:46:36.977435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f1637f3-f64a-46fa-b416-51120a0971a8","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:01d36097a72fefbf874eefe9353adbcf06fbfb8e13a9167caf5f13988527eda4","observation_id":"0058a515-2aad-4285-9bfd-b96f65f1f223","resolution":{"observed_at":"2026-05-10T14:46:36.981805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-05T20:49:12.236475Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":"2302.12766","doi":"10.48550/arxiv.2302.12766","metadata_source":"pith","pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Karamcheti, S","venue":"cs.RO","work_id":"5bd4457e-dc56-4b1e-ac07-f14764ba597e","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b5fe5c3987fe43329cba954ef33e971ddb9ef13bf2cedcb3c5e23448c21607da","observation_id":"188bc2a8-d207-4d2d-be05-5feae508b631","resolution":{"observed_at":"2026-05-10T14:46:36.271123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shridhar, L","venue":null,"work_id":"3771fa39-182e-4426-9cc1-6ebaee043fea","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:afde9643a220e2cedb7728482f50363af5a7a1ac6376e070552c03b3cf5a3398","observation_id":"0cdcf1a5-7c50-4148-be1f-523a9852a227","resolution":{"observed_at":"2026-05-10T14:46:36.992993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4f475b98faf5fb32c86d26c73c5e413807754400698bd4a3eb65f3de1bfe45b7","observation_id":"b8513001-5337-4b36-9899-284f6eaff38c","resolution":{"observed_at":"2026-05-10T14:46:36.281682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:8c85d3966afd048d37b955105960393c6e5121b3f78aefa9e78fd3fd5ac842cb","observation_id":"9470930f-2e22-40e9-ae66-9da1e7b4f620","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10243332-2096-43a0-a341-8826126c8dde","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:0329becc4f429309d7311c2b43b36ff4e4b3d7f2c1c40f2c8c0f57c39f7b22e4","observation_id":"b2e9fa2c-28d7-4fcc-b4af-9e953ab10d8e","resolution":{"observed_at":"2026-05-10T14:46:37.004626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lingo-2: Driving with natural language","venue":null,"work_id":"06cdcd39-1203-411f-9664-71d772898720","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:95d2034986da4545224657512853729959b19dff6b79c36c7f4f35fb5d2cf4d6","observation_id":"112b7671-be40-42a7-9cba-77766597adfe","resolution":{"observed_at":"2026-05-10T14:46:37.011402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:3bf32f3b2d06058166f3f6e146b5dfe617c18d8e227bb29553fa9a07087a3308","observation_id":"48818825-a06a-47d6-a88d-f79b4ccceff7","resolution":{"observed_at":"2026-05-16T09:29:06.753688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":"2310.09199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-07-02T03:56:35.167882Z","title":"PaLi-3 vision lan- guage models: Smaller, faster, stronger","venue":null,"work_id":"d20a4352-6739-4426-8a5a-b3079cc14d00","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:d876ccd350a50b03d0be04a434ac46289ee3240ed73bdec2f79ee3b3b805ae1b","observation_id":"197ddb6a-225a-41f0-a0b0-87643d848315","resolution":{"observed_at":"2026-05-10T14:46:36.300773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0afdb971-402e-4d8d-8ce8-ee2916d90496","year":null},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:104a562d9605b29dbd386a1972436420615e64ebb0a95cd58c653d38396d7c6b","observation_id":"3cb1dbc8-1c23-437c-a90a-ee0270a81d8c","resolution":{"observed_at":"2026-05-10T14:46:37.029613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":"1910.03771","doi":"10.48550/arxiv.1910.03771","metadata_source":"pith","pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":"cs.CL","work_id":"9d86da8d-01d3-41af-a0d2-ee14897927a9","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:08dc6bb7f555d4e83b7c45bb62926d941ed79cd32b0812f08fce9e0eb7316a4c","observation_id":"03b9615d-bba8-4d28-98b0-8c7f7b8511c9","resolution":{"observed_at":"2026-05-11T14:54:00.336000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:929aa7056523e62fb01005775c048104e29bcba9bde92c096cd9e1fcd8839c91","observation_id":"80ad0449-bfbe-44cd-afb1-5c1c791702dc","resolution":{"observed_at":"2026-05-10T14:46:36.309622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:bcba4f4a27a42785b7aa4720c7af586de2a39678c4827d0ee2b298a95258ed77","observation_id":"b011526a-b73b-4515-a6cd-2200478deaeb","resolution":{"observed_at":"2026-05-10T14:46:36.316893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:bb0bee1efc9922cf2d74f9286fd4609c1a9a0c8cfe5491a9591a03015253f5ed","observation_id":"9d98c612-6b4b-46ef-80d9-e0a50e3b47bb","resolution":{"observed_at":"2026-05-10T14:46:36.324591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4a3d3fc693fc29c9366d6e79b11ece892cc002c4329e0a97bf52dbb8f6a08f84","observation_id":"4deba42c-c090-496d-86bc-d6039da2dd94","resolution":{"observed_at":"2026-05-10T14:46:36.331752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dettmers, A","venue":null,"work_id":"22618c68-e833-4b2a-95c8-701c36fb66e1","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5818ae4634b6d1aacc181f905db6f9edfe142f477905c12081202f0fe3535ed8","observation_id":"0d52b70f-381e-46ee-9cf2-2c261fb6fa84","resolution":{"observed_at":"2026-05-10T14:46:37.049858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goyal, T","venue":null,"work_id":"e86c32d7-17be-4901-831f-8ca789014a65","year":2017},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:7e0f67c0eadd761b0feb240ca2c4754c29974d9ac542a491a4f9edd20924b5e2","observation_id":"4bb09748-9f58-4245-b635-9d9a83234ee6","resolution":{"observed_at":"2026-05-10T14:46:37.051903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4dc01ec0-c59b-488f-bc1a-e5f583cdb770","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:757ae9f0bffaff96cd2c6653e3958ccccf94cb4140291d2677ac27704eda9111","observation_id":"9df852a7-56e1-4332-a3a1-9541e6601835","resolution":{"observed_at":"2026-05-10T14:46:37.053972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singh, V","venue":null,"work_id":"c9517644-b059-4040-9e9f-581a4163ac6e","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:0664a415854cd0fab47d8112d333f1a13f45490ab91db84e65430530f069195d","observation_id":"f7333548-0e35-407c-9145-749c9e48a3d8","resolution":{"observed_at":"2026-05-10T14:46:37.057660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0be158db-55fa-421f-93d6-986a36bc24e5","year":2010},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:62be6519c23fc7d10153a4782b0e1818a50c95537d49e5ff6b7a46e9f67e289f","observation_id":"99dbbacc-8992-4d2b-91ee-1b28ba4c3733","resolution":{"observed_at":"2026-05-10T14:46:37.059945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kazemzadeh, V","venue":null,"work_id":"2fb53c97-4512-49b3-9376-e088428ac6ca","year":2014},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:1af55ed05686d6c8ba94239cfd9fbbeed00775bd0b456ff4cdfe1a775dfd6e5c","observation_id":"200208ef-86d9-4faa-bc10-825dc054b7e0","resolution":{"observed_at":"2026-05-10T14:46:37.061961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"469a2cc5-942e-467d-af77-25e886de2c5a","year":2016},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:cbac6287cd0ebd299ba2ee3c85395a1cb55510b4994ca682471e39b5d8cc5f14","observation_id":"123a5e49-dec9-46f9-a315-5dfa4b307325","resolution":{"observed_at":"2026-05-10T14:46:37.071177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:850438cf484ec557ca3fd38d8dcf75c53e11da3d1d3ac4d0a4b058ae7de7ecfc","observation_id":"0f44d718-30af-4b09-8bf7-3b500e3402f4","resolution":{"observed_at":"2026-05-10T15:54:09.189864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":"2309.05463","doi":"10.18653/v1/2025.findings-acl.996","metadata_source":"pith","pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","venue":"cs.CL","work_id":"618db55c-6906-42e3-a4c5-c17088cb1df8","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:7894870f9c16133151cf921b10b77317046e2430ab974dae46b019863f0fbbf1","observation_id":"d0221559-10ba-44df-a28b-24908b6d4070","resolution":{"observed_at":"2026-05-14T19:18:01.425637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:00f8ee5d395bbbd4d96bbb554e93482157810a1244c9b1fda616a3248dbbfa6d","observation_id":"2f0c8fc7-7aac-413a-8e11-525e10487eeb","resolution":{"observed_at":"2026-05-10T14:46:36.355072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd34ec42-c182-4890-8c97-6219131727ae","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:76fbde97b4d5b22b8a8ae374213ac42c8ad80193cf53e4f57983122fe38aec1e","observation_id":"2d5d5671-c8de-4f9f-9bc2-3a03de1979ab","resolution":{"observed_at":"2026-05-10T14:46:37.087332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d2b64d25-9e10-426e-bc32-780b6ef17ad3","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b99a2394d2d72e9d2cf73597d56948eb671fff47131fdaeb649c2fa03c0fd7ac","observation_id":"d2255e37-d313-4748-91f7-cf8199c91395","resolution":{"observed_at":"2026-05-10T14:46:37.095968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:45206de74a69ad75a580e0d64576965a1e11c4437c824b521a669cee9bdf4357","observation_id":"829b75fc-3030-48ad-ac28-8717fcd1d357","resolution":{"observed_at":"2026-05-13T02:13:52.361122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f21a1a6c-5236-45a4-a171-2e1d5ffcac4e","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:dc7ce1e30c3afd88fe70448aa4c9a2cc910499d1539e0a910eeadca84b369d02","observation_id":"caede679-8a21-47f2-93ba-4e174906d225","resolution":{"observed_at":"2026-05-10T14:46:37.108205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laurençon, L","venue":null,"work_id":"5118d136-d217-4ef8-8c14-840bb14ec530","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:34dfebd079ef8f2cce56a4f57a48c2a2bcd9717f4d263cc6f6eebd406a8593f0","observation_id":"040bceb1-116b-4a80-8d71-8b18759e38ea","resolution":{"observed_at":"2026-05-10T14:46:37.139921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5441028-5c05-4556-9c76-9d6c5b85ab1b","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:692b57d427b86b1b24311446bd015c6f08df98fb656ddacca16d99587233db9a","observation_id":"c52dfb7f-d379-47ad-9ef8-95f2300d1b37","resolution":{"observed_at":"2026-05-10T14:46:37.148899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b697ed159ea79ceec526349982f42d0f57fc2018109e3187d09ef54793b72674","observation_id":"eae8f4d4-3d0b-4a22-9d7d-e77a43837fd0","resolution":{"observed_at":"2026-05-12T19:11:34.143871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-05T12:05:09.343843Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":"2402.07865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-07-10T07:26:54.452009Z","title":"arXiv preprint arXiv:2402.07865 , year=","venue":"cs.CV","work_id":"b22a99b6-3240-4093-b7b8-de2f53b53610","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:87eabd39a0da0d46b25322205cc50745a7a30769a1548e79b7b2e21eec261ca1","observation_id":"8193b89f-fd85-46f4-9e06-6cda30466c1e","resolution":{"observed_at":"2026-05-10T14:46:36.251110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.10293","last_updated":"2018-11-28T02:40:54Z","snapshot_observed_at":"2026-08-02T20:30:39.614115Z","submitted_at":"2018-06-27T04:34:30Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"1806.10293","doi":"10.48550/arxiv.1806.10293","metadata_source":"pith","pith_arxiv_id":"1806.10293","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","venue":"cs.LG","work_id":"9a64fd9b-aa3d-48af-ac99-b368b857a6e0","year":2018},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/1806.10293","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4519b2052b73c3c9d33c26f3cb08734cbf7c3aa4b815415a59aeb8ae64267685","observation_id":"55ba4592-6f4b-411b-bd2c-22ac4e4d1f65","resolution":{"observed_at":"2026-05-10T14:46:36.382354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kalashnkov, J","venue":null,"work_id":"2ca11679-806d-4656-ae0c-d242924e1f91","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:7644fc028a5373bcb1af712f8c4216bd7942757c2cbbf77f65f7c09d481d259c","observation_id":"86428803-88f8-4e28-8503-7e87d93cce1b","resolution":{"observed_at":"2026-05-10T14:46:36.548155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":"2109.13396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-04T08:49:42.858933Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","venue":"cs.RO","work_id":"59e728c0-b6ca-4759-a8f4-02b981f2220f","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:37712b68cb2fd8ab48ea8a2cd98f12462541bd4b546375e4ffdc9216977e62ca","observation_id":"fada594e-f57d-489f-aadd-844b4c368a70","resolution":{"observed_at":"2026-05-13T19:55:55.512010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02976","last_updated":"2024-08-07T18:11:51Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T18:59:45Z","title":"SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World","version":2},"cited_work":{"arxiv_id":"2312.02976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoc: Imitating shortest paths in simulation enables effective navigation and manipulation in the real world","venue":null,"work_id":"34709187-6f09-45cf-be99-3ac5e764151c","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2312.02976","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:9bd1f9d3671d180d8f48a7fea5a61b06eed4e240a181824534270fbf69ac4c38","observation_id":"063ed35f-0374-48b8-b7bb-2fc8c9e40817","resolution":{"observed_at":"2026-05-10T14:46:36.394467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01918","last_updated":"2023-09-05T03:14:39Z","snapshot_observed_at":"2026-07-06T16:14:17.621050Z","submitted_at":"2023-09-05T03:14:39Z","title":"RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking","version":1},"cited_work":{"arxiv_id":"2309.01918","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01918","snapshot_observed_at":"2026-07-04T04:09:35.398816Z","title":"arXiv preprint arXiv:2309.01918 (2023) 1, 2","venue":null,"work_id":"e2d9c6d8-696d-41ac-9192-932c001b1b2c","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2309.01918","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:26733a43bc9f9b8c69ce4878f12feaae4e948c136f1d5e0ebbaa259d84f9c906","observation_id":"f66f9769-56ec-49a1-bb70-1eb1ab28386a","resolution":{"observed_at":"2026-05-10T14:46:36.401578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pinto and A","venue":null,"work_id":"7412581a-c70d-4499-88a5-8186a428b074","year":2016},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:6eb9c7cfc79d7c15d2eb0c99b5d8e1558935411c0e6e0c62c2794295544ad535","observation_id":"1e3b884b-5e43-4c4d-9be1-7b1b324aff0b","resolution":{"observed_at":"2026-05-10T14:46:36.576581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mandlekar, Y","venue":null,"work_id":"ff5c4273-5e2a-405a-80a3-478046b748bf","year":2018},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:24b229c3f3c4893a89a51143066c6889045dd83632c275affaa9e61c9eb63389","observation_id":"81e56952-cd16-437e-8ce6-bc696b072412","resolution":{"observed_at":"2026-05-10T14:46:36.583630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gupta, A","venue":null,"work_id":"64b40acf-4c47-44bf-afec-34271e574295","year":2018},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f390ea15d812574ad1d31f6f434189a32ae312cd63a2fed333a247e1d5408943","observation_id":"ed0e51a3-2fe2-4e7c-ab0a-0d464dbf54bc","resolution":{"observed_at":"2026-05-10T14:46:36.587025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dasari, F","venue":null,"work_id":"cba2de7c-28e6-41ea-ab10-3e626a9aee1f","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4ace041639bd000bca5c816aa40cf9fc5c4dbc548a0e965f6bd7959a872b74e1","observation_id":"d5422361-9980-40d8-acdc-22b192ababda","resolution":{"observed_at":"2026-05-10T14:46:36.593887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bed4e0f2-a8a5-4512-bee7-89970c351602","year":2019},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:464813e932d027553df5006165845a608cf9e3c5c2cd2259ac3e420c86890590","observation_id":"dc48d38a-a229-4e1d-87ab-1b616662311a","resolution":{"observed_at":"2026-05-10T14:46:36.598196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e9a354a5-3d20-4f04-83cc-f6c30366d3b4","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:312952416c8d52c2caff54e416dfd5f56deef84f60043c98e99362b6dfc3eace","observation_id":"9fe7a8d8-23ee-46e5-aa72-4baf86cd41b9","resolution":{"observed_at":"2026-05-10T14:46:36.601365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb22cbc4-faeb-4bd7-8ca0-7790eca71031","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:c99357684588bfbce8c941b497d893e001ba9e919b0f6d9d61f8b00426b76ffa","observation_id":"7c2ecd22-044f-4c42-a278-39597b40ef86","resolution":{"observed_at":"2026-05-10T14:46:36.605082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devin, A","venue":null,"work_id":"28da2635-dd97-4322-b2eb-f813d48fac88","year":2017},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:2bda6e7e0f4711cc3fb12810beeceeb8c9c70465e7aa539a98d8ee438d06b6ab","observation_id":"80e44838-2e0f-427c-bfc6-f0599eca2f4e","resolution":{"observed_at":"2026-05-10T14:46:36.608770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c3f778f0-fd5b-4356-9ecf-f99790da4fba","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:ad8add18a95919a0e7b2981dec6cfedd97047ba7dc0d3aaaf8781ecc869a2afb","observation_id":"13214cfc-7e96-4615-a8f1-35840404ada5","resolution":{"observed_at":"2026-05-10T14:46:36.615554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b04c48f-ddfb-4afd-ac4b-08dbf1964b89","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:673479fa4a737cb90611a4c76bde3752c00003b3243fa3c696f6af8bde744ea3","observation_id":"b6144feb-f724-4973-9a22-c333473f075f","resolution":{"observed_at":"2026-05-10T14:46:36.619859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5537fa2f-5218-4520-8105-06782b1ce451","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:3f84606aec66e31970368cd3347fdb4a53e6d105eabdde2d892104de7b762f5f","observation_id":"416edbdd-fd58-46d0-8055-8ea859feaf72","resolution":{"observed_at":"2026-05-10T14:46:36.624059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03833","last_updated":"2023-10-30T02:13:12Z","snapshot_observed_at":"2026-07-06T15:13:28.897516Z","submitted_at":"2023-04-07T20:21:47Z","title":"Learning Robot Manipulation from Cross-Morphology Demonstration","version":2},"cited_work":{"arxiv_id":"2304.03833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.03833","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging action space mismatch in learning from demonstra- tions","venue":null,"work_id":"65136fac-1d0d-46ef-aa6e-7db17c80d311","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.03833","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4e3b77401a69f7d08d9425cc00ce1fc29ede18fe65f7542e71c239016717594a","observation_id":"30536a92-8668-48ff-a830-0f0cda5a45ad","resolution":{"observed_at":"2026-05-10T14:46:36.412445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radosavovic, B","venue":null,"work_id":"95527755-1d20-4df5-9937-264981b2624e","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:2e934e30ade941efdfcddf4b587059643994e171ac6bf0201f8e5a0ec68a9905","observation_id":"ca68c219-c8f9-4d2e-8d2e-f5c90b8f9ceb","resolution":{"observed_at":"2026-05-10T14:46:36.635776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc22ed6b-d754-4234-a874-d3fb9dcfe744","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:ed8b37ad4b355e964f49ca3a5d8af3c6b66097486949e93c86dfc65031e20cc8","observation_id":"23b7bb77-e5b0-4a80-b2a4-861280d3ed8b","resolution":{"observed_at":"2026-05-10T14:46:36.638222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11706","last_updated":"2023-12-22T13:55:42Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:35:20Z","title":"RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2306.11706","doi":"10.48550/arxiv.2306.11706","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robocat: A self-improving foundation agent for robotic manipulation","venue":"arXiv (Cornell University)","work_id":"143e7731-0488-4088-8e23-63f9d4140118","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2306.11706","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:722e7794785a55fede7075426332cdcb36242cdb86eca6d6e75a99ef9c8003d2","observation_id":"b97233aa-1bde-46fc-952d-2586b61de3de","resolution":{"observed_at":"2026-05-10T14:46:36.419963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-07-06T15:46:51.353113Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:876d60ee15ec33b859f1a28259f462ddbf2869c84990cbbc366fcdf23998e2c4","observation_id":"e8386bbb-770c-46cf-8bb5-82a311ab90b0","resolution":{"observed_at":"2026-05-10T14:46:36.428955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19432","last_updated":"2024-02-29T18:30:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:30:32Z","title":"Pushing the Limits of Cross-Embodiment Learning for Manipulation and Navigation","version":1},"cited_work":{"arxiv_id":"2402.19432","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19432","snapshot_observed_at":"2026-07-01T21:26:14.115025Z","title":"Pushing the limits of cross-embodiment learning for manipulation and navigation","venue":null,"work_id":"2619f5ae-030b-4da4-895b-5d4bb7f10e8f","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2402.19432","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:57882951be4be6bc5303d534ae8720213e89bd9bd5dd34b7da229b5a8f8a7d36","observation_id":"65641d4c-1215-48f6-af99-79210b044bdb","resolution":{"observed_at":"2026-05-10T14:46:36.432809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74c154a9-3164-4e32-ab2a-87e75fa21bc3","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:3eecd6071e15c5e9c4f84f22dadfabdf3084d88dcd1558c055da33c151b0b644","observation_id":"209b3d6b-6ab0-4750-b6d1-95247100ae1f","resolution":{"observed_at":"2026-05-10T14:46:36.655694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07280","last_updated":"2023-03-13T16:54:11Z","snapshot_observed_at":"2026-07-06T15:02:45.127825Z","submitted_at":"2023-03-13T16:54:11Z","title":"Vision-Language Models as Success Detectors","version":1},"cited_work":{"arxiv_id":"2303.07280","doi":"10.48550/arxiv.2303.07280","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.07280","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-language models as success detectors","venue":"arXiv (Cornell University)","work_id":"3ed43dc9-30c3-4244-a282-f173ebfe0dc1","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.07280","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:233e51510c66ead5a9d0ebd42939b39d58bf4605399058dd8b633febd910ebc8","observation_id":"c94f036e-1c78-4419-84f9-de00eec0d1bc","resolution":{"observed_at":"2026-05-10T14:46:36.438229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a73fc22-e968-4273-a52a-854d1ef94c88","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:68792605b6e9a9b08b190dfaabbf22c0831860bae7bbb4aebce7cffcadbf9da2","observation_id":"6fab0a01-9bc0-4dc6-a934-77d00b4f2f96","resolution":{"observed_at":"2026-05-10T14:46:36.661671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08587","last_updated":"2023-06-19T22:28:02Z","snapshot_observed_at":"2026-08-05T02:34:43.016237Z","submitted_at":"2023-04-17T20:07:24Z","title":"Grounding Classical Task Planners via Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2304.08587","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.08587","snapshot_observed_at":"2026-07-04T08:49:42.276927Z","title":"Zhang, Y","venue":null,"work_id":"bedc3396-31ee-461c-a1a7-b64586288554","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.08587","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:b45c7e73cc42e35bbe4ed3c7c28208fe94001a7e95dba54ceeb19285c345a17d","observation_id":"ad5146b5-7b0e-43c3-9812-c5cdfc160910","resolution":{"observed_at":"2026-05-10T14:46:36.449759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sontakke, J","venue":null,"work_id":"24ff07ce-b0f7-4943-87b1-a7c7695f9ec5","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:690b087aee6f206191481fb5fb802df55735ea713927e6b691c6593ab650b566","observation_id":"bca01dc2-f5b8-4aa9-b600-07ddc29a4d85","resolution":{"observed_at":"2026-05-10T14:46:36.669913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, S","venue":null,"work_id":"ce35dab6-f67c-4e50-9b9b-b90eb524d63f","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5f7c15b49f5f5b2f33b6a734a106f859c25c56dfd29bf9f2a3a493a0e6bfb787","observation_id":"54842436-cd67-47a5-953b-6e8296f419e7","resolution":{"observed_at":"2026-05-10T14:46:36.678865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":"2311.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-07-05T11:41:02.629883Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","venue":"cs.RO","work_id":"6eda4437-febe-45ae-889c-8da728146973","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:77f2809298519c503419f40ab42c26fcd9bb3a90648984008d4fc3a0cdad7fa6","observation_id":"8b8992ab-39f2-4bd9-9008-25defdb0c618","resolution":{"observed_at":"2026-05-16T21:44:27.700418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:782f2198324b2acd83019f545162717dc97396280e1a71743a6d05071f4232fe","observation_id":"2d975812-61d1-4c09-b249-95e8f1228012","resolution":{"observed_at":"2026-05-13T18:18:27.368966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic mixed precision","venue":null,"work_id":"2b479afb-b189-4d43-9490-2c8b8be1c8ab","year":null},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:6ebe45ebaac229e995a713e52c8b15bd0af1575d2a15cebdb93006c1b59061f2","observation_id":"b6fedf3d-3425-4c11-ba47-714b0f7506a2","resolution":{"observed_at":"2026-05-10T14:46:36.688330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:61d8986c0c96060e9e8c9383853892cc8f128b5665c0ba326232bc3ef31a3de1","observation_id":"c8296dc2-3c9b-4047-b42b-9acf181a3f61","resolution":{"observed_at":"2026-05-11T02:39:45.042453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":"2304.11277","doi":"10.48550/arxiv.2304.11277","metadata_source":"pith","pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","venue":"cs.DC","work_id":"bee7755e-b855-401d-813a-06ae9451d768","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:3d0366b278a0f41ad017869f9105ea3a6b6ee838bc9ef683f527d58596cbe970","observation_id":"0548510b-2da9-4a7f-a398-8612ed8eed49","resolution":{"observed_at":"2026-05-12T04:15:20.153254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.496008+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dorka, C","venue":null,"work_id":"46b6d7be-a677-4a72-8804-fa05f17a8f37","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f1a38bf3258e3a874717c0658f24794e8998fdf6471bb52a84c281d8135ee355","observation_id":"03479416-af16-4399-b510-145a9a4d68b9","resolution":{"observed_at":"2026-05-10T14:46:36.696800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0f19bc09-2516-491d-9a7d-c5805c4c4957","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4536206b7e7d195d70fb6c09b68a6ee6505be251145b5349ab40ccd60779b84c","observation_id":"cc0b0235-b87a-47bc-b866-daff8be57928","resolution":{"observed_at":"2026-05-10T14:46:36.700107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"d639ec40-657b-4b37-89d2-51660a07bb64","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:e7ca16c8b526fbc843b180dec72d4aed60ae3b412da57adeff54b023aba42d1d","observation_id":"e6c429fa-bc48-4016-8329-e616d87ac108","resolution":{"observed_at":"2026-05-10T14:46:36.704627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharma, N","venue":null,"work_id":"a1a22d55-cc42-4dc8-955a-c7a86d551f79","year":2018},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:aaf5bd73ce3b0ab622751af7d53b64e8e3170caa55bb3f1bf7bdc41da7c2651d","observation_id":"21ee7424-b8b4-4f38-9b9a-9d57fdbd9de4","resolution":{"observed_at":"2026-05-10T14:46:36.706900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:735edf53534281979d8eb0001c7f22c2c226ebc5e206e38946c87538556df107","observation_id":"6826c0f3-b97c-476b-bbaf-e8b291c6863c","resolution":{"observed_at":"2026-05-12T10:21:01.130308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sidorov, R","venue":null,"work_id":"b21904ef-490a-4a1a-aef3-909fa8716a69","year":2020},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:6433dea0d21b42150625059ba2abd121d4e60dd139cf28cd8caedc48d6095da9","observation_id":"f73b2f1d-3ecf-43da-8dba-ce636a2c0556","resolution":{"observed_at":"2026-05-10T14:46:36.715189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e017539-2106-46d0-b59e-41bb4af55d4f","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:d0303f60fbfb9833e7d4e2ab3de726de3bd37f00ddfbbdd7fb6120ee25a6bdb1","observation_id":"ae9eebb4-119a-4bbc-ad5a-d91a096266a8","resolution":{"observed_at":"2026-05-10T14:46:36.719047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef5c4ade-da30-4450-933c-3e723f2da8a9","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:a81abfda47ffced4607b3a723ae7a31864b839abdc811143946420cf37d57201","observation_id":"a29e98c1-d1ae-44f3-9716-9b3867beeb3a","resolution":{"observed_at":"2026-05-10T14:46:36.724932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":"2403.09611","doi":"10.48550/arxiv.2403.09611","metadata_source":"pith","pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","venue":"cs.CV","work_id":"378a250e-75a3-4ceb-b9a3-f8a5c2ed1a66","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:92f5674a7c24d20eeb5baf895303abeeb97b2f99339c5556390c559359d79664","observation_id":"f1e3ac38-2099-4fc0-a54e-1fd79265e8e8","resolution":{"observed_at":"2026-05-16T04:09:36.761640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:23058bb337cecfd87339e62f12372c624132f93bb70fd662d727193f0f9b414b","observation_id":"61e5d36f-238b-4510-8d74-148bc6e0df71","resolution":{"observed_at":"2026-05-10T14:46:36.498450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dettmers, M","venue":null,"work_id":"2d5a6893-dd38-4f70-a806-fe1f616e919c","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:3a9cf91725ef56d535a7c9874b23ad3b6f939e2c53ed473afb91646bdd0a3c98","observation_id":"36cd3c2d-a051-4b9f-9543-beefc59842ae","resolution":{"observed_at":"2026-05-10T14:46:36.739653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tensorrt-llm","venue":null,"work_id":"2240dfee-a33a-40f0-81fb-fd69eebd1ca3","year":null},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:66510e63f4ea795ea7313a956d110c56c246e9d4fac0ae8341e6da34663907d5","observation_id":"3bc65c36-865d-4cf6-abb8-1c8edf056ad9","resolution":{"observed_at":"2026-05-10T14:46:36.747214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:8282a5a824aba13ed421364ca55b4d45376c6a595c48810a37e8929468c55944","observation_id":"dceaea86-28a9-43e5-9e59-b37b60bb659d","resolution":{"observed_at":"2026-05-11T04:15:36.384383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leviathan, M","venue":null,"work_id":"824693b3-16e1-4dbb-8688-c51bff9f5be0","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:2ed151b5334ec23b76c1d803e12744f82aa923ed2fa82e55bcb601f346de35db","observation_id":"54cc30e3-f7d8-4dda-a3b5-3da17e130a9d","resolution":{"observed_at":"2026-05-10T14:46:36.753848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5600d0491ec3a73ae1957633e51b5ba14861694faa4989d5dc6686b811000b06","observation_id":"17c70509-f1da-4839-8a68-8b8468f82283","resolution":{"observed_at":"2026-05-10T22:41:14.065009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rosete-Beas, O","venue":null,"work_id":"4cdd68b3-07eb-4456-8b4d-72c8d95babe1","year":2022},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:e6b9ed612cd2a0b03d3bd5dba0ff690d535602543ee3eee0c674963ed12d9324","observation_id":"8e0cfa67-a2dd-4207-b30e-a59efa0384e2","resolution":{"observed_at":"2026-05-10T14:46:36.765351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19aa2182-6ed9-428d-a44b-35418e99db7d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:972cc36ed3bd2e5e4cc66a8e17535fa68395b0bf64859df7115c3aebe8d1a456","observation_id":"173ae2e0-f676-45c7-9306-c961e580afe6","resolution":{"observed_at":"2026-05-10T14:46:36.774118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"377ffdb6-0440-4a33-b873-22729f287c2d","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:78ad5af392bfd6b162be2716edea5ae43d66035293d6bc24a2bcb0b681f6c32c","observation_id":"cffcd069-f252-4261-b673-4da27be0bab7","resolution":{"observed_at":"2026-05-10T14:46:36.776680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08927","last_updated":"2024-01-13T07:39:35Z","snapshot_observed_at":"2026-07-06T15:55:06.149983Z","submitted_at":"2023-07-18T02:14:49Z","title":"Multi-Stage Cable Routing through Hierarchical Imitation Learning","version":5},"cited_work":{"arxiv_id":"2307.08927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.08927","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-stage cable routing through hierarchical imitation learning","venue":null,"work_id":"6ca6ef2f-36b0-4fbc-95cb-f41c3d1308db","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.08927","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:35beca77fe2408ca20d7abe02121c724992ec4a7ee14cb474fc60559620bae09","observation_id":"f8e6c2b0-caa5-4bd4-b76e-83c8e9e28d1e","resolution":{"observed_at":"2026-05-10T14:46:36.520997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02790","last_updated":"2018-11-07T08:01:21Z","snapshot_observed_at":"2026-07-06T07:13:11.246438Z","submitted_at":"2018-11-07T08:01:21Z","title":"RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation","version":1},"cited_work":{"arxiv_id":"1811.02790","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.02790","snapshot_observed_at":"2026-07-04T11:29:50.833627Z","title":"RoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation","venue":"cs.RO","work_id":"24d36e56-dc83-4a5f-a941-54481ba1bd2c","year":2018},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/1811.02790","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:4768d6b771759a14a713ea6a2cf1b8a003a7535c7f835523abae2df3a18a049b","observation_id":"a34a49d3-9303-48a2-afea-37ca99439ec8","resolution":{"observed_at":"2026-05-10T14:46:36.530484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b46676d6-55ae-4d5b-82dd-c38b99a3ded8","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f46e5e6efa88532a0feb3dbdef1102b7296d92cf07611df8cb3fbf4343264d02","observation_id":"72a40f0b-d94e-49d6-a3db-91ca6b36019b","resolution":{"observed_at":"2026-05-10T14:46:36.787029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca8bfd9d-1bdd-4af9-9d52-778fc8cc83f9","year":null},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:d5e470a67b7668201de04b2f262e6bbb7844543a37eed9937262c226193897e7","observation_id":"b31e1cfc-5673-483c-93f4-3c8f5de0257f","resolution":{"observed_at":"2026-05-10T14:46:36.791015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2641baef-935e-451a-86f5-60b4257039cc","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f6893765b66820a53f1743b2de079e38cdda74dbc26536633782d4516055aa21","observation_id":"4086578b-cc0f-4984-a551-54b0b0aa1410","resolution":{"observed_at":"2026-05-10T14:46:36.795079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lynch, A","venue":null,"work_id":"5a7c80e1-e4ea-4cca-a9fe-fb11d6e6b2cd","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:aba7ebe23da20cc50f4d79b2a7c11b6216a30e72b5d25cae76032e5c1bbc0005","observation_id":"2b1a6d6f-e2d7-44b0-968d-c92cb9b6407b","resolution":{"observed_at":"2026-05-10T14:46:36.797541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":41,"verified_fuzzy":30},"total_outbound_references":169},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 169 outbound references and 100 inbound Pith citation observations for arXiv:2406.09246."}