{"as_of":"2026-08-19T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dceae00d3f2d0cf18b70c43ff0002657d8fbfbabb3c55d937308e6d755971038","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:42:06.146713Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:39:40.204306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T06:20:01.885711Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:694fa7ea86c141d9d34cfbdaba22b2d8ce0014b54c7955190c7bef81e0e07983","observation_id":"07cc7d3e-2ee1-483a-9247-4815e3e92ae3","resolution":{"observed_at":"2026-05-17T06:20:01.937735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-04T11:38:53.471843Z","title":"org/abs/2506.09930","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:38:53.471843Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:ddc6acc6beb1dbec55d50324bd6937fc10932aaba251d203e76697fec89f62eb","observation_id":"bab77f63-a90c-4106-a0b7-b3e759dc711e","resolution":{"observed_at":"2026-08-04T11:38:53.471843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2601.02078","last_updated":"2026-08-14T10:25:02Z","snapshot_observed_at":"2026-08-19T12:09:59.210145Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T18:02:11.393346Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2601.02078"},"observation_digest":"sha256:9fe2bf62f4a8da07e5fa5ba875df0c54ef7271fd8e8591953b3a56b3a1bf57d4","observation_id":"95e87e2d-283c-4f7d-bf50-7687c3e09ee7","resolution":{"observed_at":"2026-05-16T18:03:12.269733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-03T12:41:53.551056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02078","last_updated":"2026-08-14T10:25:02Z","snapshot_observed_at":"2026-08-19T12:09:59.210145Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T12:41:53.551056Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2601.02078"},"observation_digest":"sha256:4d249c74c3bd8a68ee73bd16a41eb97f4e3ba5932b28eb4499c922605e1cf839","observation_id":"60f0d20b-097b-459f-8ff6-a89a095e4604","resolution":{"observed_at":"2026-08-03T12:41:53.551056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-08-11T00:21:08.790870Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:21:00.089755Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2605.02757"},"observation_digest":"sha256:307d710b53ffcf8bcba166fd504f81acd7866fbe32f8d16d78cdd55d0934497a","observation_id":"e144412d-e29f-4851-9400-08dafe29f882","resolution":{"observed_at":"2026-05-09T06:35:38.600524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2606.02277","last_updated":"2026-06-01T14:02:37Z","snapshot_observed_at":"2026-08-12T20:07:24.923377Z","submitted_at":"2026-06-01T14:02:37Z","title":"RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T14:39:27.174418Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2606.02277"},"observation_digest":"sha256:81c7d8961199ce87d3757a4b0481c76720f2a42a575f0d971f859a772c44769e","observation_id":"124dc2f3-cafd-47c4-be9a-8f050d0bbdf5","resolution":{"observed_at":"2026-07-01T23:06:20.664056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2606.06761","last_updated":"2026-06-04T22:57:34Z","snapshot_observed_at":"2026-08-08T01:39:10.461346Z","submitted_at":"2026-06-04T22:57:34Z","title":"AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T00:47:21.667833Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2606.06761"},"observation_digest":"sha256:73662aca51253c2ed2823ff35a4914718998d04b9ffb59f7e5223b6601981d3f","observation_id":"19ff866d-7b68-434a-99ed-c057353da94d","resolution":{"observed_at":"2026-07-02T13:56:59.992400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2606.12366","last_updated":"2026-06-10T17:34:25Z","snapshot_observed_at":"2026-07-06T23:51:17.719874Z","submitted_at":"2026-06-10T17:34:25Z","title":"APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T09:49:56.894300Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2606.12366"},"observation_digest":"sha256:3d511faa66cec8783ea18f2ad1de4b23499c5101f29b3fa87296c79ea369565a","observation_id":"afcccc75-7d19-4c99-b990-e9cd5036660f","resolution":{"observed_at":"2026-07-03T10:48:02.730672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2606.24815","last_updated":"2026-06-23T17:00:06Z","snapshot_observed_at":"2026-08-05T15:55:37.300817Z","submitted_at":"2026-06-23T17:00:06Z","title":"MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-25T23:07:27.176553Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2606.24815"},"observation_digest":"sha256:d5e5869f27c7a4aa0d534564cf7fff6c872894869ee4e5712150ee950d930dc7","observation_id":"42673a39-889b-48e5-933b-039500523b22","resolution":{"observed_at":"2026-07-04T18:00:01.458115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.09930","doi":"10.48550/arxiv.2506.09930","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"org/abs/2506.09930","venue":"ArXiv.org","work_id":"25a5b122-3d19-4c49-a064-812889edb5e4","year":2025},"citing_paper":{"arxiv_id":"2607.00020","last_updated":"2026-06-06T18:58:54Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-06T18:58:54Z","title":"EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T22:46:28.245243Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2607.00020"},"observation_digest":"sha256:c6a6e924ae4a5c829c8ff9d79319b3c34449c17d76fc33cf3e186f4652e9a12b","observation_id":"36726a43-7f1c-4f05-83f9-08bbb7e3535c","resolution":{"observed_at":"2026-07-02T22:47:25.123843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-01T11:06:14.393672Z","title":"From intention to execution: Probing the generaliza- tion boundaries of vision-language-action models.arXiv preprint arXiv:2506.09930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20033","last_updated":"2026-07-27T11:34:54Z","snapshot_observed_at":"2026-08-14T15:44:34.575625Z","submitted_at":"2026-07-22T11:20:05Z","title":"Robots Acquire Manipulation Skills in Seconds from a Single Human Video","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:06:14.393672Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2607.20033"},"observation_digest":"sha256:e047ea793e1b562ade27bc6486a3fc4d38919581a2518359bb33c8e267a57f8e","observation_id":"7274a360-5f3c-4098-acd1-5d1578617171","resolution":{"observed_at":"2026-08-01T11:06:14.393672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-07-30T14:45:01.896517Z","title":"From intention to execution: Probing the generalization boundaries of vision-language-action mod- els,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-19T14:18:47.189844Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T14:45:01.896517Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:2d5b9942efbb087b91ec8939462ab96d34dc4f08a341f91de9ca9e864586961d","observation_id":"f466b2ab-6682-4105-9fb0-844986fa41c4","resolution":{"observed_at":"2026-07-30T14:45:01.896517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-01T10:23:13.435458Z","title":"From intention to execution: Probing the generalization boundaries of vision-language-action mod- els,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-19T14:18:47.189844Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:13.435458Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:0e80e0e03c1f412be6b8698637b721b00902346b8ec8157ec886de855ecd3018","observation_id":"82189999-d2a1-4aa9-8fbd-d1272d3f771b","resolution":{"observed_at":"2026-08-01T10:23:13.435458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09930","snapshot_observed_at":"2026-08-16T00:39:40.204306Z","title":"From intention to execution: Probing the generalization boundaries of vision-language-action models.arXiv preprint arXiv:2506.09930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11671","last_updated":"2026-08-12T05:30:53Z","snapshot_observed_at":"2026-08-18T11:06:48.378555Z","submitted_at":"2026-08-12T05:30:53Z","title":"StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:40.204306Z"},"links":{"cited_paper":"/paper/2506.09930","citing_paper":"/paper/2608.11671"},"observation_digest":"sha256:3ffb9492eeac366766d166ded654b38db284b7d9c04fbcd73b3875db6ab4fdca","observation_id":"78dbd86f-6df9-4060-87f0-f9c36e3b9296","resolution":{"observed_at":"2026-08-16T00:39:40.204306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09930/citation-record","integrity":"/paper/2506.09930/integrity","json":"/paper/2506.09930/citation-record.json","paper":"/paper/2506.09930"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T04:42:03.448199Z","title":"Paligemma: A versatile 3b vlm for transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.448199Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:5d264f59b0c050509dd21555ac01e773d66023aa71403ac33570414249b1845c","observation_id":"c27d9800-1868-4362-86fc-6cdad0e5b7b0","resolution":{"observed_at":"2026-08-07T04:42:03.448199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T04:42:03.456303Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.456303Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:d2ce1201453210df29e78609bb78eb2fd32b2344900970bf12bca16041badd53","observation_id":"84b7dd7e-7714-4b6d-9c2a-fd9a277ec88b","resolution":{"observed_at":"2026-08-07T04:42:03.456303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T04:42:03.462652Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.462652Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:6ff29af1af9cd585fc9e3751fb6728b5ba4b76227eec95432c9246c205c32543","observation_id":"5a4bcf23-5d93-4151-9601-6a5045fa80a3","resolution":{"observed_at":"2026-08-07T04:42:03.462652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T04:42:03.469820Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.469820Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:6d5d5d4036525a1e97f94722155fb8bd19dc3221cf2f3dbdb5273ef0c970b63e","observation_id":"4b6f62db-9986-4bc5-904f-cb8758868817","resolution":{"observed_at":"2026-08-07T04:42:03.469820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:10.842112Z","title":"Language models are few-shot learn- ers","venue":null,"work_id":"77fbcfb8-5bc0-45b9-9617-273ff8a3a88f","year":1901},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.476254Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:bda5b7549ad42499e24951ffe9a76c2164c47397dd4c49ddd437e447fe37132d","observation_id":"cc1c29cf-2742-466e-9b41-3ef9f52be5be","resolution":{"observed_at":"2026-08-07T04:42:10.920972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-07T04:42:03.486242Z","title":"Pali-x: On scaling up a multilingual vision and language model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.486242Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:f0f6f80814bb5e8e61f01629fc40c022dad9af02f99c2726f219c0061c8b091b","observation_id":"91e20cde-cd8d-4722-8c14-d6fb38401d96","resolution":{"observed_at":"2026-08-07T04:42:03.486242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:10.697516Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":"e13d426e-ba3d-45ef-b860-8b2d6a0a8c29","year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.490855Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:ccc8e06f5f18e4a9d7755bca313a000cd7705b61578424ea94d9240958b395de","observation_id":"341cf704-859f-40e6-a05b-41851bd41b86","resolution":{"observed_at":"2026-08-07T04:42:10.761426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:10.514641Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"5bac4271-95b9-4559-b0de-f4e7dbe49f2a","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.494634Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:2ffb8f5d2c554abbda31ec0d5ee216018104af48233af61e525906a621f66102","observation_id":"c747118b-51f4-45ef-9502-97fea4230882","resolution":{"observed_at":"2026-08-07T04:42:10.608283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T04:42:03.500130Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.500130Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:9602a26732d864f2d33100b7d090d626aecc1b28cb5d172b1fc2b64682cc60d8","observation_id":"bc69081c-67bc-45d0-8d79-3631fa2d1980","resolution":{"observed_at":"2026-08-07T04:42:03.500130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"f528ab6f-4d08-47aa-8553-a12f80519c4c","year":2019},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.509005Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:6217bd2dfdedb2348f6a340cd0780ccb7da9d429585e8de5f955972a6009cb25","observation_id":"0d963e5b-7976-44ec-a70f-bf6c8bd322ad","resolution":{"observed_at":"2026-08-07T04:42:06.329783Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T04:42:03.517492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.517492Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:8ef66ca2d50f9eb29be56a0b93b69684f51d68571da5c7781bcfc57f9fcffe8a","observation_id":"7f056c45-23d6-4dce-b2af-3fa2239fa884","resolution":{"observed_at":"2026-08-07T04:42:03.517492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:10.333939Z","title":"Poor performance of openvla on bridge","venue":null,"work_id":"f9e62564-325b-4914-b64f-18a60bc2de1a","year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.526157Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:7c41b34ffcdbb09361eb644fcf8c9c86f79bee035afbe49d39794632c1717fae","observation_id":"ba37c4f1-fd83-4a19-aea7-bc0a26fc0e0e","resolution":{"observed_at":"2026-08-07T04:42:10.418414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:10.053262Z","title":"Gemini, 2023","venue":null,"work_id":"664c9c94-3775-4921-81a7-5907c677d8d8","year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.534702Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:7a9ee2dbf4d9d114ff98e13fa16b4036e9d70b78384d7288d9318559d706bb65","observation_id":"44f349b3-9c3e-4c41-8ad6-84a9a674b104","resolution":{"observed_at":"2026-08-07T04:42:10.208868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:09.768827Z","title":"Maniskill2: A unified benchmark for generalizable manipulation skills","venue":null,"work_id":"77d5b369-dd53-4083-9e69-8ff13a407f76","year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.542407Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:8af123e464f4bb9fe111d5d131b6854596f968eb92fe5e12ba96cdca7534bcfd","observation_id":"dd51dde9-1c76-4a58-a908-dce00f64396b","resolution":{"observed_at":"2026-08-07T04:42:09.898690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-08-07T04:42:03.549671Z","title":"Rekep: Spatio- temporal reasoning of relational keypoint constraints for robotic manipulation.arXiv preprint arXiv:2409.01652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.549671Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:3009e5b91214f0ca6cbc4dc9697bdc4eb8dcd7d80f18ac815bf6944eaa4b5d24","observation_id":"96adb65c-2cc8-4e41-8c87-0cedfbba00c6","resolution":{"observed_at":"2026-08-07T04:42:03.549671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T04:42:03.558677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.558677Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:8d93d75407da69ba4764c680e4485ad2eeca2ec652e22b833d9abca52efc54a5","observation_id":"0532ff28-dd99-4a5c-8c30-6d2d8e0bca1c","resolution":{"observed_at":"2026-08-07T04:42:03.558677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:09.491071Z","title":null,"venue":null,"work_id":"e92d2773-ba78-4a67-b10e-3c74f1612e80","year":2020},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.566759Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:50923d06136e4711e2be7ce0316a774abaf0f817d11ae0f1c15a7c0f6ef4d371","observation_id":"9cbc4315-164b-4170-b50f-3d0196a42f86","resolution":{"observed_at":"2026-08-07T04:42:09.627086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:09.269580Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"04037f4d-a5ab-4b87-b713-c6212a6037b9","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.575347Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:29ac7d1c7ba939af93170c62fc582239e91b210603e148d66e2ae71daa8b0856","observation_id":"72427009-033b-452a-a48c-2ea4e9ea4ae3","resolution":{"observed_at":"2026-08-07T04:42:09.364393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:09.070813Z","title":"Open- vla: An open-source vision-language-action model","venue":null,"work_id":"fbc81980-7fe9-403a-83f6-45bcc70dda47","year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.650556Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:a175ec8dde29e8339bcb5a9a246b728eda7824c6125b8e03907a4e815fe85a18","observation_id":"6077cad2-4627-44b2-84c5-80f9bd9a672f","resolution":{"observed_at":"2026-08-07T04:42:09.173991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-07T04:42:03.738170Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.738170Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:4f7ad1a68f66d5ab9237899a46c078812ef99907f628f549830cc06e6b949eb2","observation_id":"2c25dea5-686f-4947-be56-be29b27d9155","resolution":{"observed_at":"2026-08-07T04:42:03.738170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T04:42:03.781269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.781269Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:6990bbff38a30f2664ff4eb4a4a1cc53fc9da08c7254241f20335ca6b2812a9a","observation_id":"8a5f7fbd-95d5-4e82-9b39-1ffe23eaf7ce","resolution":{"observed_at":"2026-08-07T04:42:03.781269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-07T04:42:03.904872Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.arXiv preprint arXiv:2306.03310,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.904872Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:b98b0fe74b1dd720d8780ea29555496b8bc8dbd4d8308a7ebe9c466b7240693d","observation_id":"5366ed24-bd34-4772-91b0-b58102627c61","resolution":{"observed_at":"2026-08-07T04:42:03.904872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:08.839535Z","title":"Visual instruction tuning","venue":null,"work_id":"ad34636a-f3e7-433e-b478-9a2b90f7bec0","year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.997313Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:db78cf681f31f2e2973792a97b3cdcfd28505e64b9c26b0eccf30a855dc76a17","observation_id":"acd3e924-dcb6-4e59-84dd-32d9efb42b3f","resolution":{"observed_at":"2026-08-07T04:42:08.961317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-14T20:34:51.960761Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-07T04:42:04.036897Z","title":"Rectified flow: A marginal preserving approach to optimal transport, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.036897Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:90461c2d5244b357ccd91c500db713057d68125d4088b0a8e4ed4853386e882c","observation_id":"3a825f77-8c62-4827-a63d-fae94d00ac9d","resolution":{"observed_at":"2026-08-07T04:42:04.036897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T04:42:04.128560Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.128560Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:d75de74d801c0680734eae54eb0620baa6b5f1093d9b48455df3d156877a0f49","observation_id":"ea21fac9-c7c1-4fc8-80f2-d937895f41d5","resolution":{"observed_at":"2026-08-07T04:42:04.128560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-07T04:42:04.189941Z","title":"What matters in learning from offline human demonstrations for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.189941Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:b875d54ca65fe8f2dafc914a1372497d576fe9f64e34d5692e5599a0a220c47a","observation_id":"f7d4a076-07f3-4d94-bb82-cfa8c353b254","resolution":{"observed_at":"2026-08-07T04:42:04.189941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:08.616633Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks.IEEE Robotics and Automation Letters (RA-L), 7(3):7327–7334, 2022","venue":null,"work_id":"8cab17e9-7620-4d38-afe2-48a99d598df7","year":2022},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.283011Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:07b3f1a709b0bbbc3cba9cb8e0b4a5e6f13e030401c75b9dc6ba14031ca683bf","observation_id":"156eb4df-4266-4f88-a898-01374b2dda86","resolution":{"observed_at":"2026-08-07T04:42:08.731297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:08.451484Z","title":"RoboManipBaselines, December","venue":null,"work_id":"55814647-9c6a-468d-8ee4-413014974eba","year":null},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.352564Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:50bea183787e7385b5cd89282259e0982c0f551f2eeb0962d4d259a10060fefc","observation_id":"5c66e6c8-1674-4f14-8461-7089d1f0e2c4","resolution":{"observed_at":"2026-08-07T04:42:08.515642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:08.067193Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"4315097f-8704-414c-8f37-93c96427bf82","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.509031Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:e3454716357eb6ea7e0029cfed3a6b94debca9931c3007bfe7cd6a66efe972da","observation_id":"6bf085e6-01f9-4da8-8d34-e10d1caae89b","resolution":{"observed_at":"2026-08-07T04:42:08.177530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.895743Z","title":"gpt4o, 2024","venue":null,"work_id":"fce3116b-3b28-483a-9245-fcc4be9d608d","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.590014Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:fc862b3866f47bb47d2282bd8db16d465a677ba43817ddd3feb17fd85461ad63","observation_id":"5a7a5c19-55b3-4716-97aa-d25409227988","resolution":{"observed_at":"2026-08-07T04:42:07.948686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:42:04.670921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.670921Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:e1ad4c2bde08fa968aa6a8b36e39667a1e1ae64dceb46c6b8898eda939cf6f1c","observation_id":"16c5c5a6-c9ea-457d-b02c-a96bcbe279f6","resolution":{"observed_at":"2026-08-07T04:42:04.670921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.735081Z","title":null,"venue":null,"work_id":"c4f65a95-1783-4b29-bc12-ff514de4c83d","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.742455Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:2d3c754e8e9fdc937fb2bbc1d393c171c28265d1eba6082193f7045442823591","observation_id":"9bc60aae-10b8-4c33-9b05-dd9d98415e27","resolution":{"observed_at":"2026-08-07T04:42:07.813039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-19T10:37:36.887221Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-07T04:42:04.839068Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.839068Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:147ce7e2ff9ae79090bc78f7325157361147787e2c5ea2400b4fac385b88317f","observation_id":"66c08d11-835d-4732-b7d2-f8eac72be357","resolution":{"observed_at":"2026-08-07T04:42:04.839068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T04:42:04.937068Z","title":"Fast: Efficient action tokenization for vision-language-action models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.937068Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:6551d4591102bea9cd542d4c7853f4341eee781e1130a83e3f1ef2744a498830","observation_id":"d4f464ad-4aed-4261-9491-5e8dfbcfba1f","resolution":{"observed_at":"2026-08-07T04:42:04.937068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T04:42:05.044108Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.044108Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:b8a2a1d3acb6f311fe50638aa48b2f0de9a13c676c4e8e2998269b3df3d36ea9","observation_id":"a7599869-dcfc-4e08-b4bc-b0bbdd366888","resolution":{"observed_at":"2026-08-07T04:42:05.044108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.565061Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"202e8232-fe86-4211-9506-47a5c561e94c","year":2021},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.159411Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:bc6134c7bbc7cf4d0c59456ae8e753f77b4d55a83cedd9ec09612f44888d357d","observation_id":"63153e01-3e4f-4536-9664-d8ae44c94a4b","resolution":{"observed_at":"2026-08-07T04:42:07.641362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.375141Z","title":null,"venue":null,"work_id":"4de4570f-cdec-4961-b42b-0aa5c33756db","year":2020},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.232657Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:3c98f674e9250c1c547b2e4e3af9fdc6f43a060cf50b305e314ddd9740a0ee08","observation_id":"928ae829-0606-4ba7-8e14-fcba1b06b291","resolution":{"observed_at":"2026-08-07T04:42:07.475381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-07T04:42:05.314334Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.314334Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:e64bcd6d0f4851e8da8b14dc98ff46fa53c0ee70489012c7824a6aa289c11b0c","observation_id":"952a6701-c7ec-479c-9ea3-1305e37ac407","resolution":{"observed_at":"2026-08-07T04:42:05.314334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.248069Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"c5db91ae-a12d-4440-b670-174ce150033c","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.424420Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:c0c2fadad87f5ea0b2b6da4037f13b6cf3b3a95f0cdaf19dedf7b6181f789929","observation_id":"a804a151-5955-4284-84e7-9cc7f52a29c2","resolution":{"observed_at":"2026-08-07T04:42:07.323345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:07.098969Z","title":"Metamorph: Multimodal under- standing and generation via instruction tuning, 2024","venue":null,"work_id":"10b3b942-3692-4411-b49e-8cfaef798b65","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.541456Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:ebf6aae678582b83a262f67dba1986f471f6186339fc0d6c572e312870bb70e0","observation_id":"1f7feb02-84ed-478e-b985-553503aef950","resolution":{"observed_at":"2026-08-07T04:42:07.180134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:05.639347Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model.arXiv preprint arXiv:2410.08792, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.639347Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:e7abf4f9c7f5e7ca2d4c11568814a1cdaf6d1ac9a9e640f0d6ea62853141f7d7","observation_id":"2b2fa300-de27-470b-9a94-91a669883642","resolution":{"observed_at":"2026-08-07T04:42:05.639347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:06.900594Z","title":"Decomposing the generalization gap in imitation learning for visual robotic manipulation","venue":null,"work_id":"c91b0501-57af-4d11-a95f-8f73cc4dc5f7","year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.716768Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:22149c6fb04d9fda5b6160e9feb7cd30ea4536e823c31f0573b9b4cc7d9a6fb8","observation_id":"581770ba-6bfe-444b-ad65-cdb3dfebdfae","resolution":{"observed_at":"2026-08-07T04:42:07.012189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13130","last_updated":"2025-02-18T18:55:21Z","snapshot_observed_at":"2026-08-16T12:57:13.112901Z","submitted_at":"2025-02-18T18:55:21Z","title":"Magma: A Foundation Model for Multimodal AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13130","snapshot_observed_at":"2026-08-07T04:42:05.831412Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.831412Z"},"links":{"cited_paper":"/paper/2502.13130","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:52df248bb65731e09b1ada75a476a0f49afcdac6fd8eb544e3dd58f5dcd7618b","observation_id":"3fc7aefc-af35-4ad5-a4bf-727f9b6e9183","resolution":{"observed_at":"2026-08-07T04:42:05.831412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:05.914924Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:05.914924Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:43505c3ab748d20b4794ab98616b44e0830b50c03cda1e3fa0a066a9ea09f7a0","observation_id":"95b2b9ed-2033-42bb-9e5c-a4c1aca5bdbe","resolution":{"observed_at":"2026-08-07T04:42:05.914924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-19T12:50:53.888784Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T04:42:06.021627Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:06.021627Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:4220102a5fd74e6508d809f4f45a9eefe95aa95289333f642c608cc4327775a2","observation_id":"0479ad34-5cb8-45d6-b6a2-9d79d522827f","resolution":{"observed_at":"2026-08-07T04:42:06.021627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:06.749652Z","title":"carrot on plate","venue":null,"work_id":"cf5e729c-aab3-4747-a9e0-388073305e9f","year":2023},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:06.146713Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:31f7cd6d0b79c1746fc3f0ff0ddd91f74ae13b2260880332a1d729693f8895f2","observation_id":"b74ebdc7-4d61-4f68-980e-a90cdf7e78fc","resolution":{"observed_at":"2026-08-07T04:42:06.813547Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:42:08.263459Z","title":null,"venue":null,"work_id":"e2599489-29ff-4ae8-be56-d06be8ff0dad","year":null},"citing_paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:04.440709Z"},"links":{"citing_paper":"/paper/2506.09930"},"observation_digest":"sha256:0aa715d106fc2a3e163281535b855178bf5dae13f6e628bae3aec092e1d0ff8e","observation_id":"d042169b-3098-4228-bdd8-69403383f2f0","resolution":{"observed_at":"2026-08-07T04:42:08.365026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09930","last_updated":"2025-06-11T16:52:18Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T02:50:35.742484Z","submitted_at":"2025-06-11T16:52:18Z","title":"From Intention to Execution: Probing the Generalization Boundaries of Vision-Language-Action Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 14 inbound Pith citation observations for arXiv:2506.09930."}