{"as_of":"2026-08-05T23:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8523a8bbe17dfd68ec3d0486fb232a7075fd542768fd017b7a39e0fe401fa452","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T18:02:23.305313Z","state":"measured"},{"denominator":193,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":193,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":710,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:50:43.697483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:8d58b4287c4753d560aed62644023aa4e5ce180aaae8c63837ed9085b9d07b76","observation_id":"1bff4d0c-4c89-49f2-abc0-fa8959b304d5","resolution":{"observed_at":"2026-05-17T21:37:50.837969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:022fa0feed19f69813b2834d39b52d5d9449a2e914628790b4b40f1c0309e516","observation_id":"db3bf548-5062-47a9-a496-ea1fd0b8bd69","resolution":{"observed_at":"2026-05-14T19:48:48.967737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:2286ad29f49314923cccea90f72635eb4d427c8ace5bc20b81e5064843e8fd9e","observation_id":"c289f6b5-265d-4bab-9790-cadc7468ced2","resolution":{"observed_at":"2026-05-17T20:55:52.362088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:70e4876e31c55a9f7322a8cbed434c00335a6cf51c6bae4b7bcb3fa631f79aa5","observation_id":"b67af7ca-89d7-4017-8dcd-a9aed805bb63","resolution":{"observed_at":"2026-05-11T05:26:05.406172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:a6cd935efc56c7d6319202892f292f3dca4457433bc92f62be801cde4df20954","observation_id":"6ced7795-e819-4a0d-b6cb-46f522532940","resolution":{"observed_at":"2026-05-15T23:50:45.421014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.16278","last_updated":"2026-05-18T09:58:49Z","snapshot_observed_at":"2026-08-01T11:49:26.764186Z","submitted_at":"2025-05-22T06:23:04Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T14:30:47.787654Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.16278"},"observation_digest":"sha256:18940f5b4520e26b9900f77fec8a99251391145a670dd59da472cfa92e8ee0e5","observation_id":"b4e42aa6-311a-4dc5-861e-cf83f6f7fa2d","resolution":{"observed_at":"2026-05-22T14:31:40.702988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:ac18ad895ed68e47239d27b61ebb0bc024a923ba4cdd1a44d8487bfd42b56242","observation_id":"857dad4d-0e7d-4cc9-9770-0099d54f9e38","resolution":{"observed_at":"2026-05-21T14:25:47.218063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:3e557077c58fce6790b8127385370e2aa9b1e1c1716592cd9fecf801366d22d9","observation_id":"45587987-2e58-4c9b-ba7f-001bd17d22eb","resolution":{"observed_at":"2026-05-16T12:55:40.412498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:5b9a59ffe71fddd689b6ee3f1c613ee3ce3d5f897fe5989bd75fbfd7de472bc9","observation_id":"e5a96561-63e1-4239-81a0-1a43cb8bac19","resolution":{"observed_at":"2026-05-15T14:18:51.681308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:b69bb721d7b2ef7432b0f5503ca431625526d18bcb27018d20f5a3f3b07af5c3","observation_id":"72dc4682-8985-4280-81fd-d359e9130445","resolution":{"observed_at":"2026-05-11T00:33:50.677015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T22:57:07.883617Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.21539"},"observation_digest":"sha256:ee91862d452767c38a336da0fb4ba2145c0d56b497eb5f36651094cdf5768d62","observation_id":"101ca8ae-75dc-4e00-ab6f-89e1ace28cb3","resolution":{"observed_at":"2026-05-11T22:57:08.167210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:69a459ecbf7581dbd783bacf3b05468a807e62c379dc961d617a226fb063a92a","observation_id":"03d12432-816d-4351-be1d-ffe37b8cf870","resolution":{"observed_at":"2026-05-17T14:08:35.406683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:ab1c7493474675a3c3cdc0d58babae05fc27100b762eff9014cdb395ae84f796","observation_id":"d617f648-b2df-43ba-8faa-50399d09bc84","resolution":{"observed_at":"2026-05-16T15:42:41.574722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T04:32:56.397350Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.05331"},"observation_digest":"sha256:e136a82ec2e250386d9dd71ac706e5525fd779452c917e76b7dee2c0205cb053","observation_id":"8e86f715-3493-4a84-9516-e8def77facdf","resolution":{"observed_at":"2026-05-25T04:32:56.770143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.12440","last_updated":"2025-07-18T07:18:39Z","snapshot_observed_at":"2026-07-06T21:58:13.740929Z","submitted_at":"2025-07-16T17:27:44Z","title":"EgoVLA: Learning Vision-Language-Action Models from Egocentric Human Videos","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T04:32:58.733165Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.12440"},"observation_digest":"sha256:916453ded6a6c94ab7f6c8baf591a04ebcff45f30a7ec1b923770db04c39b349","observation_id":"c250a78b-7295-4aad-a829-6045709cac23","resolution":{"observed_at":"2026-05-21T04:32:58.770684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T09:54:28.271928Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.12898"},"observation_digest":"sha256:73f30976852f25357fe5e41f32bb2f63cde0ec420d0111210e3fac4861af39a8","observation_id":"2dea83ce-9844-4114-a00b-0f60d39b7f72","resolution":{"observed_at":"2026-05-16T09:54:28.306948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:3c41c4096315ae3239c911e322b7aa305e82e8714fcf7be731724c7f4f8e8dec","observation_id":"5d20a68c-29ed-4dcd-b978-f74f5fee51da","resolution":{"observed_at":"2026-05-17T08:04:12.625571Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T22:50:43.697483Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-05T22:50:39.090909Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:43.697483Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:096c54ff58337736c00d71957edbbacfe5fcd684df2a9253936e4b9ea2ddb812","observation_id":"37a80976-345c-4ebc-936f-47c047652646","resolution":{"observed_at":"2026-08-05T22:50:43.697483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T22:46:41.568220Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-05T22:46:26.310165Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:41.568220Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:49cafb0ebb56ca76b269d4331f4c705fa74010897e7c8f4e56d91d518c18506a","observation_id":"d3cc5d21-ff06-4a7c-aad9-629e010bf34a","resolution":{"observed_at":"2026-08-05T22:46:41.568220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":204,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:b915ce3e382c591d3d72784302482ee1b5001856c257a8cb259c5de4cd3f6835","observation_id":"e151758a-4ebc-43a5-9c26-778274baeca7","resolution":{"observed_at":"2026-05-17T20:28:16.256180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T14:42:32.635806Z","title":"π0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.635806Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:6c5912bab95b5e3ea992886564b1fadda901be6f4f3dfa238715aa10ad999500","observation_id":"24cbae40-cbb2-42ce-af58-84229a872e20","resolution":{"observed_at":"2026-08-05T14:42:32.635806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T14:39:58.527031Z","title":"π0.5 : a vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21063","last_updated":"2025-08-28T17:59:05Z","snapshot_observed_at":"2026-08-05T14:39:56.796203Z","submitted_at":"2025-08-28T17:59:05Z","title":"Prompt-to-Product: Generative Assembly via Bimanual Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:39:58.527031Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2508.21063"},"observation_digest":"sha256:451623c2cb0ab62e47fbdce6ceb7957181ee1a3fc5ea8f7ad4b83f9c1d6faa66","observation_id":"6cb59a10-a635-46a0-9e1c-776520621a03","resolution":{"observed_at":"2026-08-05T14:39:58.527031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T13:31:09.947328Z","title":"pi0.5: a vision- language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.947328Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:e1bf2c7aaa77c5150716dad8278f9f5ec282ffe04eaf874dd67c0868985b5be6","observation_id":"4a699971-f082-47c4-8c80-c75de34631a8","resolution":{"observed_at":"2026-08-05T13:31:09.947328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T12:02:28.277722Z","title":"arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02055","last_updated":"2025-09-05T06:24:50Z","snapshot_observed_at":"2026-08-05T12:02:25.039196Z","submitted_at":"2025-09-02T07:51:59Z","title":"Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:02:28.277722Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.02055"},"observation_digest":"sha256:1755bc4e9e2d7a6cc19fb2f4a73573e6a8f0d9b3b50b3160cf2c05f80eb6559d","observation_id":"e2b0527b-41a6-4c37-98c2-d8d7da7e52fe","resolution":{"observed_at":"2026-08-05T12:02:28.277722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T21:29:06.880873Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:06.880873Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:4ea1b600d9cc2de0893c72120c983f52264a4259b3d90992723f78dafa8bd350","observation_id":"eee92cf9-71f0-43df-9c11-9aaba1001183","resolution":{"observed_at":"2026-08-04T21:29:06.880873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T20:10:13.390798Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08820","last_updated":"2025-09-10T17:52:09Z","snapshot_observed_at":"2026-08-04T20:10:11.887304Z","submitted_at":"2025-09-10T17:52:09Z","title":"RoboChemist: Long-Horizon and Safety-Compliant Robotic Chemical Experimentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:10:13.390798Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.08820"},"observation_digest":"sha256:a9c75f17b95919e60277679a3fc5c511730959190f23f64d15b0aae8fb505641","observation_id":"41f9ae23-47df-4cfa-8699-e0e5f19bc2b6","resolution":{"observed_at":"2026-08-04T20:10:13.390798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:ac67c2d816862f25c752ce563ad5af5b303b26cd1641188a80ea16d8b454d6b7","observation_id":"8ccdd464-d875-4dd1-89a7-4b8d3fe74e44","resolution":{"observed_at":"2026-05-18T00:02:24.499007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:3ef3846411ab821a688fd28af051c48b45bb69fa7c795c563eaa4b43e3c1b598","observation_id":"f895124d-e9f9-4b5a-bd36-8e0cde952dff","resolution":{"observed_at":"2026-05-15T08:02:11.392205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T16:17:25.996881Z","title":"π 0.5: a vision-language-action model with open-world generaliza- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.996881Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:60ff7fe5324989e256ed4527d623c575d21b4f38a9296b233473fe2acea20ba7","observation_id":"317d6c8c-a1f1-45cc-8389-fde0af5ed0f4","resolution":{"observed_at":"2026-08-04T16:17:25.996881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T02:05:52.431747Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2509.24527"},"observation_digest":"sha256:868480934666c716685b7c3cded569ed1aafc9df31ccfab660491dfd729079c9","observation_id":"127896f9-22f6-4885-8a3f-34a7382a5108","resolution":{"observed_at":"2026-05-15T02:05:52.602287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T13:30:29.109251Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00182","last_updated":"2026-07-17T15:18:48Z","snapshot_observed_at":"2026-08-04T13:30:25.312429Z","submitted_at":"2025-09-30T19:03:14Z","title":"A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T13:30:29.109251Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.00182"},"observation_digest":"sha256:06d01e88f41f527f261aa36ec89b041b2f8393e43b8b97db50b242c64f382595","observation_id":"6fed43e7-171c-4653-83b6-24924e3dbcb8","resolution":{"observed_at":"2026-08-04T13:30:29.109251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T12:59:13.209733Z","title":"π 0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01389","last_updated":"2026-05-24T16:18:14Z","snapshot_observed_at":"2026-08-04T14:09:35.781731Z","submitted_at":"2025-10-01T19:22:48Z","title":"INSIGHT: INference-time Sequence Introspection for Generating Help Triggers in Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:59:13.209733Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.01389"},"observation_digest":"sha256:6522f95dc08dcf23287907baf04fa99a9592aa80ee6896cc1779932c13831100","observation_id":"a4da73bb-5af4-4e59-8536-a7b8193d8678","resolution":{"observed_at":"2026-08-04T12:59:13.209733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-04T11:38:48.693484Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T06:20:01.885711Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:b7cbe29e9a05d9ec1bdbb7b039c6b2bec7afc3f29a5a94687f92641d16c5283b","observation_id":"6f88509f-7fdf-4324-b089-902bbd28b144","resolution":{"observed_at":"2026-05-17T06:20:01.953718Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T11:38:53.815467Z","title":"Stephen James, Zicong Ma, David Rovick Arrojo, and Andrew J Davison","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-04T11:38:48.693484Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:38:53.815467Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.03827"},"observation_digest":"sha256:2e64356310719050c5dcb76318f25cb2710db3aa1a77ea7d3e37a4bc376be312","observation_id":"f15583d8-99a2-4077-bb3b-05299ba444b6","resolution":{"observed_at":"2026-08-04T11:38:53.815467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T11:38:12.607785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.607785Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:37fd1e9994cbaafeb541898bffce8488f5629164fa14dad7745b5f2dcee0c17d","observation_id":"13847b29-9fb7-4c7a-8aea-0ed219205bcd","resolution":{"observed_at":"2026-08-04T11:38:12.607785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T10:44:36.312378Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08807","last_updated":"2026-07-04T03:31:36Z","snapshot_observed_at":"2026-08-04T10:44:29.379805Z","submitted_at":"2025-10-09T20:43:27Z","title":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:36.312378Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.08807"},"observation_digest":"sha256:eae849369ddef6282cd93b16732d4a3bb6185dce33f90971cce27267af0c0bfa","observation_id":"c5c10fdb-c9c9-4880-9576-50d882d82c86","resolution":{"observed_at":"2026-08-04T10:44:36.312378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T01:14:10.174044Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.10125"},"observation_digest":"sha256:7aa67ecf04c6f6ca9b94d01ccce7173c18f917a6ab78b1de1820ae50eb950f41","observation_id":"c4e1984a-b5e8-4747-85e0-461ca5f17ead","resolution":{"observed_at":"2026-05-16T01:14:10.462298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2510.12796","last_updated":"2025-12-18T07:25:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-14T17:59:47Z","title":"DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T06:48:00.943591Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.12796"},"observation_digest":"sha256:06c4226939c459ea887b81a9cb9b555d9c2d3aae5e01ff41f0fd0a69b397caeb","observation_id":"7e26644c-764d-4401-a13c-73b1c64c5931","resolution":{"observed_at":"2026-05-17T06:48:01.060499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T09:34:42.876795Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T09:34:42.876795Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.14836"},"observation_digest":"sha256:42305fcbda704441eb396061a91846048b9d137f8b4723b8552abebfae1850d4","observation_id":"2c2d1d15-49a7-4538-98a7-2f3b8694c86e","resolution":{"observed_at":"2026-08-04T09:34:42.876795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T09:16:08.892396Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.16435","last_updated":"2026-05-22T18:07:30Z","snapshot_observed_at":"2026-08-04T09:16:05.194969Z","submitted_at":"2025-10-18T10:16:45Z","title":"What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T09:16:08.892396Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.16435"},"observation_digest":"sha256:dfcd58df5528787ad131e34b7957440fbcfa55bf1eb22df42fc8102f9b26a05c","observation_id":"05942d54-c760-462d-aec7-289e9565d1b2","resolution":{"observed_at":"2026-08-04T09:16:08.892396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2510.17640","last_updated":"2026-04-10T05:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-20T15:21:12Z","title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T06:10:47.309028Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.17640"},"observation_digest":"sha256:54e544cb76d4259f5dd774e86df8897e0c82139a24a41b16802ee2569c113b00","observation_id":"cd8a25d4-d20e-4821-b7ed-6d7c424de79e","resolution":{"observed_at":"2026-05-18T06:10:57.862148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T08:53:10.367470Z","title":"abs/2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18608","last_updated":"2025-10-21T13:06:52Z","snapshot_observed_at":"2026-08-04T08:53:09.218522Z","submitted_at":"2025-10-21T13:06:52Z","title":"A Compositional Paradigm for Foundation Models: Towards Smarter Robotic Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:10.367470Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.18608"},"observation_digest":"sha256:44fceac103097abe63750cb1d6f4ef1e00d7f512f6cb1b26d58c2ffb427df040","observation_id":"70eb54f7-2acf-45d7-aa92-c5deb405cecb","resolution":{"observed_at":"2026-08-04T08:53:10.367470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2510.21583","last_updated":"2026-05-20T09:16:04Z","snapshot_observed_at":"2026-07-06T22:33:58.663508Z","submitted_at":"2025-10-24T15:50:36Z","title":"Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T19:47:48.545820Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.21583"},"observation_digest":"sha256:c348e9a2279884230dc24d36f0d01cee8bd037ee8fe9b18839d2e40dbb8b22f5","observation_id":"2d19ea9a-fc35-4144-92dd-8c6d4e76cb84","resolution":{"observed_at":"2026-05-21T19:50:33.868682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T02:35:13.126171Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.00088"},"observation_digest":"sha256:487f4f95ab5ada2c5876685e57c3e3ec6f6ec79ee83cb04f969e617b7fd0897b","observation_id":"f22d87d0-674b-409d-8883-68ec379d1e4a","resolution":{"observed_at":"2026-05-18T02:35:13.194295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-04T00:09:53.037371Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T01:05:01.553811Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:890dd6bd37078ab6115abf4ecb410230f4d50223c26d002277657498fea8dfc4","observation_id":"3220ba0f-cba3-45c1-9046-468f63db3259","resolution":{"observed_at":"2026-05-18T01:05:33.754905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T00:10:04.706491Z","title":"_ 0.5 : a vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02776","last_updated":"2026-07-12T06:20:43Z","snapshot_observed_at":"2026-08-04T00:09:53.037371Z","submitted_at":"2025-11-04T17:59:12Z","title":"XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T00:10:04.706491Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.02776"},"observation_digest":"sha256:b87fadcbb5b4c848cde3b03672774af37bb867332d832e2bd09daf34e4facbd7","observation_id":"8734c05c-1182-44e2-9a35-0fa48370b3ec","resolution":{"observed_at":"2026-08-04T00:10:04.706491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T23:08:51.090448Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07403","last_updated":"2026-07-02T19:21:24Z","snapshot_observed_at":"2026-08-03T23:08:47.401867Z","submitted_at":"2025-11-10T18:52:47Z","title":"SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:08:51.090448Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.07403"},"observation_digest":"sha256:3a6f62eb3b877ae9dbe7b97b3e1fc67f9349e1aa975f5e415eb5de52d66153c3","observation_id":"12199c74-cd1d-47a9-8c57-0bec1d2b0098","resolution":{"observed_at":"2026-08-03T23:08:51.090448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T22:03:27.184247Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12795","last_updated":"2026-06-04T23:11:07Z","snapshot_observed_at":"2026-08-03T22:03:23.193636Z","submitted_at":"2025-11-16T21:55:05Z","title":"ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-based Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T22:03:27.184247Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.12795"},"observation_digest":"sha256:57d1ebe32759b5ae8dc12f5ab4046d93d07292427c5a9d84b8d07848777149fb","observation_id":"1e5343eb-1f60-4702-a82a-269dbe94dcd3","resolution":{"observed_at":"2026-08-03T22:03:27.184247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:568cc16b9eab62aad74783cc7b06fa8971f294676f30df846a6119471838d917","observation_id":"9ba93a51-b85a-458b-88db-d0aa7b7143c1","resolution":{"observed_at":"2026-05-17T21:30:18.339633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.15669","last_updated":"2026-04-20T12:58:10Z","snapshot_observed_at":"2026-08-02T21:34:45.427514Z","submitted_at":"2025-10-31T05:26:16Z","title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T03:09:09.713822Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.15669"},"observation_digest":"sha256:eac3b4745463852d7181e8153ec2bfa74a0e83c8d8696612e77b64fee5737989","observation_id":"5e9c034e-c047-46c3-a72b-9110abd22f73","resolution":{"observed_at":"2026-05-18T03:10:48.920061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T21:16:51.909363Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.17001"},"observation_digest":"sha256:351dc9ddab8da5f47921cd41cf89eca18ab4bd63fb01f8ba6366fec8f2cd2db3","observation_id":"b1fd7e4e-a5f9-4452-8d6e-e485c52fed88","resolution":{"observed_at":"2026-05-17T21:20:17.191917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T20:59:51.301625Z","title":"arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:59:51.301625Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2511.17502"},"observation_digest":"sha256:f1d70d500ad989de6c9ffa3a91d75c4d8eea99c49493601e58c6b66eda93649b","observation_id":"2276f108-a3ec-49d7-bcaf-a04833d25917","resolution":{"observed_at":"2026-08-03T20:59:51.301625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T19:22:54.520626Z","title":"1, 2, 3, 5, 6, 7, 8","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01031","last_updated":"2026-07-26T23:00:24Z","snapshot_observed_at":"2026-08-04T22:29:52.995491Z","submitted_at":"2025-11-30T18:59:24Z","title":"VLASH: Real-Time VLAs via Future-State-Aware Asynchronous Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T19:22:54.520626Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.01031"},"observation_digest":"sha256:91c9589134c5785eab235833a70f90027af20ac5d488784fd090d17a99b13a6e","observation_id":"11066cb0-96ae-43b5-81dc-de0f302b5d77","resolution":{"observed_at":"2026-08-03T19:22:54.520626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T19:11:42.801522Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.01715","last_updated":"2026-07-01T14:29:04Z","snapshot_observed_at":"2026-08-03T19:11:41.556847Z","submitted_at":"2025-12-01T14:21:15Z","title":"Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T19:11:42.801522Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.01715"},"observation_digest":"sha256:7845bb0dca75e10246d65ad13f0ef39a14c91f80affa2fd8c9b17d026e09b046","observation_id":"959b51c7-0685-4d7b-b8ea-6f7a0fb70425","resolution":{"observed_at":"2026-08-03T19:11:42.801522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2512.01773","last_updated":"2026-04-15T17:13:09Z","snapshot_observed_at":"2026-08-03T04:29:49.820139Z","submitted_at":"2025-12-01T15:15:04Z","title":"IGen: Scalable Data Generation for Robot Learning from Open-World Images","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T02:58:36.214948Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.01773"},"observation_digest":"sha256:dd1b9f6824429d7205d96ae482c887e449f0107d9691558d423935cfab2120cf","observation_id":"2877a3d8-5e91-4fb3-b1a8-b40025c437f9","resolution":{"observed_at":"2026-05-17T02:58:55.029388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2512.09928","last_updated":"2026-04-09T17:02:58Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-10T18:59:32Z","title":"HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T23:01:13.910539Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.09928"},"observation_digest":"sha256:1c44032a5a57051363e7e121e147eb1bc0176da49b80490cc7f5dbeadb5b69ae","observation_id":"95cf4eea-589e-48d0-b830-58bc45045b29","resolution":{"observed_at":"2026-05-16T23:01:20.386325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T17:05:07.647630Z","title":"π 0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10946","last_updated":"2026-07-21T09:04:48Z","snapshot_observed_at":"2026-08-03T17:05:06.727123Z","submitted_at":"2025-12-11T18:59:46Z","title":"ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T17:05:07.647630Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.10946"},"observation_digest":"sha256:847a5a88c384edc724c4bf3f568617efff7eca6099ad50c915ea3c61bdc7e9a1","observation_id":"02e4d1ea-30fb-4843-9d24-274fc9f9f59d","resolution":{"observed_at":"2026-08-03T17:05:07.647630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T17:38:20.732710Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11891","last_updated":"2026-07-02T17:23:13Z","snapshot_observed_at":"2026-08-03T17:38:18.677599Z","submitted_at":"2025-12-09T16:53:44Z","title":"VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T17:38:20.732710Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.11891"},"observation_digest":"sha256:fd5122278b94f39ccf35e41c386b061017acb4e9500b8d6f12cb73068d8b73e0","observation_id":"3856cc85-aa78-4f76-a532-ad5fcb631af5","resolution":{"observed_at":"2026-08-03T17:38:20.732710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T17:32:14.406664Z","title":"5: a vision-language-action model with open-world generaliza- tion, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.11899","last_updated":"2026-07-21T16:21:35Z","snapshot_observed_at":"2026-08-03T23:38:42.360154Z","submitted_at":"2025-12-10T08:34:28Z","title":"Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T17:32:14.406664Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.11899"},"observation_digest":"sha256:aeb42b65f6de0f87bacdc03dd1018c55d1c71cbe91be2259d802121a25f11baa","observation_id":"6b47a868-7136-425e-9eb9-6fb24fb95377","resolution":{"observed_at":"2026-08-03T17:32:14.406664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T16:27:23.426184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13636","last_updated":"2026-07-17T07:01:14Z","snapshot_observed_at":"2026-08-04T13:44:30.220787Z","submitted_at":"2025-12-15T18:31:32Z","title":"MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:27:23.426184Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.13636"},"observation_digest":"sha256:28f98a0f42955305f6b0924bea33519f5ffa3dfa457470ea958033c5fbe5a902","observation_id":"da3fe36e-dd70-4f7a-8681-45877e354712","resolution":{"observed_at":"2026-08-03T16:27:23.426184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:00.142543Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.15692"},"observation_digest":"sha256:799b3e58c2a35ffe31599419dda1375a2f04fe607e34dad5434df63a4a0cc6a6","observation_id":"d63030b4-20dc-40c1-b027-472928688250","resolution":{"observed_at":"2026-05-15T10:41:00.323961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T15:05:03.261026Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18368","last_updated":"2026-07-02T04:31:01Z","snapshot_observed_at":"2026-08-03T15:05:00.790623Z","submitted_at":"2025-12-20T13:46:08Z","title":"Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T15:05:03.261026Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.18368"},"observation_digest":"sha256:d2f07f7e5d7b27379aeac01ccbf08cfc0d9c764954e3b2fb48fe6d82171a95d8","observation_id":"49176935-da59-4e4c-a172-d0113ba9cccb","resolution":{"observed_at":"2026-08-03T15:05:03.261026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T14:00:20.747597Z","title":"π0. 5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:00:20.747597Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.21970"},"observation_digest":"sha256:a0ebab36e6f20bc90f6803c7c3528ea2a3b4ae2fd85cb2e40c6f2ed1579852e1","observation_id":"ba07debc-8ef5-439a-8209-c1b2b6bdb2a3","resolution":{"observed_at":"2026-08-03T14:00:20.747597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2512.22519","last_updated":"2026-04-24T04:40:53Z","snapshot_observed_at":"2026-07-06T22:40:12.666349Z","submitted_at":"2025-12-27T08:31:25Z","title":"Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T19:28:35.576661Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.22519"},"observation_digest":"sha256:f7815b035b8c0aca03e66742a57f26eb57fcfb32ac9029fb330f54bbfa5bd0d0","observation_id":"1bc8d88f-6cda-44f0-a3c2-8788ec401683","resolution":{"observed_at":"2026-05-16T19:31:13.400040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-03T13:35:53.078536Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T18:39:59.449746Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.23864"},"observation_digest":"sha256:8de06d83ba41f8099b4f28afc6d6212e88ae718c9540f9868204ed5edd9d8f8c","observation_id":"f633d5bf-2293-42d2-bf5d-ae6e706e68b7","resolution":{"observed_at":"2026-05-16T18:41:10.923589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T13:35:54.101247Z","title":"π0.5: A vision-language-action model with open- world generalization.arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.23864","last_updated":"2026-06-28T00:20:33Z","snapshot_observed_at":"2026-08-03T13:35:53.078536Z","submitted_at":"2025-12-29T21:06:33Z","title":"Learning to Feel the Future: DreamTacVLA for Contact-Rich Manipulation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:35:54.101247Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.23864"},"observation_digest":"sha256:829ae5fae914c8a2cf8a0b54dfc6b88a39f754f415ae0207a89c3cdf83d89218","observation_id":"32694325-e753-4d5d-9de2-3a90dc290465","resolution":{"observed_at":"2026-08-03T13:35:54.101247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T13:29:47.182992Z","title":"π 0.5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-04T11:27:48.952895Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:47.182992Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:7b06ee8a7cce533e7698416996ea4a588e090908c7750dae22b99981f0a0e53d","observation_id":"cb7779e4-cd41-46bb-84a2-f7208358222d","resolution":{"observed_at":"2026-08-03T13:29:47.182992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2601.02078","last_updated":"2026-06-30T05:51:48Z","snapshot_observed_at":"2026-08-03T12:41:49.134646Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T18:02:11.393346Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.02078"},"observation_digest":"sha256:aff9f89ed87938cfea25b0e55e4f47e21a48f08139135353bdaf193fa3b25258","observation_id":"c554426d-5ef4-47c7-937a-f1f8de4fc835","resolution":{"observed_at":"2026-05-16T18:03:12.204186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T12:41:54.996220Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02078","last_updated":"2026-06-30T05:51:48Z","snapshot_observed_at":"2026-08-03T12:41:49.134646Z","submitted_at":"2026-01-05T12:59:39Z","title":"Genie Sim 3.0 : A High-Fidelity Comprehensive Simulation Platform for Humanoid Robot","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T12:41:54.996220Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.02078"},"observation_digest":"sha256:50f4b3b989eb7470ab3763ef7796859303977ae599b87f7896f026abd76b1156","observation_id":"dfb145c8-acff-429b-8e15-964018781195","resolution":{"observed_at":"2026-08-03T12:41:54.996220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T12:37:24.605491Z","title":"π0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.02295","last_updated":"2026-07-28T17:46:45Z","snapshot_observed_at":"2026-08-03T12:37:21.822048Z","submitted_at":"2026-01-05T17:31:01Z","title":"CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:37:24.605491Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.02295"},"observation_digest":"sha256:b00001ab2ecde2d7c1be5b881ac21f2b50868c2b5b5c8bd423b679c6acc01ac9","observation_id":"5d3eeb53-4de4-49ff-9163-060000a59307","resolution":{"observed_at":"2026-08-03T12:37:24.605491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T12:30:33.806316Z","title":"pi0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:30:33.806316Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.03309"},"observation_digest":"sha256:e26d1037f86577b27315ff12f457ebe7b69c838afd1a5b2e5eaef0fba94fab12","observation_id":"3c7bdf54-4323-4445-87c4-d80772fa3baf","resolution":{"observed_at":"2026-08-03T12:30:33.806316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:c99eacc6ec28def0dd08edbb9ab0428abdcd5b5f4a764da6114943f56948df40","observation_id":"3befa379-7fdd-4311-a3ce-4bb9df6d84b2","resolution":{"observed_at":"2026-05-16T15:08:01.749537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2601.09512","last_updated":"2026-05-15T10:27:07Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-14T14:23:42Z","title":"CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T15:53:44.767068Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.09512"},"observation_digest":"sha256:7217133d860fc53cb6150a9a3afefd5dcc7e3532652d1b132a9f0619519af15b","observation_id":"559cc542-074e-403f-bace-651f1620e661","resolution":{"observed_at":"2026-05-21T15:54:14.486258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T09:36:21.735961Z","title":"Bo Liu, Yifeng Zhu, Chongkai Gao, Yihao Feng, Qiang Liu, Yuke Zhu, and Peter Stone","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.14323","last_updated":"2026-05-31T06:08:19Z","snapshot_observed_at":"2026-08-03T09:36:19.663430Z","submitted_at":"2026-01-20T01:24:17Z","title":"SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T09:36:21.735961Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.14323"},"observation_digest":"sha256:80021c09c3d8c22cc9303d4b9532b7ad3a49332a3e0b2a16628b36bf2ce8d2ea","observation_id":"ba848dd2-a97e-4270-b92f-4a85e068cd45","resolution":{"observed_at":"2026-08-03T09:36:21.735961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T14:50:12.804707Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.16163"},"observation_digest":"sha256:53769b7cf25f26a433a75e3d1a352e31581f6b0a02e05a8d22b2ccb677d09faf","observation_id":"a2574a6b-878b-45b6-8c80-5736e89514f3","resolution":{"observed_at":"2026-05-12T14:50:12.938758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2601.20239","last_updated":"2026-05-13T12:53:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T04:22:47Z","title":"TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T11:06:23.555610Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2601.20239"},"observation_digest":"sha256:1b01484c5ad2555ec07b6c054ce57c9316e8485fd76aa028fdba7de31dd01d8a","observation_id":"6f4d1fdb-fa58-41f1-9dde-fb0e10ffac64","resolution":{"observed_at":"2026-05-16T11:07:48.160072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:a90a9c680d111946e607b8e4d9ae4bb8b26725a65c838106a3b50a481f9d1621","observation_id":"ff30f187-bf5b-4e2a-b0ea-69750a3f8f9d","resolution":{"observed_at":"2026-05-16T08:27:36.858412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T05:38:48.729216Z","title":"pi0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.01662","last_updated":"2026-05-31T01:44:31Z","snapshot_observed_at":"2026-08-04T04:26:21.121118Z","submitted_at":"2026-02-02T05:30:14Z","title":"PLanAR: Planning-Language-Grounded Agentic Reasoning for Robot Manipulation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T05:38:48.729216Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.01662"},"observation_digest":"sha256:7419fa0fd95d4fd095d116d92582f9533d9ad8c4c94c144a42e968e7e0a7b688","observation_id":"cba26dfb-47e4-4a94-8d5f-35dae4d9bcfe","resolution":{"observed_at":"2026-08-03T05:38:48.729216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T04:23:41.983791Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05233","last_updated":"2026-06-26T06:02:43Z","snapshot_observed_at":"2026-08-05T00:47:39.586138Z","submitted_at":"2026-02-05T02:49:52Z","title":"MobileManiBench: Simplifying Model Verification for Mobile Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:23:41.983791Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.05233"},"observation_digest":"sha256:c816e9d150d83d113a304f2f95ac7926c59b07706d44f8623e701cb2eaef8d6e","observation_id":"ec841025-6bab-4d75-be70-b62660958626","resolution":{"observed_at":"2026-08-03T04:23:41.983791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.06339","last_updated":"2026-05-12T02:54:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-06T03:05:30Z","title":"Action Hallucination in Generative Vision-Language-Action Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T07:29:48.843843Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.06339"},"observation_digest":"sha256:eafceada5116d5731504ce731b8f5a12ad58ed411e69ca276997bcafc7e4bbe8","observation_id":"e8efcab4-8756-4f76-a201-a4a26be4ae40","resolution":{"observed_at":"2026-05-16T07:30:44.245198Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T03:56:04.604747Z","title":"Y., Ghosh, D., Groom, L., Hausman, K., Ichter, B., Jakubczak, S., Jones, T., Ke, L., LeBlanc, D., Levine, S., Li-Bell, A., Mothukuri, M., Nair, S., Pertsch, K., Ren, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.604747Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:57e0e1985366181c85e7904d603cc987250e5a3dda5632f8cf964b4be379ab5b","observation_id":"822fa9cc-27c0-42aa-804c-b12f3cc2c5b0","resolution":{"observed_at":"2026-08-03T03:56:04.604747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T03:51:43.920039Z","title":"π0.5: A vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06868","last_updated":"2026-06-10T12:12:23Z","snapshot_observed_at":"2026-08-04T09:25:46.963479Z","submitted_at":"2026-02-06T16:55:10Z","title":"Consensus-based optimization (CBO): Towards Global Optimality in Robotics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:51:43.920039Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.06868"},"observation_digest":"sha256:8a63eba151db9bd3faf1e6180c6da3d8fc6bd4ae0ee818482f912ebad24939b9","observation_id":"f429bd4f-dda0-41d3-87bd-1f735a17ee52","resolution":{"observed_at":"2026-08-03T03:51:43.920039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.07399","last_updated":"2026-05-22T10:22:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T06:31:53Z","title":"VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T07:00:01.741166Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.07399"},"observation_digest":"sha256:18468c63c7dbe035454454e51ea7bd4dbfbd6940edf0e7a7ec14668acc4776f3","observation_id":"cbe83c48-fda6-4a53-9f4c-0bd5983d5603","resolution":{"observed_at":"2026-05-25T07:00:26.056998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.09023","last_updated":"2026-05-19T02:18:04Z","snapshot_observed_at":"2026-08-02T13:36:40.045905Z","submitted_at":"2026-02-09T18:59:52Z","title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:53.818915Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.09023"},"observation_digest":"sha256:85f0a08447966bf5946ca032914efa11dd3db82a23dca745ebd7dec2bbf44d32","observation_id":"d84481d5-0f37-4a81-bff2-b68a4b21982d","resolution":{"observed_at":"2026-05-21T13:14:10.822640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:d4328efecd09d665da6c07a43f8dfca5d59952851d030d33cb385c6534d7f7e5","observation_id":"453b2280-79e1-4fb6-a597-2683c9e4ee6b","resolution":{"observed_at":"2026-05-16T03:37:13.930979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T02:53:16.234139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T02:53:16.234139Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:b0cea9fa78461936a9b8c07601b7251e5ab798925e87e89e443405fff5e83b18","observation_id":"2e14a9a8-b0db-46fd-917c-51ac4d7493bd","resolution":{"observed_at":"2026-08-03T02:53:16.234139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:ca005962a7b3a6a4a0f9e70a983216100df3c7cf784b79894d56c63d67dd15ab","observation_id":"8ce62710-b8d4-451e-a343-9dc33d815d60","resolution":{"observed_at":"2026-05-21T14:10:13.306712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.10698","last_updated":"2026-02-11T09:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T09:57:32Z","title":"AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T06:01:30.803128Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.10698"},"observation_digest":"sha256:e8ac93c298ae5cd072eed8bda707acdd30d295a9e6747d936804de75140abd28","observation_id":"c06f1fc0-9b34-480a-ad17-ba7a970d86c0","resolution":{"observed_at":"2026-05-16T06:02:24.993241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:fc6c42ed816289c5d998fcfc43343ec811e0cbd80cb801724b838fa05cbff533","observation_id":"62cccc27-cd54-4ada-aebf-f88eef954206","resolution":{"observed_at":"2026-05-16T02:30:32.154029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T03:11:52.645633Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.11236"},"observation_digest":"sha256:c6218ce789466c4e7b904334c06f115232fba779a057a1afe92e95b07e629f10","observation_id":"12fc5a08-103d-474b-a7c4-9b4e8fa421b1","resolution":{"observed_at":"2026-05-16T03:12:11.669904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T00:02:12.805125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11934","last_updated":"2026-06-08T09:01:34Z","snapshot_observed_at":"2026-08-04T13:02:28.723589Z","submitted_at":"2026-02-12T13:30:24Z","title":"Robot-DIFT: Correspondence-Sensitive Diffusion Features for Contact-Rich Robot Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:12.805125Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.11934"},"observation_digest":"sha256:5aa7fb03fb319e85c903c8421b19befa8b3670a75b57f42211bb21acf7519ad8","observation_id":"ac8d9279-251b-419a-bea3-ce423503ecbe","resolution":{"observed_at":"2026-08-03T00:02:12.805125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T23:57:44.611376Z","title":"π0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T23:57:44.611376Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.12215"},"observation_digest":"sha256:ff52b6a3091009b530005aab1682f17e6749dc7b49cdaa0bedb1ac1ee1a8105f","observation_id":"8fdfede4-577f-473e-b6bb-34c1cfcf2ae9","resolution":{"observed_at":"2026-08-02T23:57:44.611376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T23:48:58.046107Z","title":"pi {0.5}: a vision-language-action model with open- world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-02T23:48:53.948791Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T23:48:58.046107Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.12628"},"observation_digest":"sha256:1dd2a91bfae8537ee5aaad5bc97ad58eb219fd798a4409eea6e4e8919637f366","observation_id":"dfe368ce-6ede-4d57-a0e1-890224b89277","resolution":{"observed_at":"2026-08-02T23:48:58.046107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T23:23:51.672629Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T23:23:51.672629Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.13977"},"observation_digest":"sha256:daafa1df383db6ce18a4834f0b921112052e0987f412709a64b736237cc215b9","observation_id":"33274cb5-09d9-4684-af41-3ef5e931b8f8","resolution":{"observed_at":"2026-08-02T23:23:51.672629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:8a64931d963938348cb58a01119551d6ebbd6a876b92f8a6aa237ee0ed66f927","observation_id":"f3859444-12dd-4cc5-8c70-f4e5eab3d792","resolution":{"observed_at":"2026-05-11T16:18:15.507578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T22:14:26.872226Z","title":"π0.5: a vision-language-action model with open-world generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17659","last_updated":"2026-07-15T16:20:07Z","snapshot_observed_at":"2026-08-04T20:00:40.213674Z","submitted_at":"2026-02-19T18:59:20Z","title":"When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:26.872226Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.17659"},"observation_digest":"sha256:6d8526a9fa9b56b62f3ab38d616c76238a0f9fe0327fa7f6f12e84fb89818752","observation_id":"0a3d9840-ce2f-4f5c-9780-6474f13409af","resolution":{"observed_at":"2026-08-02T22:14:26.872226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.20200","last_updated":"2026-05-18T05:10:52Z","snapshot_observed_at":"2026-07-06T22:46:49.536946Z","submitted_at":"2026-02-22T15:39:34Z","title":"Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T13:22:16.242427Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.20200"},"observation_digest":"sha256:2e0268dc6692f756f36c63730c6eb02c4af60d3b6a316029d44b98176403fe22","observation_id":"92826e6a-2113-45d5-840c-7794690bd75e","resolution":{"observed_at":"2026-05-21T13:24:11.161214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2602.20309","last_updated":"2026-04-06T23:32:59Z","snapshot_observed_at":"2026-08-02T13:10:10.837199Z","submitted_at":"2026-02-23T19:55:54Z","title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:20:10.435886Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.20309"},"observation_digest":"sha256:d055a0e60bd79071285181bf877027cca3ad728f0dce553da68fa653e7cb3127","observation_id":"4c857a25-5d50-4912-b536-efb2ad166f3f","resolution":{"observed_at":"2026-05-15T20:20:17.357438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T21:12:11.016607Z","title":"π0.5: a vision- language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21013","last_updated":"2026-05-29T17:02:38Z","snapshot_observed_at":"2026-08-02T21:12:09.620600Z","submitted_at":"2026-02-24T15:30:55Z","title":"Notes-to-Self: Scratchpad Augmented VLAs for Memory Dependent Manipulation Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:12:11.016607Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.21013"},"observation_digest":"sha256:91b64abfba1e25f7ddd35e976f8a5d73aeab8045e24a0a678cdfed98b7ab8ccf","observation_id":"9733372d-3292-4d28-92cd-2715eac8a56c","resolution":{"observed_at":"2026-08-02T21:12:11.016607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T21:09:32.221168Z","title":"Sotaro Katayama, Masaki Murooka, and Yuichi Tazaki","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21331","last_updated":"2026-06-09T16:18:54Z","snapshot_observed_at":"2026-08-02T21:09:30.967859Z","submitted_at":"2026-02-24T20:01:29Z","title":"CableRobotGraphSim: A Graph Neural Network for Modeling Partially Observable Cable-Driven Robot Dynamics","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:09:32.221168Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.21331"},"observation_digest":"sha256:128c1faf794c1a22773aeb4a81148dde7afc70d12b029554ffe61e0306338cd7","observation_id":"53349c06-8d18-40a0-9b86-0ec37d997b72","resolution":{"observed_at":"2026-08-02T21:09:32.221168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16054/citation-record","integrity":"/paper/2504.16054/integrity","json":"/paper/2504.16054/citation-record.json","paper":"/paper/2504.16054"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:87412531972f2ae5549824768aeceaf0eaadebec65a0c6d06f34b3b4a6ca5059","observation_id":"3f3e3f5d-95c4-4dba-80a1-873ce12d6d39","resolution":{"observed_at":"2026-05-22T18:05:01.002542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:8eab15acd9d19b55a4aa4279dace13a99295b8ee647a43a90f5e0b91d7607a15","observation_id":"78d66ea7-8622-4c83-a5a6-a95c2d5e91be","resolution":{"observed_at":"2026-05-22T18:05:00.997231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minivla: A better vla with a smaller footprint","venue":null,"work_id":"5feb606f-b7fc-495a-ae0e-89240411e3fd","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:add40b899b1641c6662bcefc0e694e6a99db7bdedc32cbd9ad242fb7f3e130c7","observation_id":"d45c2814-20a1-40ab-bbf5-4fccddb9e364","resolution":{"observed_at":"2026-05-22T18:05:01.451836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":"2403.01823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-07-10T14:37:16.092859Z","title":"RT-H: Action Hierarchies Using Language","venue":"cs.RO","work_id":"ecf7cf18-c1a8-4a6b-bc2a-fb165643aa0d","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:41434e957e8ff2a76ee9a92e69dbb0973bdcd9d4c6277842988b4b8ed184098a","observation_id":"1222a5a0-d94e-4da3-9bf8-337b50151eb9","resolution":{"observed_at":"2026-05-22T18:05:00.991878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:ee6c27d46240493eb79ea477072085e5ebc9e8fd1f5beca81a43189c68162dbe","observation_id":"89e3696b-734e-4753-bf03-c3f2e0044103","resolution":{"observed_at":"2026-05-22T18:05:00.994437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roboagent: Generalization and efficiency in robot manip- ulation via semantic augmentations and action chunking","venue":null,"work_id":"4f788291-1da0-46e3-b5f9-9575c4a909ba","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:3a72db80b0ab41867b132ad4e7da890a3704365249b2ecf7756f803ecef1d53a","observation_id":"328a572c-4a08-401a-a4f5-d2da11190dcc","resolution":{"observed_at":"2026-05-22T18:05:01.460975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:251068cef085731a7cd59f89697f473818dda503e59fc798038a7700ccab8690","observation_id":"10b90701-b7af-4b2b-9ebe-eac35d252f1e","resolution":{"observed_at":"2026-05-22T18:05:00.980064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9f0c501a07caba69e33e323858cba07f8152ad6893e9fac6dc98231efe52a995","observation_id":"5e556176-8e55-4d4a-865a-26b45d0f82cf","resolution":{"observed_at":"2026-05-22T18:05:00.986329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:1f7c5b119aa9d9f472da3f203cfacafaebc17fe599f6edaaa218b6913aa03e91","observation_id":"b1510de5-0c53-457a-8cbe-ebc43ff4fc69","resolution":{"observed_at":"2026-05-22T18:05:00.983104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"970b2a83-3145-4c74-8520-b7b64ecebf7f","year":2020},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:86c5720f9f6a5b2dad0fc3084ee7307cb0ad6591f1acb8571c49a7f765359055","observation_id":"4f1d3e48-3b07-4bb0-ba34-beeac5598e02","resolution":{"observed_at":"2026-05-22T18:05:01.459125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03966","last_updated":"2024-09-06T01:29:35Z","snapshot_observed_at":"2026-07-06T19:11:18.410415Z","submitted_at":"2024-09-06T01:29:35Z","title":"Automating Robot Failure Recovery Using Vision-Language Models With Optimized Prompts","version":1},"cited_work":{"arxiv_id":"2409.03966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03966","snapshot_observed_at":"2026-07-03T01:17:30.743384Z","title":"Automating robot failure recovery using vision-language models with optimized prompts","venue":null,"work_id":"d854d08b-8c6f-4189-9ef1-ef4571912927","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2409.03966","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:22f3d89ed5c6b9c3a987310f20fba7cc90285bdebe934edee8e94def821e39cd","observation_id":"1b3ceba0-937f-4688-9dce-193331f2c144","resolution":{"observed_at":"2026-05-22T18:05:00.974652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:c93c7aa944b5c8b0fb6fdbda66e24fff444f2faabbb741002dead4239e3a8a85","observation_id":"75e1d32f-7ffe-4658-b2fc-ef8ea69bf78d","resolution":{"observed_at":"2026-05-22T18:05:00.977492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":"2412.04453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-04T09:09:43.511252Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Naviga- tion","venue":null,"work_id":"f57eed5a-690c-4e1f-8832-41c0fa16ce05","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:f28e64f5045f43bb4848422d46b20f2cec999b83dd466707e9c5ba737a3c5769","observation_id":"64d3b1c8-7ccc-47a6-9849-95ad8e8a46b4","resolution":{"observed_at":"2026-05-22T18:05:00.989303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal manipulation interface: In- the-wild robot teaching without in-the-wild robots","venue":null,"work_id":"e0e60fd5-6828-45c5-ab7f-90b16a77d163","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5ba046f2229a099c5ba00991e5eaea89d60f4dcd12cf89050e4113b30fd6f9b1","observation_id":"d5300036-5645-4478-ae0d-b91b5a3f4a5d","resolution":{"observed_at":"2026-05-22T18:05:01.448514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Racer: Rich language-guided failure recovery policies for imitation learning","venue":null,"work_id":"8ce7522b-1e7d-481a-82ed-1b02b5722546","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:8413e1e42c48d8fb4095016e3f4598adbdf77b9f0a8514fb39a83f32cb3a1330","observation_id":"d24f5f49-717c-4aa9-8545-1695fc521456","resolution":{"observed_at":"2026-05-22T18:05:01.457516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robonet: Large-scale multi-robot learning","venue":null,"work_id":"e15b70a8-253b-4a12-986d-2412267fa84e","year":2019},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e34e14f629f394512b865c6915cb652cc2089864994d9ca74a03e7f9d67668bd","observation_id":"c6b63635-db63-4cd0-9250-900f99b42ee8","resolution":{"observed_at":"2026-05-22T18:05:01.462891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An unbiased look at datasets for visuo- motor pre-training","venue":null,"work_id":"0087ecbf-7904-4501-b9a6-baed0a3ae57f","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:a73b75df9d3ffef4781a0752c6e9c61a3126d20c2245291af5303748db3989b2","observation_id":"018921d4-d02f-441f-862b-aefff6bb0a18","resolution":{"observed_at":"2026-05-22T18:05:01.464682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:abf20f990bad62f0ceb51e543831f5e6bcad91df1e2c0daae054f930d9266e0b","observation_id":"4903c79d-2e7a-4715-ba10-a683ddc771bf","resolution":{"observed_at":"2026-05-22T18:05:00.971979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reviews-consumer technology","venue":null,"work_id":"0d808e4f-614d-44c9-84e6-e623ddfb9c44","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9e500a7eecc01fb4b1ff87cd4eb2b1e2beb5042f91fd65b4b97d48578cd02f2f","observation_id":"d2b55c9e-f7d7-4036-804b-37bbcbe7668e","resolution":{"observed_at":"2026-05-22T18:05:01.450122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":"d0638d31-4c32-43cb-b3c2-03a396e82c9c","year":2019},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e683527fb7838608f2618dcc7cf6d274309108d0738b81a0a66fa6b36f87a9ea","observation_id":"fe721ed6-4894-4136-b725-f82d08392f76","resolution":{"observed_at":"2026-05-22T18:05:01.455658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling cross-embodied learning: One policy for manipulation, navigation, locomotion and aviation","venue":null,"work_id":"b6b57143-7e2d-4b8e-97ee-fbc1ac7702e3","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:b1eb32955a788431100be75cbe2cd74e31784c5ef6cc13d3f38edbc4b50ca358","observation_id":"5bdf743e-2472-4524-8b28-1ed0ca327ba8","resolution":{"observed_at":"2026-05-22T18:05:01.453766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:7ca6326196b6fd9cb2a9872ba7d46ffe95755780daa48281841b80b141cc9698","observation_id":"fc9d53e5-909f-454f-8b1a-a95d15c0e966","resolution":{"observed_at":"2026-05-22T18:05:00.999789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18915","last_updated":"2024-08-29T16:07:30Z","snapshot_observed_at":"2026-07-06T18:37:43.309281Z","submitted_at":"2024-06-27T06:12:01Z","title":"Manipulate-Anything: Automating Real-World Robots using Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2406.18915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18915","snapshot_observed_at":"2026-07-04T16:49:58.284739Z","title":"Manipulate-anything: Automating real-world robots using vision-language models","venue":null,"work_id":"22dc0509-ebc5-4557-aaa4-338f0096ab4b","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.18915","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:2f0dfa9eca11435fdd2b123d79bdb889dc7b7f3a19f2022af1e722e756bb2509","observation_id":"cb2b7158-1d5a-45ee-b1c1-b61fcee8e625","resolution":{"observed_at":"2026-05-22T18:05:00.865624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":"2109.13396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-04T08:49:42.858933Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","venue":"cs.RO","work_id":"59e728c0-b6ca-4759-a8f4-02b981f2220f","year":2021},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:c924fb902d066e3dd5f3c37b7481f050259f2168264cf3dd2b571ea1c20957e8","observation_id":"50ce92dc-96f8-4969-851c-c9724a6bcf1b","resolution":{"observed_at":"2026-05-22T18:05:00.966765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02976","last_updated":"2024-08-07T18:11:51Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T18:59:45Z","title":"SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World","version":2},"cited_work":{"arxiv_id":"2312.02976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoc: Imitating shortest paths in simulation enables effective navigation and manipulation in the real world","venue":null,"work_id":"34709187-6f09-45cf-be99-3ac5e764151c","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2312.02976","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:b143f2eea6c55a1df980aa9106aa2376819110e65562e6da0d251550d62de73c","observation_id":"a416a26a-ea1d-41c0-a3d2-31ec3d1d38ab","resolution":{"observed_at":"2026-05-22T18:05:00.923439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"b7d88996-7282-4d4b-af2e-09557ece9b75","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:f34a193251a2c8260876308dd3bfcf48e30f977a1c2de9384b9b26720dde2136","observation_id":"caba3e9e-ae05-49b6-9d2f-545baa5da75c","resolution":{"observed_at":"2026-05-22T18:05:01.399541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05865","last_updated":"2024-09-09T17:59:50Z","snapshot_observed_at":"2026-08-02T18:32:11.602139Z","submitted_at":"2024-09-09T17:59:50Z","title":"Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments","version":1},"cited_work":{"arxiv_id":"2409.05865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05865","snapshot_observed_at":"2026-07-10T23:07:47.730125Z","title":"Robot utility models: General policies for zero-shot deployment in new environments","venue":"cs.RO","work_id":"f9ed1317-fff5-4b13-a34c-929bdd56371d","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2409.05865","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:68f302febe8a9db3666433f36449634ca1256cf842f0e092ddd4fee90fdfc5cc","observation_id":"60b016cb-36e7-43bc-b150-aef360bd979a","resolution":{"observed_at":"2026-05-22T18:05:00.920809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anygrasp: Robust and efficient grasp perception in spatial and temporal domains","venue":null,"work_id":"8196719e-1be1-417d-bbd1-939c6d95123b","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:dd40bd3e136fe990d34ec6a7d0132904b1e53fc41c30282421c09e0d0bb02427","observation_id":"7c5746f0-1f9f-4cd6-b3f6-99c53ab6217c","resolution":{"observed_at":"2026-05-22T18:05:01.397823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rh20t: A comprehensive robotic dataset for learning diverse skills in one-shot","venue":null,"work_id":"77e8397b-0a71-483a-a642-52ff15ba79a8","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:65494bcd5c81558e7e6785399fe2218e753cda084afcfbe167744eea53a588ba","observation_id":"41def0df-85e7-496b-bdca-b1d8718a43fe","resolution":{"observed_at":"2026-05-22T18:05:01.428251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Navigating to objects in the real world","venue":null,"work_id":"d8981fb3-f6da-4fb3-bfad-e908979f90e0","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:7fc725575833c747ccf11c77f08b36d592947446deb205b0615ef0d26b5b4784","observation_id":"679b4fb0-974f-476b-ae0c-70c04fc373c0","resolution":{"observed_at":"2026-05-22T18:05:01.442969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"bd0f6f08-3e6c-4562-ba77-cada5dcd0993","year":2017},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:03d9c75703e80655631c371b59fb9abbc859cf210b76aeade1b925c7dd32c487","observation_id":"e9b44355-9293-4a62-a9a3-8778dca84f67","resolution":{"observed_at":"2026-05-22T18:05:01.446733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot learning in homes: Improving generalization and reducing dataset bias","venue":null,"work_id":"5ccf5f01-74e9-4c40-954b-f36c14d00e2c","year":2018},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9fcadcbc2c98bfd2a1c47316b8aa86a946d5bd44a8a5a387dc42ed9081d2ac23","observation_id":"0fb3d65f-0631-40bd-ba3a-172e9030b655","resolution":{"observed_at":"2026-05-22T18:05:01.413044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"93a6af72-e4d3-4cb7-b509-0bafdf18e1fa","year":2016},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:d6e2c7cae6b6d8e86e594394c008c0c74f2c0953c0daa07eda57a3466c9b6efb","observation_id":"8db603b6-6d48-443b-818d-bdbbf9c95b76","resolution":{"observed_at":"2026-05-22T18:05:01.405706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"ab27185c-855f-43b2-b39c-1d43460d717e","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:3a0d0e7af7b94489a419496009b130e490ab7bbde27a992bd36087e31fc862b7","observation_id":"ac1b73af-7c00-4fa6-9631-9c4996e1c3eb","resolution":{"observed_at":"2026-05-22T18:05:01.395964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17842","last_updated":"2023-12-24T03:48:40Z","snapshot_observed_at":"2026-08-04T14:38:08.722883Z","submitted_at":"2023-11-29T17:46:25Z","title":"Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning","version":2},"cited_work":{"arxiv_id":"2311.17842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17842","snapshot_observed_at":"2026-07-10T23:07:47.839412Z","title":"Look before you leap: Unveiling the power of gpt-4v in robotic vision- language planning","venue":"cs.RO","work_id":"3a36cb18-2858-403a-b51b-66e98d943052","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2311.17842","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:eb42b670c77a935e75769d22a4cc3ee7156a42b7b09a64c86af4fee4f5f3521e","observation_id":"2f1cd2c7-f65e-4034-bc60-c64512065632","resolution":{"observed_at":"2026-05-22T18:05:00.897341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.03734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:47:02.918794Z","title":"Otter: A vision-language-action model with text-aware visual feature extraction","venue":null,"work_id":"56cfc800-67ce-4e4b-b7db-edd998c8c4c0","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:64449bd750640ec0b1b93667f964943a9aaee86a14215f7dbba82ee458dd8282","observation_id":"8c61f841-1fe9-4e09-b874-027d4d476f79","resolution":{"observed_at":"2026-05-22T18:05:00.958640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"ac6efd73-bbc6-45e9-a0f5-3de8b09e974a","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:b68ffd51cfe7e093fdbf271bcce97f1ff35180dd0e9d97f89108850f6c29b73b","observation_id":"6a2ccd2c-0e9d-4f83-9356-a237e9600aeb","resolution":{"observed_at":"2026-05-22T18:05:01.444807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:a80ecd6ac45fd6134c3bf4f0ea38904ec0ed6884f81d7881727ccd03aac1836f","observation_id":"03668529-d3c6-4f04-9439-a58281f01c53","resolution":{"observed_at":"2026-05-22T18:05:00.899688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robots at the tipping point: the road to irobot roomba","venue":null,"work_id":"018d6e9a-477d-42ab-a002-e7d7c5472ada","year":2006},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:4b9148acbd1740ce8dcf80f6531388afa2cd0b26ff52fd363f6eba59ee71bd02","observation_id":"2913e9ca-7bf9-4806-ba41-f2caa95b040e","resolution":{"observed_at":"2026-05-22T18:05:01.424437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e44129bd-c4be-48e1-b1af-13c1225dc065","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0ec0bda7c056b15d774137ea6dd089c5b393f044bc5c77727349e479970654c7","observation_id":"45fad8e0-6958-4439-ad36-0978a75fc72b","resolution":{"observed_at":"2026-05-22T18:05:01.416672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5956ed277faca7366847eae98498f9f136deb31c4accf826f7822233a8486829","observation_id":"24e088ea-b9ca-4b63-bfa1-28a8ce078cbd","resolution":{"observed_at":"2026-05-22T18:05:00.928639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e93ebf05fd33f99803913366724ce9101b484050a7baa0badfb0050d6cd98959","observation_id":"abe1abcd-4e08-4c5e-97c1-6b415b892c55","resolution":{"observed_at":"2026-05-22T18:05:00.902550Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive task planning with language models","venue":null,"work_id":"08d429d1-355e-4d3e-9b16-a54791536c07","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9a69862d5a3eaa6309ce45c3d7a336af9aa80e82fdd0a42ecaaad39e6015ea34","observation_id":"2c2695fc-1af4-4a13-9d6d-61c7a2daf9ec","resolution":{"observed_at":"2026-05-22T18:05:01.390008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:8ca02ce2528289b2a2e4199e1eebc5980eed03725f511769fc21b8b8bda42f30","observation_id":"9dfaf2b2-2e11-45fb-91d2-6a8693942608","resolution":{"observed_at":"2026-05-22T18:05:00.957536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20095","last_updated":"2025-01-30T17:34:37Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-28T17:59:12Z","title":"LLaRA: Supercharging Robot Learning Data for Vision-Language Policy","version":3},"cited_work":{"arxiv_id":"2406.20095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.20095","snapshot_observed_at":"2026-07-01T08:55:35.848576Z","title":"Llara: Supercharging robot learning data for vision- language policy","venue":null,"work_id":"43cfbab9-c300-4c4b-b779-5d9fe11bca1a","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.20095","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:1e3216e21a0ca6f2d1dfa9ea33c7744d3ade5f3ac50bd7401062d4e52209b5ab","observation_id":"729510c9-4d9a-4b2f-adcf-1e77007432be","resolution":{"observed_at":"2026-05-22T18:05:00.942249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05485","last_updated":"2025-05-10T18:11:38Z","snapshot_observed_at":"2026-07-06T20:33:15.472157Z","submitted_at":"2025-02-08T07:50:22Z","title":"HAMSTER: Hierarchical Action Models For Open-World Robot Manipulation","version":4},"cited_work":{"arxiv_id":"2502.05485","doi":"10.48550/arxiv.2502.05485","metadata_source":"pith","pith_arxiv_id":"2502.05485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hamster: Hierarchical action models for open-world robot manipulation","venue":"cs.RO","work_id":"f39a927c-66ea-4ef7-9099-acdb4855f6fa","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2502.05485","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e9585842010d4cc94a65b966d76932b136f40a25ec24a56b7748a48d8301bfe4","observation_id":"01f4aa74-3f39-4664-973e-0c22a3171904","resolution":{"observed_at":"2026-05-22T18:05:00.950134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code as policies: Language model programs for em- bodied control","venue":null,"work_id":"85d27d2f-5b05-4bf8-bb43-18520cb5be16","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:c04d23bb4b4d71083ea6013a00e782631d3522b717ea79c57ec0e8d32e73eea7","observation_id":"a4cf5d20-fc53-4f46-9d29-77fbbc64c6c6","resolution":{"observed_at":"2026-05-22T18:05:01.385804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-07-06T19:39:01.657517Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":"2410.18647","doi":"10.48550/arxiv.2410.18647","metadata_source":"pith","pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Data scaling laws in im- itation learning for robotic manipulation","venue":"cs.RO","work_id":"7f726c47-5435-4bf1-82c7-d27a6dd714ea","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0fcc7157f92744ba8a697c5e5aedb77cd2b01d69072d8a845b76e84575045f0d","observation_id":"c659049c-3b15-4da0-a082-7049d7d19bb9","resolution":{"observed_at":"2026-06-29T02:14:00.368555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:2e2c988d08aeb1d594b78f7fa2a4115dfe332cf6aafdb59a3ad00284d45142f3","observation_id":"70863e49-e320-4d4f-b285-dba65fec6b93","resolution":{"observed_at":"2026-05-22T18:05:00.929170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moka: Open-vocabulary robotic manipulation through mark-based visual prompting","venue":null,"work_id":"d078ba76-add9-4e92-8552-be5106595cae","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0a8617432beda2c8d865b0347af9d615753ce0bbe8cad6ad6ec0297d6d50332f","observation_id":"857188e5-2369-4e7e-90b5-0be4799080f7","resolution":{"observed_at":"2026-05-22T18:05:01.409419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2503.10631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-07-10T23:07:48.060771Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","venue":"cs.CV","work_id":"ecac5f06-a68f-4fff-a89a-a89358afb649","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:88eb13d6d46828619dfed1aee6acfcb61983505e50cdaeafa40dd96939ff2e3c","observation_id":"f0ad5648-5195-416f-a61c-ac5f80899851","resolution":{"observed_at":"2026-05-22T18:05:00.944757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-04T04:35:05.950904Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":"2401.12202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-07-04T17:09:59.559023Z","title":"OK-Robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":"0ed6249b-7e12-4a76-b290-b7493420d577","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:8649529829c05ee34f0d48536828afdbf816c4b910f9e7e69caac66f15c51249","observation_id":"10654187-49b0-4ca9-87d4-c064cd22d9e1","resolution":{"observed_at":"2026-05-22T18:05:00.890907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-02T10:38:01.750409Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":"2209.14577","doi":"10.48550/arxiv.2209.14577","metadata_source":"pith","pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","venue":"stat.ML","work_id":"10529e85-31c7-446e-9dca-712d082a2bea","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:cd0fa964a5b9d03c4be17109c365288eae40e0d41d6f13eca0a1e624b1155a70","observation_id":"bb45dc09-c860-4ab2-80b8-b86a53be9b6e","resolution":{"observed_at":"2026-05-22T18:05:00.931642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":"2410.07864","doi":"10.48550/arxiv.2410.07864","metadata_source":"pith","pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","venue":"cs.RO","work_id":"12319725-bc7d-4c32-a229-ad270a7460bc","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0aca03c95bb16119ac467745df977f64f8f3148b74c1872adde3eb23f348c966","observation_id":"4fffcbe7-bf8f-45d5-b2a9-eaf52fde9fa1","resolution":{"observed_at":"2026-05-22T18:05:00.961170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09312","last_updated":"2017-08-08T21:46:24Z","snapshot_observed_at":"2026-07-06T05:35:24.598806Z","submitted_at":"2017-03-27T21:16:30Z","title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics","version":3},"cited_work":{"arxiv_id":"1703.09312","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.09312","snapshot_observed_at":"2026-07-09T08:56:06.352798Z","title":"Dex-Net 2.0: Deep Learning to Plan Robust Grasps with Synthetic Point Clouds and Analytic Grasp Metrics","venue":"cs.RO","work_id":"1adace8d-6bd2-4ecc-9769-afcd232a02dc","year":2017},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/1703.09312","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:3c18b440242afe42349f4d0c7cd8f0a2b5278d238b111b3b9280f18f1003383f","observation_id":"33ff78da-1e73-4c88-9a77-25401e3fa3ad","resolution":{"observed_at":"2026-05-22T18:05:00.944447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence? Advances in Neural Information Processing Systems, 36:655–677","venue":null,"work_id":"699236de-6f56-454a-9c45-8c72f9d3a652","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:87df491a67a9d44ea380b5ed455c5d6e6848ebd385d7e34175945ddef87cdfbc","observation_id":"d44ca5df-f078-4a0c-996e-dff2de4529d1","resolution":{"observed_at":"2026-05-22T18:05:01.422557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R3m: A universal visual representation for robot manipulation","venue":null,"work_id":"af03d581-b2f5-4dfd-b5ce-a241642b4def","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:d71cb2466c0e5b787c1b0f8f6ce390159c3a8408aaf383a2acd016215384c185","observation_id":"91f068c7-a5ce-4092-832a-9a0b0e443802","resolution":{"observed_at":"2026-05-22T18:05:01.418980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":"2402.07872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-07-04T20:00:08.793749Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms","venue":null,"work_id":"9bdbd928-061c-41e7-86fb-f0f2df7fd286","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:15361e927dcd8567439743578772fd029fe3f7720e111d7260f152106f562f91","observation_id":"753df86c-10a5-4030-87b2-d0e9b3d2b2d4","resolution":{"observed_at":"2026-05-22T18:05:00.962878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autonomously learn- ing to visually detect where manipulation will succeed","venue":null,"work_id":"dbd73f87-248c-4462-bcea-3b1162eb2391","year":2014},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:601e382b6db21ae34f7aa3ff54ff99d53f6b559bb516ddb33e2ef708d093ef0a","observation_id":"ef0e990f-e717-404d-9658-4cb6820b5e1a","resolution":{"observed_at":"2026-05-22T18:05:01.414846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11815","last_updated":"2024-06-17T17:55:29Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:55:29Z","title":"LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning","version":1},"cited_work":{"arxiv_id":"2406.11815","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11815","snapshot_observed_at":"2026-07-03T15:18:33.791076Z","title":"Llarva: Vision-action instruction tuning en- hances robot learning","venue":null,"work_id":"257036fd-800f-414b-98ff-1b1f7d7f39fb","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.11815","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0846e9c48db08ed2b2146e3cf31c16137edec8b6357efb6df2989a11435d6dd4","observation_id":"c6264bba-281b-41fd-b8b8-bb7f49518a39","resolution":{"observed_at":"2026-05-22T18:05:00.919649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":"a1c88e01-3793-4804-9d88-37ef09f87388","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:ea39f4720cf5c1ac1eebdc794a86217d33b0f9fd98c2678745643ba49df6d6e8","observation_id":"0e527388-67c9-4bff-ac4b-1bcc16ebcf55","resolution":{"observed_at":"2026-05-22T18:05:01.423304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:028837a4f40f4d49f39427f883c85c11286e14e2824e3d93d0d74e36f5762442","observation_id":"2ecd5116-f2e7-4cb9-afdb-72ec8e93560a","resolution":{"observed_at":"2026-05-22T18:05:00.933566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FAST: Efficient action tok- enization for vision-language-action models","venue":null,"work_id":"5464a1cc-6fab-4a19-8969-bc5496510859","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5b5357714ffd864f7c5f7a129d060e0fdfadbb6762bd4a2429a5258a07ceecf6","observation_id":"b4860028-eeea-43b3-b91e-49406634ace1","resolution":{"observed_at":"2026-05-22T18:05:01.419343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18115","last_updated":"2024-06-26T07:06:42Z","snapshot_observed_at":"2026-08-03T22:24:48.402918Z","submitted_at":"2024-06-26T07:06:42Z","title":"Open-vocabulary Mobile Manipulation in Unseen Dynamic Environments with 3D Semantic Maps","version":1},"cited_work":{"arxiv_id":"2406.18115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18115","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-vocabulary mobile manipulation in unseen dynamic environments with 3d semantic maps","venue":null,"work_id":"bd342540-73c1-466e-96e9-4e02f7dc67f4","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2406.18115","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:21b58d1691d848593732e4b2391362644165e8d98e2dfd62e419763ccdfadbef","observation_id":"7c1f1b22-cc76-4d44-ac4e-35010933035c","resolution":{"observed_at":"2026-05-22T18:05:00.952247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"85c2b680-5758-496a-84b0-4fcb8b85aeb6","year":2021},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:d5e47b3473e4bbfefedb01bdf16be0ac9471776113f18a2094b3e878772571e0","observation_id":"41548a38-1c30-4e65-a077-217fd00ee66e","resolution":{"observed_at":"2026-05-22T18:05:01.437420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-07-30T21:15:46.584759Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":"2311.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-07-02T13:46:59.337867Z","title":"On bringing robots home","venue":null,"work_id":"6e3fdf89-a927-4640-9775-66c9b9d3a55b","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:fd46cfb78bbe409a16ad859226252b39411991bfa9ba449eb9f7202023e14a34","observation_id":"3a83061e-6c76-489f-8989-d1d738bef472","resolution":{"observed_at":"2026-05-22T18:05:00.969501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":"e6f05a39-6f69-4f15-b706-a041c43239b8","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:1dc3c1ec97ec123d30f845fe4649d649f9cf6949a9b7f70e9cb9e0399a2588a3","observation_id":"3d6d025c-d723-4c03-ac61-baa72c34fb15","resolution":{"observed_at":"2026-05-22T18:05:01.430035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-07-06T15:46:51.353113Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":"2306.14846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-07-04T21:10:08.552638Z","title":"ViNT: A foundation model for visual navigation","venue":null,"work_id":"41c011a1-665d-4cf7-a0d9-59604241df87","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:db55104a1fb6babd47bf2af136127065f729c2fb49eefecca0a16358bb9783b4","observation_id":"e8dedf86-1f6a-465f-977c-2584ea469877","resolution":{"observed_at":"2026-05-22T18:05:00.947021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06237","last_updated":"2024-10-08T17:52:29Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:52:29Z","title":"BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.06237","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bumble: Unifying reasoning and acting with vision-language models for building-wide mobile manipulation","venue":null,"work_id":"2f463d16-11f9-4b5f-9cbe-a563d02b11db","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2410.06237","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:b6803a0879ee2373ea1a63f42221c32401733bd7f7dd091dde6cb527ce6803b0","observation_id":"f97ab4cc-78e7-4a97-a4b3-034f09c98d90","resolution":{"observed_at":"2026-05-22T18:05:00.963893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12910","last_updated":"2024-03-19T17:08:24Z","snapshot_observed_at":"2026-08-04T09:24:08.528569Z","submitted_at":"2024-03-19T17:08:24Z","title":"Yell At Your Robot: Improving On-the-Fly from Language Corrections","version":1},"cited_work":{"arxiv_id":"2403.12910","doi":"10.48550/arxiv.2403.12910","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12910","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yell at your robot: Improving on-the-fly from language corrections","venue":"arXiv (Cornell University)","work_id":"efeb3fdb-ee67-40c2-9c43-c2b12b925654","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2403.12910","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e155c310c66cd91e5f28c17aa80f43adafa7269b6b6431179845f97eb13ec576","observation_id":"4b94d6f4-8050-42ca-a421-12760bde3724","resolution":{"observed_at":"2026-05-22T18:05:00.887959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2502.19417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.19417","snapshot_observed_at":"2026-07-10T04:16:48.655148Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","venue":"cs.RO","work_id":"5fa4c212-9ac8-4c92-95ee-879621fbcb2e","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2502.19417","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:5d408c8f209c2acf2a2bf91a6e35e616c54904a649a6530c268dfcd4b19aa88e","observation_id":"4ca952a4-2f8c-4c18-bd64-911acd1d9eb5","resolution":{"observed_at":"2026-05-22T18:05:00.968391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"70851cea-b563-4947-a6c1-7b34c6b31297","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:83c182df82daa2b67bc7a2c6e3f849374722dbbcf15852b50c552b29fdbe8162","observation_id":"1705a5b8-196e-46ab-a1ed-5d3bc823352c","resolution":{"observed_at":"2026-05-22T18:05:01.413431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00905","last_updated":"2023-10-25T21:45:24Z","snapshot_observed_at":"2026-07-06T14:57:35.878347Z","submitted_at":"2023-03-02T01:55:10Z","title":"Open-World Object Manipulation using Pre-trained Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2303.00905","doi":"10.48550/arxiv.2303.00905","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open- world object manipulation using pre-trained vision-language models","venue":"arXiv (Cornell University)","work_id":"660bb696-9c99-4e73-b2f3-0e961a026607","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2303.00905","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0060817d01e7686a7073744d7abaf9d7ca4240b7f47bf421d41fcee5ba16f3b9","observation_id":"8a97b39f-b308-47ce-a50e-cf8997c5a9b2","resolution":{"observed_at":"2026-05-22T18:05:00.899383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08442","last_updated":"2024-12-11T15:06:25Z","snapshot_observed_at":"2026-07-06T20:05:18.939982Z","submitted_at":"2024-12-11T15:06:25Z","title":"From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons","version":1},"cited_work":{"arxiv_id":"2412.08442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08442","snapshot_observed_at":"2026-07-04T04:39:33.914861Z","title":"From multimodal llms to generalist embodied agents: Methods and lessons","venue":null,"work_id":"3734e67c-28ff-407a-a15b-741504941b0c","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2412.08442","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:f54c3ce52bb85278ec64c33a1ae6ddfe77624086eee4bd59380f01fc9adbb90a","observation_id":"a427c21b-8a0f-4bcb-9ca1-c34cf5463855","resolution":{"observed_at":"2026-05-22T18:05:00.858804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:f27c016cddaeb0a10f56a3c00c23a6a775bb0f029f21760724b8db2e7e3ebefb","observation_id":"ec8058ee-b505-4fbc-aa4c-de5c78b0bc54","resolution":{"observed_at":"2026-05-22T18:05:00.933864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"11283ad3-2d27-4321-a8cb-07aee4723288","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:17f43f9a37061be994f32eba5a60a415fbd605cd897fff8b175998cc726d3a14","observation_id":"4690b45b-0cdf-4d00-b5c2-84c85f709926","resolution":{"observed_at":"2026-05-22T18:05:01.441215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:490b978404ea37d640b8ecce56c08c2491aaf4bcfa7c3846dadca9be8b8551e3","observation_id":"f1fb22f4-1a26-4e4b-a80d-ab3f1c1ff213","resolution":{"observed_at":"2026-05-22T18:05:00.952613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"93439aae-912b-48a3-9b9b-3e30df26fa62","year":2017},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:e9e8cb81e2796c88cde06e4f845a800b752e92e5a4782d07b4532c802dc7e005","observation_id":"052b0a18-4771-4866-b28b-8f3c723cceca","resolution":{"observed_at":"2026-05-22T18:05:01.387772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BridgeData v2: A dataset for robot learning at scale","venue":null,"work_id":"42b1f8e5-0fff-425a-b18d-8f9949c3979f","year":null},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:412db8fa23aeec8f2fbc4c62320c896468a8b240742ea2097fa8b2521878373d","observation_id":"e12937bf-8415-49a7-bbc9-cb24d6cb5fea","resolution":{"observed_at":"2026-05-22T18:05:01.409843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmˆ 3: Large language model-based task and motion planning with motion failure reasoning","venue":null,"work_id":"873a0768-308f-427a-a71e-9ce1471f9afd","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:17dd883772c1cb4498adbbbac3749ca8ab31335502c55341156059486211887f","observation_id":"f85ce96f-b335-442a-85ab-1699d27a5493","resolution":{"observed_at":"2026-05-22T18:05:01.407943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:81ffa8882e86e98bfa959dd0fe100e06b12594b11f53934b16e42ca7965d1e28","observation_id":"a670d574-06e4-49f3-8ad0-99e646053eec","resolution":{"observed_at":"2026-05-22T18:05:01.406145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":"2409.12514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-07-04T04:29:35.761670Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"20b3dc32-113f-4f7b-8826-52a8d03fd6b3","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9e3e514a41044775c2c50a61dab3a132e3f8f62289c3a6d8629a5002a61947f5","observation_id":"c710c50e-2bcc-4709-b055-dcdbd03afaef","resolution":{"observed_at":"2026-05-22T18:05:00.955724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":"2502.05855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-07-10T04:16:48.719609Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","venue":"cs.RO","work_id":"3564a757-5726-4b2a-a28e-114a4a467dfb","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:892666b6de19dfaf56dcf06f832ea16dcd2e9a6969f62218d0558c4fa2d1387d","observation_id":"18f4c3ef-2dc0-42c0-afa1-29edfaefb4a4","resolution":{"observed_at":"2026-05-22T18:05:00.976688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-05T09:35:54.057917Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":"2203.06173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-07-08T01:44:26.089441Z","title":"Masked visual pre-training for motor control","venue":"cs.CV","work_id":"87cf1bc9-a17c-4f06-8a24-80a4a1051a0b","year":2022},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:2e374c93fc5e8c61b1f48dc2bb2916886713030edf8e090dd8ae49dd394ff922","observation_id":"cf3f0499-aec2-4f22-bca2-0f57d8c90e19","resolution":{"observed_at":"2026-05-22T18:05:00.939533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13130","last_updated":"2025-02-18T18:55:21Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T18:55:21Z","title":"Magma: A Foundation Model for Multimodal AI Agents","version":1},"cited_work":{"arxiv_id":"2502.13130","doi":"10.48550/arxiv.2502.13130","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13130","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magma: A founda- tion model for multimodal ai agents","venue":"ArXiv.org","work_id":"f6cbf5e3-ffcc-4d64-b575-714feb387ddb","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2502.13130","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:c7b9f9104690594aecff1a003299cd5576ddcfddbcb4385a68067fbb33f2cf10","observation_id":"cc67c135-cb35-427a-b9e7-6bacdcf30490","resolution":{"observed_at":"2026-05-22T18:05:00.973902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"d9f93e31-2a33-4a7a-97da-c1c23526525f","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:9d41f209b48de95ca89bbf7735fdd983cbb0cf012e9b88fdc75e5f9d4c6fb060","observation_id":"72890800-e9f2-4b87-9548-89018afbe567","resolution":{"observed_at":"2026-05-22T18:05:01.439260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotic control via embodied chain-of-thought reasoning","venue":null,"work_id":"5bd93071-4a22-477a-9296-4a6d6773c68c","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:4bac5842936299bd76fa832e3e9b447890a4149cd971273c919f2432a045632b","observation_id":"828e06b8-607d-44b8-aecb-d3192bd68c6c","resolution":{"observed_at":"2026-05-22T18:05:01.431798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cot-vla: Visual chain- of-thought reasoning for vision-language-action models","venue":null,"work_id":"e88ecd5d-bf42-4aa9-9d1c-25b504890004","year":2025},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:610640942f6c62a740be9e43a530260dbeb0189e64216a50a4dcd5f25248a3bb","observation_id":"59a2ec82-c40d-4496-b57e-16411d91d8e9","resolution":{"observed_at":"2026-05-22T18:05:01.435528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:fd22c1f3f73fed31e65a9b2bdd3bf8c05081e5d3a407ec526f44ffe935c7709f","observation_id":"2dba29be-db06-4c0a-8c69-5dff826f3490","resolution":{"observed_at":"2026-05-22T18:05:00.949393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10220","last_updated":"2025-03-07T05:09:28Z","snapshot_observed_at":"2026-07-06T18:00:44.208590Z","submitted_at":"2024-04-16T02:01:56Z","title":"Closed-Loop Open-Vocabulary Mobile Manipulation with GPT-4V","version":2},"cited_work":{"arxiv_id":"2404.10220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closed-loop open-vocabulary mobile manipulation with GPT-4V","venue":null,"work_id":"9f20a2bc-3a17-422e-8937-8fc645deca60","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2404.10220","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:92dca2b1a17a51af3eb604e5d24ccf5da70eb92c3f29f9853172fb38d1894c8e","observation_id":"c380f0ec-d388-4497-84a5-7521cbedfed3","resolution":{"observed_at":"2026-05-22T18:05:00.884980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"put the scissors in the drawer","venue":null,"work_id":"da208c9e-aa1c-4775-870e-1b6d7fcad018","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:078a2718b8db9dc8899069456e459eef7af46b774cdbefad67749211ff3456b9","observation_id":"4361a7fb-9b7d-44a6-b812-36d8e3f10e43","resolution":{"observed_at":"2026-05-22T18:05:01.433563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34b1d4ee-124a-44da-ad23-75bbe4912ea7","year":null},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:d66c9c9341589133093234a3f97729a5e514563641d9e2a8c73504b646aced4f","observation_id":"4cb6fad6-37d1-4747-a575-fcdc96a4e21a","resolution":{"observed_at":"2026-05-22T18:05:01.426401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"action expert","venue":null,"work_id":"8f644872-d521-4989-ae84-461e708a54c5","year":2048},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:0ca95311ec7a8b2bb7abc3dad6eac0a9886851fa8d2292189fbd0d0cb199d38e","observation_id":"d4b8922d-a915-44b9-8e76-20c26a58ab8a","resolution":{"observed_at":"2026-05-22T18:05:01.420650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":49,"verified_fuzzy":40},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 100 inbound Pith citation observations for arXiv:2504.16054."}