{"as_of":"2026-08-06T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e03bf27e2f45b0afca2c057ca79b144e96e688c2a30c41a165c2116b0a74d64","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T12:38:24.425784Z","state":"measured"},{"denominator":160,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":160,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1093,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:44:38.169220Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:afa8e76268dfbfb3712df6cd14de8e059830a679336adf0ed0294af3ae1cfe31","observation_id":"a0ea6fd0-44c2-40d9-9cd8-0ada0f20440c","resolution":{"observed_at":"2026-05-24T01:25:54.432542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-05T18:48:10.679925Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:c1b78f158647bd8e2c240ad12a61a92cd45bb788369a6ebbf1b873e1a0fb97d1","observation_id":"bcb6b6ea-2692-4ab3-9e0e-7092a78ef483","resolution":{"observed_at":"2026-05-17T21:37:50.683754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:2fb13f34a3c41c25d23d424b3e3cf3462ca55059364dc73642bc91dbd430eebb","observation_id":"0600c0bc-a69d-4080-8a38-1d103ef5b0e3","resolution":{"observed_at":"2026-05-11T08:52:31.885570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:41e161cc80089c841f1a02ee1843911c1b6af504e506589bc94d1c0833f53c82","observation_id":"2002e7c8-88ac-4260-b5bb-8c299c943d58","resolution":{"observed_at":"2026-05-12T06:12:19.743290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:ad6e2283f8d8b46ab22f98c1649f8ae59a66a6163733322dcf8277c1be10bcd4","observation_id":"ec0dfc2a-d280-4e28-8223-2ac7edb35059","resolution":{"observed_at":"2026-05-14T19:48:48.938637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:2e4601022b87ff572044c810c5e15a44f2b7886e92126d1c58f60d67abb34f5f","observation_id":"2d4f3a82-d24f-407b-9751-e0f38e9fdf9e","resolution":{"observed_at":"2026-05-15T22:53:37.185946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T04:35:31.914360Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2502.19645"},"observation_digest":"sha256:9c40026a294e20a1a05d7e6a8acda3e489f90d47db1b04fb6b71c6074609b5c4","observation_id":"22368c17-48cc-475f-b1a6-826d0c9a25f4","resolution":{"observed_at":"2026-05-11T04:35:32.232973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T17:50:29.675358Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.00200"},"observation_digest":"sha256:45349adb330f8560a06044a87085ccdcdf13c3cb2fda6f8155e842a55d170d8e","observation_id":"70a418a6-8288-4c5d-b055-d352eaaba0bd","resolution":{"observed_at":"2026-05-13T17:50:29.708086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:4f4de5ee099175450753d6d4bfd6138618800295f66e2eef44116fa4a4dcc12c","observation_id":"1bb1c304-9840-48dd-9b50-7271ac95850a","resolution":{"observed_at":"2026-05-23T01:32:22.624008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T15:09:24.367362Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.06669"},"observation_digest":"sha256:34fea0e15555461142955d264aeafbe6104f0c5e2f09ca752279cc7340def011","observation_id":"5aecb05a-2703-465b-8d19-b1d7e4e16bea","resolution":{"observed_at":"2026-05-11T15:09:24.576942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.10070","last_updated":"2026-05-05T11:02:02Z","snapshot_observed_at":"2026-08-02T13:36:34.279824Z","submitted_at":"2025-03-13T05:34:43Z","title":"AhaRobot: A Low-Cost Open-Source Bimanual Mobile Manipulator for Embodied AI","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T00:00:53.307042Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.10070"},"observation_digest":"sha256:354fbdfa2bfc550bca818e8c9144b59f04a5eac7680b91e9f704f8bcbbd27122","observation_id":"60c15d60-ad52-422a-86e4-8d335280e9a8","resolution":{"observed_at":"2026-05-23T00:02:17.521597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:b32603c0f133a7fecd849ac139fa9ec1c8803c67264a19042da20d2bd85d199b","observation_id":"61ae2709-9375-4bca-8b10-eb5b17f922b2","resolution":{"observed_at":"2026-05-15T22:00:48.811414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:ac8ba06164ce7542062f1ff28983ed6ce79071da11a3c05bffa3de814b1ffc14","observation_id":"b8f7d2b5-4894-4ee9-b64b-3e88dbed82b0","resolution":{"observed_at":"2026-05-10T19:09:10.181938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T16:25:00.365534Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2504.02792"},"observation_digest":"sha256:3779cff6e7d054989b5b03b27c65d0271e9a9c1e46d58b0cab188c02297b53a7","observation_id":"84d5953f-dc81-4d28-a135-e97261a8fa55","resolution":{"observed_at":"2026-05-13T16:25:00.467741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2504.13618","last_updated":"2026-04-19T20:39:33Z","snapshot_observed_at":"2026-07-06T21:11:24.852957Z","submitted_at":"2025-04-18T10:48:46Z","title":"On the Importance of Tactile Sensing for Imitation Learning: A Case Study on Robotic Match Lighting","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T19:16:17.765462Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2504.13618"},"observation_digest":"sha256:eba3400dc6e01629bb69ca85b8cb8a30f42a3913c3aa8a3ee94e97016ecddf39","observation_id":"2fccd485-6540-43ae-a635-d5c7e90a80f4","resolution":{"observed_at":"2026-05-22T19:16:58.624700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:850ae470042060fa935ea0406adef98e24681b813c9aa74c49d7e245cc17b57b","observation_id":"5e556176-8e55-4d4a-865a-26b45d0f82cf","resolution":{"observed_at":"2026-05-22T18:05:00.986329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T15:53:29.412890Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2504.19854"},"observation_digest":"sha256:1cd1946eed36f43b748539e9a60a21973f1672eabb75c103e8d3d4cbfb6e03e1","observation_id":"a73fecff-0909-4187-a945-73b7b40303be","resolution":{"observed_at":"2026-05-16T15:53:29.434032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.00306","last_updated":"2026-04-19T00:13:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-01T04:58:50Z","title":"J-PARSE: Jacobian-based Projection Algorithm for Resolving Singularities Effectively in Inverse Kinematic Control of Serial Manipulators","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T18:28:26.116236Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.00306"},"observation_digest":"sha256:27e23cc496e0788e95f7e4d252ad6cc929794668ca5de2fbbe2609c98e009160","observation_id":"5ef22e29-3bce-495a-b431-e7415c487a2c","resolution":{"observed_at":"2026-05-22T18:31:55.864774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:99de673cb6e0613a021e5a9659181de7bf9536e47266326df30d435ac5e5596f","observation_id":"c73ba013-9396-40ba-a5d1-1bc598abcf31","resolution":{"observed_at":"2026-05-17T20:55:52.171711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.03500","last_updated":"2026-05-01T03:34:16Z","snapshot_observed_at":"2026-08-02T10:57:11.334123Z","submitted_at":"2025-05-06T13:05:04Z","title":"VLAs are Confined yet Capable of Generalizing to Novel Instructions","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T16:46:05.993833Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.03500"},"observation_digest":"sha256:b8a98c3ac489a2860e812209aa1fa82bcb429a67bdf95c914c21613bdf0a9558","observation_id":"2f4d5805-aa3f-4f2f-8659-48ebc2ccb1a3","resolution":{"observed_at":"2026-05-22T16:46:47.428158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T23:50:45.332466Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.12705"},"observation_digest":"sha256:b686f9740ae688e0fe798f981c40c2980fd9b58aefc5d062a92cbfcd3d22226b","observation_id":"cc9c5646-0c0a-4933-9b77-32fe93602d9a","resolution":{"observed_at":"2026-05-15T23:50:45.394919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.13255","last_updated":"2026-04-24T03:20:34Z","snapshot_observed_at":"2026-07-06T21:26:20.811742Z","submitted_at":"2025-05-19T15:39:08Z","title":"Policy Contrastive Decoding for Robotic Foundation Models","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T14:09:48.762737Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.13255"},"observation_digest":"sha256:c44eb245a2c2c7dd8be2f0755beaabb457b58e654455244bc0fbfe351590144f","observation_id":"79f4cdd0-7913-46d1-8983-d230889baa62","resolution":{"observed_at":"2026-05-22T14:11:38.508066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T15:59:08.846629Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.15659"},"observation_digest":"sha256:5603ecb0d584fea329ac45ccd29c17258552f4a2dc6e779e6ff94d870b9210b8","observation_id":"eb9890e5-82ed-45bc-8a52-8d28c59fada0","resolution":{"observed_at":"2026-05-17T15:59:08.907271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.16278","last_updated":"2026-05-18T09:58:49Z","snapshot_observed_at":"2026-08-01T11:49:26.764186Z","submitted_at":"2025-05-22T06:23:04Z","title":"DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T14:30:47.787654Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.16278"},"observation_digest":"sha256:686883440509245fd7ba836c24752f4a91ac51887f8d9b16a589b64b81f8a492","observation_id":"9aec41ef-dc46-48f3-aae3-25b2891de423","resolution":{"observed_at":"2026-05-22T14:31:40.583412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T14:25:47.178714Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.17016"},"observation_digest":"sha256:dcc72b6e32667ca8bc164e59ef88f2ad0fa546341a4da701203bb7c5870c2628","observation_id":"58564182-be91-4a99-80f6-a761f9c71764","resolution":{"observed_at":"2026-05-21T14:25:47.265869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:5310394ed996b898ec83d51a3d234679c7dc583229ea058b85dc8bc94132139f","observation_id":"9c09501f-ec09-4c2e-98d7-99374eb8f6ef","resolution":{"observed_at":"2026-05-16T12:55:40.480291Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2505.21282","last_updated":"2026-04-19T13:43:39Z","snapshot_observed_at":"2026-08-05T20:01:00.305386Z","submitted_at":"2025-05-27T14:51:34Z","title":"EgoWalk: A Multimodal Dataset for Robot Navigation in the Wild","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T12:56:30.634284Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.21282"},"observation_digest":"sha256:a94275f9bb6e112e8bb43957f1c34ea692eefd97ad0c0bbf96cab886726f3e81","observation_id":"84b25f2e-3d98-49ea-8c63-0aafb05f01e9","resolution":{"observed_at":"2026-05-19T12:57:17.709860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:8db03dda4e1dbd59ee9eff8768124b544be606711e2cb41c3445b7aa9e7e319d","observation_id":"af0695d2-d1e2-4647-bb0e-e2c0b640429c","resolution":{"observed_at":"2026-05-11T21:22:37.167640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:18:51.613045Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.07339"},"observation_digest":"sha256:418b8090fd44ef5afb4e6718004a0af73b8ed7ede739d46610cb6a323d32561a","observation_id":"a5806d79-07bb-4406-ba1e-7a1eba7b83fe","resolution":{"observed_at":"2026-05-15T14:18:51.674437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T07:36:24.319361Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.08052"},"observation_digest":"sha256:07b5f3820e0e726ec623667eb33e1b4203002e668de78378d01678b7e9bab244","observation_id":"cdb078b9-bc45-41fe-8e7c-458892ab1bd5","resolution":{"observed_at":"2026-05-15T07:36:24.368787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.08902","last_updated":"2026-05-11T20:21:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-10T15:27:46Z","title":"Intention-Conditioned Flow Occupancy Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T10:24:52.160209Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.08902"},"observation_digest":"sha256:7755996fbfd60bdb66cd5878cdeb8bb5142fc98b53dde918af3e3b948a5d5e15","observation_id":"21c9af57-5d01-45fc-b924-7e0660213228","resolution":{"observed_at":"2026-05-19T10:27:14.531924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:61af58baae77d7ee15e2cd34948c2642ea3659a430eb8d253392c141289e921b","observation_id":"5b6f6463-1cb4-4704-8729-e5b45bc57d45","resolution":{"observed_at":"2026-05-11T00:33:50.663856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.14009","last_updated":"2026-05-15T20:28:32Z","snapshot_observed_at":"2026-08-03T04:25:49.365460Z","submitted_at":"2025-06-16T21:12:27Z","title":"GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T00:26:28.696429Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.14009"},"observation_digest":"sha256:c96bc7c9c03f2b02165516611444b24b1ba6e66625d0e5055947fdd0002cbdd7","observation_id":"34916f84-9160-4628-acb2-820dd22e26bd","resolution":{"observed_at":"2026-05-22T00:30:49.402120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:490fdf8b1774d6f0d3c2ae3628657e622c0c3e9e1d00a746a0390c8e9387f568","observation_id":"584e080f-4f28-44a4-8cd7-f5f76fa11127","resolution":{"observed_at":"2026-05-17T21:55:46.398786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.15953","last_updated":"2026-05-13T00:42:26Z","snapshot_observed_at":"2026-07-06T21:44:32.853406Z","submitted_at":"2025-06-19T01:38:13Z","title":"ViTacFormer: Learning Cross-Modal Representation for Visuo-Tactile Dexterous Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T09:46:38.742771Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.15953"},"observation_digest":"sha256:3bbb9bcd682bd795ff83bd43dc3a09a87f8a4c143a4dbcd4c15c3fd99fb932fb","observation_id":"11f12992-a548-4838-ba4a-fc3577db590c","resolution":{"observed_at":"2026-05-19T09:47:13.868635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T06:40:27.206337Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.18088"},"observation_digest":"sha256:035132470a5079d07a85ed0d5b49bc6e6ff59fae1a870619c5314ecbeac6637a","observation_id":"26903364-645d-4a93-a458-50ddb89eab29","resolution":{"observed_at":"2026-05-11T06:40:27.315717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.01925","last_updated":"2025-07-02T17:34:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:34:52Z","title":"A Survey on Vision-Language-Action Models: An Action Tokenization Perspective","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T14:08:34.893876Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.01925"},"observation_digest":"sha256:a0b2bc21bbdbf1f11e4e631d2c455bd2f628f54fd27b94dd256c7fed1c940eb5","observation_id":"f0f2b177-6e27-4a48-9d8c-8a453ccfb118","resolution":{"observed_at":"2026-05-17T14:08:35.173173Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:e6ccc92956177b960e955022700b2179f195f1f54a7ff1bf15f73e0151e47e2f","observation_id":"26e3b965-2d83-4fcf-83b9-f57dc77e32c6","resolution":{"observed_at":"2026-05-16T15:42:41.465663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:44:38.169220Z","title":"π 0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04741","last_updated":"2025-07-07T08:16:38Z","snapshot_observed_at":"2026-08-06T19:38:11.454667Z","submitted_at":"2025-07-07T08:16:38Z","title":"Vision-Language Models Can't See the Obvious","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:44:38.169220Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.04741"},"observation_digest":"sha256:2d43ce0bcb15c89eea804782f1753c06a27de5371f1a0ae8f60bc7393ed95e51","observation_id":"acaf3167-99b5-4a3c-9459-617788618ca5","resolution":{"observed_at":"2026-08-06T19:44:38.169220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:38:17.491803Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05116","last_updated":"2026-07-08T17:09:24Z","snapshot_observed_at":"2026-08-06T19:29:40.498273Z","submitted_at":"2025-07-07T15:30:55Z","title":"VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:17.491803Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05116"},"observation_digest":"sha256:f97f996991864848df8a48e643e479f5189260dd1f8f2315d55b7a83a0eae47c","observation_id":"b9298607-3ab8-4e82-b19c-77faaef27559","resolution":{"observed_at":"2026-08-06T19:38:17.491803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:35:42.756539Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05198","last_updated":"2025-07-07T16:58:17Z","snapshot_observed_at":"2026-08-06T19:27:34.617844Z","submitted_at":"2025-07-07T16:58:17Z","title":"EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:35:42.756539Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05198"},"observation_digest":"sha256:10f9491c04abf7cdfc0fab50e09a24eacb1e5da4b2aa83fa5602a56a0071e0c5","observation_id":"95afc9ed-12f0-47c2-bebf-a76652c4f769","resolution":{"observed_at":"2026-08-06T19:35:42.756539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T04:32:56.397350Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05331"},"observation_digest":"sha256:f27defca456f8be5d1200126743de4e0fcc9dd9114a8ad45c40c9286a40f7009","observation_id":"af8e91e8-8a61-4f2a-8a27-c598d6e0aa36","resolution":{"observed_at":"2026-05-25T04:32:56.680934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:27:21.775053Z","title":"π0: A vision -languageaction flow model for general robot control,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05607","last_updated":"2025-07-08T02:36:03Z","snapshot_observed_at":"2026-08-06T19:19:40.151852Z","submitted_at":"2025-07-08T02:36:03Z","title":"Structured Task Solving via Modular Embodied Intelligence: A Case Study on Rubik's Cube","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:27:21.775053Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05607"},"observation_digest":"sha256:103e1d0008782d120eff4f5390bf385a4864db3e96af6febf87e74678087fc1f","observation_id":"371656df-0697-4228-93f1-9b18e15e00a8","resolution":{"observed_at":"2026-08-06T19:27:21.775053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:26:17.606262Z","title":"π0: A vision-language-action flow model for general robot control. CoRR, abs/2410.24164, 2024. doi: 10.48550","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05674","last_updated":"2025-09-12T04:53:53Z","snapshot_observed_at":"2026-08-06T19:18:06.610964Z","submitted_at":"2025-07-08T04:57:23Z","title":"Integrating Diffusion-based Multi-task Learning with Online Reinforcement Learning for Robust Quadruped Robot Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:17.606262Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05674"},"observation_digest":"sha256:0eb13e8aedeffd163199dcf330003fb7c4d1016bef5b2af6240a0b0c7bd8b621","observation_id":"d1fbca58-e1a5-4e48-a7d5-667a6643cc2b","resolution":{"observed_at":"2026-08-06T19:26:17.606262Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:20:52.364117Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05934","last_updated":"2025-07-08T12:34:10Z","snapshot_observed_at":"2026-08-06T19:12:22.082286Z","submitted_at":"2025-07-08T12:34:10Z","title":"BlueLM-2.5-3B Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:20:52.364117Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.05934"},"observation_digest":"sha256:6425ca738b43f74f7024b9ea973cce418abf85001fadbf33a1c776cee14b4333","observation_id":"7c346b10-9eee-412a-9943-084600a73c8a","resolution":{"observed_at":"2026-08-06T19:20:52.364117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T19:14:30.177708Z","title":"π0: A vision-language- action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06224","last_updated":"2025-07-08T17:57:03Z","snapshot_observed_at":"2026-08-06T19:05:55.289283Z","submitted_at":"2025-07-08T17:57:03Z","title":"EC-Flow: Enabling Versatile Robotic Manipulation from Action-Unlabeled Videos via Embodiment-Centric Flow","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:30.177708Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.06224"},"observation_digest":"sha256:3242a6abd2a07e80fd3501742ab0838872ffd0ad2e2b74c610f3647373965981","observation_id":"a5dfad87-88cc-4c58-9385-0a00a8513a55","resolution":{"observed_at":"2026-08-06T19:14:30.177708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-02T06:26:17.199293Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T05:09:02.111308Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.07986"},"observation_digest":"sha256:911755fbabd5e162a24069809805d36427947982ce62dd8fec3b1c78e737ca65","observation_id":"fafd0c86-d44d-478a-80d4-a1e4c6fa9d33","resolution":{"observed_at":"2026-05-19T05:12:05.299689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T18:15:42.647136Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:42.647136Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:ce5fc023f48feea0e6e42bd852d327c2ac421a98b3de26cc3665eb64506f94a7","observation_id":"66839269-e730-4751-a862-0c5b0834200c","resolution":{"observed_at":"2026-08-06T18:15:42.647136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T18:09:09.647558Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09160","last_updated":"2025-07-12T06:44:37Z","snapshot_observed_at":"2026-08-06T18:00:03.083389Z","submitted_at":"2025-07-12T06:44:37Z","title":"Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:09.647558Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.09160"},"observation_digest":"sha256:eaa7594f5ef361f7dc2a2ebe6f66f19f37cdf2e25b8425df39b5ee3e5bb276f2","observation_id":"dcb8b3ff-4a89-44fa-800d-e8f509ff96be","resolution":{"observed_at":"2026-08-06T18:09:09.647558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T17:26:28.326401Z","title":"Black, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10899","last_updated":"2025-07-15T01:26:59Z","snapshot_observed_at":"2026-08-06T17:19:37.222813Z","submitted_at":"2025-07-15T01:26:59Z","title":"Object-Centric Mobile Manipulation through SAM2-Guided Perception and Imitation Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:28.326401Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.10899"},"observation_digest":"sha256:bb85f6d9fa660c228d8f5ce980b0a4f0251936dcbf4e0b91a016d0f7a60c0ecd","observation_id":"be1640e1-6b27-40de-b3af-d20bf4a07adb","resolution":{"observed_at":"2026-08-06T17:26:28.326401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T17:18:49.198062Z","title":"π0 : A vision-language- action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11296","last_updated":"2025-07-15T13:21:32Z","snapshot_observed_at":"2026-08-06T17:09:14.187565Z","submitted_at":"2025-07-15T13:21:32Z","title":"Diffusion-Based Imaginative Coordination for Bimanual Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:18:49.198062Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.11296"},"observation_digest":"sha256:ebd183a269876eb8f92025be117bb15105c737687a3185e1c9df5c0ea1328a62","observation_id":"0451c3f8-69b3-421d-bd28-7c9e2d98b671","resolution":{"observed_at":"2026-08-06T17:18:49.198062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T16:42:14.652101Z","title":"Pi0: A Vision-Language-Action Flow Model for General Robot Control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12741","last_updated":"2025-07-17T02:49:43Z","snapshot_observed_at":"2026-08-06T16:37:31.762983Z","submitted_at":"2025-07-17T02:49:43Z","title":"Public Evaluation on Potential Social Impacts of Fully Autonomous Cybernetic Avatars for Physical Support in Daily-Life Environments: Large-Scale Demonstration and Survey at Avatar Land","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:14.652101Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.12741"},"observation_digest":"sha256:b72b0e665b16b69daa767d1b155153a680f790e31af4c8fe3bd4d26296fe4a68","observation_id":"089e81b7-29c1-4bdf-8366-2667604637e0","resolution":{"observed_at":"2026-08-06T16:42:14.652101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.12768","last_updated":"2026-05-06T08:19:11Z","snapshot_observed_at":"2026-08-03T01:37:13.706745Z","submitted_at":"2025-07-17T03:48:57Z","title":"AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T03:52:18.984005Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.12768"},"observation_digest":"sha256:1cc54dab5b36c0d270568f8dcb86649733bfb6f59685431752459bcb85124dcf","observation_id":"20e9b048-92b0-4361-bb52-934b18440f96","resolution":{"observed_at":"2026-05-19T03:52:57.541199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T09:54:28.271928Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.12898"},"observation_digest":"sha256:941ca12eb177225f66f33e69191e8e99d84f5127ce41aa2f1836202c1ed58aed","observation_id":"4d5a8270-5228-48a4-85cc-23873b14b19f","resolution":{"observed_at":"2026-05-16T09:54:28.335954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:47:40.788104Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15073","last_updated":"2025-07-20T18:15:18Z","snapshot_observed_at":"2026-08-06T15:39:04.926062Z","submitted_at":"2025-07-20T18:15:18Z","title":"Reinforcement Learning for Flow-Matching Policies","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:40.788104Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15073"},"observation_digest":"sha256:ab11047fbb16cf5349ce6e0c9cd5aaa04cbb4665dd4656101084f95f4352c08e","observation_id":"c0d62655-327a-46d1-aaca-c7d260a4f923","resolution":{"observed_at":"2026-08-06T15:47:40.788104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:3eebde959d65fb79946985fc64e189a3e4c79f489e87abdae3713a8077a1cb14","observation_id":"5c4ec451-ad20-44f5-b1a5-974f783bb2dc","resolution":{"observed_at":"2026-05-17T08:04:12.629932Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:33:38.444159Z","title":"corr, abs/2410.24164, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15597","last_updated":"2025-07-21T13:19:09Z","snapshot_observed_at":"2026-08-06T15:25:42.125132Z","submitted_at":"2025-07-21T13:19:09Z","title":"Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:33:38.444159Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.15597"},"observation_digest":"sha256:6fe7b8400ef20bed19003c47cc3eb3398e6b99defeed31eb2ca1eb36ca695dd1","observation_id":"fd76e2bb-41aa-4466-9b3b-2a46499d2114","resolution":{"observed_at":"2026-08-06T15:33:38.444159Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T15:01:48.271563Z","title":"Black, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17141","last_updated":"2025-07-23T02:23:41Z","snapshot_observed_at":"2026-08-06T14:53:59.976561Z","submitted_at":"2025-07-23T02:23:41Z","title":"Towards Human-level Intelligence via Human-like Whole-Body Manipulation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:48.271563Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.17141"},"observation_digest":"sha256:2cf08916c5d34f65b18b374fdb99575397b4097b58c7f9d0055123624a11095f","observation_id":"08323709-7dd0-48ff-a5ae-b4252357730b","resolution":{"observed_at":"2026-08-06T15:01:48.271563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T14:57:34.064538Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17294","last_updated":"2025-07-29T12:31:26Z","snapshot_observed_at":"2026-08-06T14:49:26.284149Z","submitted_at":"2025-07-23T07:54:10Z","title":"VLA-Touch: Enhancing Vision-Language-Action Models with Dual-Level Tactile Feedback","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:57:34.064538Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.17294"},"observation_digest":"sha256:051844390c7be156b9b83ad7489c91896847da290db3e92f2a912e769343964a","observation_id":"9bb34379-aaf8-4319-9ec4-5503ca708c52","resolution":{"observed_at":"2026-08-06T14:57:34.064538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.18809","last_updated":"2026-05-13T07:56:01Z","snapshot_observed_at":"2026-07-06T22:02:32.276277Z","submitted_at":"2025-07-24T21:11:39Z","title":"Test-time Offline Reinforcement Learning on Goal-related Experience","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T02:18:34.690441Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.18809"},"observation_digest":"sha256:5afd0718adfad49b556bf9bf1da89984647d9a54df26b49bae43ceb8fc5a3004","observation_id":"490fde5d-cef2-4cf9-8512-2159be3cf686","resolution":{"observed_at":"2026-05-19T02:21:59.654946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T13:07:09.618360Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-06T13:07:08.917009Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:09.618360Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.21053"},"observation_digest":"sha256:65be5626272071853149ecc58aeb2f7dc91d619d40a6bc485c816c11841d32f4","observation_id":"0ce2233f-4dad-46fa-b9aa-660cf115acc1","resolution":{"observed_at":"2026-08-06T13:07:09.618360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T12:39:37.651115Z","title":"arXiv preprint arXiv:2410.24164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-06T12:39:36.140101Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:37.651115Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:a57fd2e2840240997a1cc24385f02987885982eedc66422cbc9143ec35764499","observation_id":"98fb2361-38df-4a16-ab48-2e47ff2f9c71","resolution":{"observed_at":"2026-08-06T12:39:37.651115Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T11:51:02.091283Z","title":"π0: A vision-language-action flow model for general robot control.URL https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22380","last_updated":"2025-07-30T04:46:48Z","snapshot_observed_at":"2026-08-06T11:51:01.367799Z","submitted_at":"2025-07-30T04:46:48Z","title":"Improving Generalization Ability of Robotic Imitation Learning by Resolving Causal Confusion in Observations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:51:02.091283Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.22380"},"observation_digest":"sha256:e1102859078048bf5d7d0e6846ef57125be4dd90607b1e52eda18413e2e166e9","observation_id":"d2bf74e7-b9a3-43b3-8576-2be2a04e15bd","resolution":{"observed_at":"2026-08-06T11:51:02.091283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T10:48:18.867996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23523","last_updated":"2025-08-01T06:30:43Z","snapshot_observed_at":"2026-08-06T10:47:54.256882Z","submitted_at":"2025-07-31T13:06:59Z","title":"H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T10:48:18.867996Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.23523"},"observation_digest":"sha256:aa925e80b2e7123235d0c13088a09edcecfc38bbf319f5b98ce035a1d83d78c4","observation_id":"d9a7d4b8-7613-4fd1-9375-2c726b69c5fa","resolution":{"observed_at":"2026-08-06T10:48:18.867996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T21:52:02.893886Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2507.23682"},"observation_digest":"sha256:61b9ee8af732b3e56362d2b5101c0255a65135f7d5d12448e71b601813d20992","observation_id":"71a5747f-c752-4f73-bd4c-9bc07a1a5672","resolution":{"observed_at":"2026-05-15T21:52:02.961866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T10:11:47.387858Z","title":"π0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00491","last_updated":"2025-08-01T10:09:38Z","snapshot_observed_at":"2026-08-06T10:11:46.525145Z","submitted_at":"2025-08-01T10:09:38Z","title":"HannesImitation: Grasping with the Hannes Prosthetic Hand via Imitation Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:11:47.387858Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.00491"},"observation_digest":"sha256:39488a15d2e33cd54bd226e80864d38d019ae302af9411f558507e99b6961fad","observation_id":"c9e8315a-733a-414c-a4c6-2f040681b95d","resolution":{"observed_at":"2026-08-06T10:11:47.387858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T21:28:41.904725Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.05635"},"observation_digest":"sha256:0180bab7f6429ad0eb4dcf1527fb12c57b98c2cb91363496b64fa3dab16e3ced","observation_id":"d8964fb7-2688-4bd8-b183-841c56ef2688","resolution":{"observed_at":"2026-05-15T21:28:41.964233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T23:17:29.431156Z","title":"Black, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05636","last_updated":"2025-08-07T17:59:59Z","snapshot_observed_at":"2026-08-05T23:16:26.510816Z","submitted_at":"2025-08-07T17:59:59Z","title":"FaceAnonyMixer: Cancelable Faces via Identity Consistent Latent Space Mixing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:29.431156Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.05636"},"observation_digest":"sha256:e5b7361ca735199950dbea89d243ee691522acc4a88190ccefc2cd2488ae009b","observation_id":"4ab12c15-ed62-4476-9a44-2dc02a708d4e","resolution":{"observed_at":"2026-08-05T23:17:29.431156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T23:06:33.712603Z","title":"π0: A Vision-Language-Action Flow Model for General Robot Control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05941","last_updated":"2026-07-01T21:54:22Z","snapshot_observed_at":"2026-08-05T23:06:33.124821Z","submitted_at":"2025-08-08T02:07:08Z","title":"Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:06:33.712603Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.05941"},"observation_digest":"sha256:3d31d84f1c7b53a9d5a2792ee78e4a1db6d8f6976f0cbc63f96bbc24d3757e1a","observation_id":"e7e65a3d-ee2a-4f59-b585-f775af7c558a","resolution":{"observed_at":"2026-08-05T23:06:33.712603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T22:51:58.490409Z","title":"π0: A vision-language- action flow model for general robot control, 2024,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06257","last_updated":"2025-08-08T12:22:36Z","snapshot_observed_at":"2026-08-05T22:51:52.256416Z","submitted_at":"2025-08-08T12:22:36Z","title":"Multi-Omics Analysis for Cancer Subtype Inference via Unrolling Graph Smoothness Priors","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T22:51:58.490409Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.06257"},"observation_digest":"sha256:a3d0c0d3568be883da9c84d35e518fb9a08f0c4e129ee85e5831ee116d433b08","observation_id":"944057e8-bf5e-4fad-81a4-6ea10e59526a","resolution":{"observed_at":"2026-08-05T22:51:58.490409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T22:50:41.076925Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06426","last_updated":"2025-08-08T16:14:01Z","snapshot_observed_at":"2026-08-05T22:50:39.090909Z","submitted_at":"2025-08-08T16:14:01Z","title":"Shortcut Learning in Generalist Robot Policies: The Role of Dataset Diversity and Fragmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:50:41.076925Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.06426"},"observation_digest":"sha256:9069a3d0b8106f311988d8460f0f32246481ee05c52723a4fdc0ee5efbbf15d5","observation_id":"9ad5d33d-b8da-42b2-86d0-d8f04f8ae900","resolution":{"observed_at":"2026-08-05T22:50:41.076925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T22:46:39.871089Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06429","last_updated":"2025-08-08T16:16:43Z","snapshot_observed_at":"2026-08-06T08:09:31.684688Z","submitted_at":"2025-08-08T16:16:43Z","title":"SPARSE Data, Rich Results: Few-Shot Semi-Supervised Learning via Class-Conditioned Image Translation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:39.871089Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.06429"},"observation_digest":"sha256:535edd0424fd52e66eab25202995ba229b085fe4fee9cae6a188a74b597123d8","observation_id":"1eb14267-c287-4869-b822-a7247872d9c9","resolution":{"observed_at":"2026-08-05T22:46:39.871089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T21:59:00.765491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07650","last_updated":"2025-08-23T14:01:26Z","snapshot_observed_at":"2026-08-05T21:58:58.897913Z","submitted_at":"2025-08-11T06:01:00Z","title":"GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:59:00.765491Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.07650"},"observation_digest":"sha256:2ff45714f12db00924ae5a420d429ccf1ea9139f52dba488ee6aaf21d4865ff0","observation_id":"1559dab7-3594-454f-bd9f-302cac670c54","resolution":{"observed_at":"2026-08-05T21:59:00.765491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2508.08574","last_updated":"2026-04-13T16:50:27Z","snapshot_observed_at":"2026-08-02T09:29:49.746608Z","submitted_at":"2025-08-12T02:19:15Z","title":"DeepFleet: Multi-Agent Foundation Models for Mobile Robots","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T00:13:27.533407Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.08574"},"observation_digest":"sha256:73d046e88e45cc9bef6ab3ced3da6b9e428177570e6d49ee4bf9142ca47e2f13","observation_id":"f1a2d9de-0e4f-4892-a869-9e30b7767636","resolution":{"observed_at":"2026-05-19T00:16:55.429897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T20:50:28.780841Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.09827","last_updated":"2025-08-13T14:03:10Z","snapshot_observed_at":"2026-08-05T20:50:26.544153Z","submitted_at":"2025-08-13T14:03:10Z","title":"Time delay as the origin of oscillations in anodic Si electrodissolution","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T20:50:28.780841Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.09827"},"observation_digest":"sha256:899d84d869a6ece5928f0cdfde24915b06970d5f2de61db9a5f30246bd71247a","observation_id":"e114be25-12c2-46b2-8898-f6ef1efcbe26","resolution":{"observed_at":"2026-08-05T20:50:28.780841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T20:38:38.197244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10259","last_updated":"2025-08-14T00:57:58Z","snapshot_observed_at":"2026-08-05T20:38:36.897476Z","submitted_at":"2025-08-14T00:57:58Z","title":"Leveraging OS-Level Primitives for Robotic Action Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:38:38.197244Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.10259"},"observation_digest":"sha256:dfc550a3125cd29e6886d5fa4551fb9c7c7781cdf1dfbcbf6f2f2fe6ffdeec52","observation_id":"ba5700c1-d379-457d-9b22-d536e652a461","resolution":{"observed_at":"2026-08-05T20:38:38.197244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T20:31:33.972251Z","title":"2024.𝜋0: A Vision-Language-Action Flow Model for General Robot Control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-06T07:55:46.567033Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:33.972251Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.10399"},"observation_digest":"sha256:8a83ff2b91aa938c57daa8f336bb8f60db6dd873bc5db1eb801c3935f62dcb26","observation_id":"fa49e8e6-abff-4f81-a5b0-2f59041fffa2","resolution":{"observed_at":"2026-08-05T20:31:33.972251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T16:55:52.119863Z","title":"π0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17449","last_updated":"2025-09-04T16:46:34Z","snapshot_observed_at":"2026-08-05T16:55:50.271610Z","submitted_at":"2025-08-24T17:01:15Z","title":"Robotic Manipulation via Imitation Learning: Taxonomy, Evolution, Benchmark, and Challenges","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T16:55:52.119863Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.17449"},"observation_digest":"sha256:503ba4e8088c8967d29c73d20fc809f36d683d295f9789710b0568a0b21fc5e5","observation_id":"6b9ab49d-43d9-409d-b057-bbffb4c6db71","resolution":{"observed_at":"2026-08-05T16:55:52.119863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T15:33:21.237689Z","title":"pi0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19788","last_updated":"2025-08-27T11:14:05Z","snapshot_observed_at":"2026-08-05T15:33:20.859379Z","submitted_at":"2025-08-27T11:14:05Z","title":"Context-Aware Risk Estimation in Home Environments: A Probabilistic Framework for Service Robots","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:33:21.237689Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.19788"},"observation_digest":"sha256:73621d1678fadd8ee3caf0430816461016a644bdfd6824dc8cb44243d78b4637","observation_id":"d99a860e-408f-4259-b184-6a6754df008d","resolution":{"observed_at":"2026-08-05T15:33:21.237689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T14:42:32.559657Z","title":"π0: A vision-language-action flow model for general robot control, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.559657Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:c0b9af4902809939cbb5f5fca936d6d954672698b73d644652ec273ec651ef13","observation_id":"0a2f361f-bb9e-42f5-bf36-5f7abb6d96a1","resolution":{"observed_at":"2026-08-05T14:42:32.559657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T14:39:58.474830Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21063","last_updated":"2025-08-28T17:59:05Z","snapshot_observed_at":"2026-08-05T14:39:56.796203Z","submitted_at":"2025-08-28T17:59:05Z","title":"Prompt-to-Product: Generative Assembly via Bimanual Manipulation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:39:58.474830Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2508.21063"},"observation_digest":"sha256:15dfc490b2ee1fa7300c58aaa0f979679dd08d39be26e0960e6e23459220dc70","observation_id":"63e8f5d3-b3f2-4cfa-9638-0939ce5f95e6","resolution":{"observed_at":"2026-08-05T14:39:58.474830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T13:50:17.340438Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00328","last_updated":"2025-08-30T03:01:57Z","snapshot_observed_at":"2026-08-05T13:50:16.414260Z","submitted_at":"2025-08-30T03:01:57Z","title":"Mechanistic interpretability for steering vision-language-action models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:50:17.340438Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.00328"},"observation_digest":"sha256:236ea665521a4ad136cbc52e03976eb825d25451c5738cc536101844b196f790","observation_id":"dedf9934-f427-451f-a357-b1117075386c","resolution":{"observed_at":"2026-08-05T13:50:17.340438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T13:46:41.215161Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00361","last_updated":"2025-08-30T04:53:32Z","snapshot_observed_at":"2026-08-05T13:46:39.182535Z","submitted_at":"2025-08-30T04:53:32Z","title":"Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:41.215161Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.00361"},"observation_digest":"sha256:1d93d87a4366bee61be096749894625badd25069fc7a5cd8d9335f904fabd408","observation_id":"1fc43ed9-d9e4-4b61-be7c-5d1c4d81762b","resolution":{"observed_at":"2026-08-05T13:46:41.215161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T13:31:09.936405Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-06T11:26:06.418969Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:31:09.936405Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.00576"},"observation_digest":"sha256:76dad3040ef6c25420eeaf32e4e5b04d5d59ee6970512a1d4cc74a7f884b8c9a","observation_id":"6193c206-5a0f-451d-8efd-508c8acea7c8","resolution":{"observed_at":"2026-08-05T13:31:09.936405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T12:15:01.261741Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01819","last_updated":"2025-09-01T22:50:55Z","snapshot_observed_at":"2026-08-05T12:14:58.768407Z","submitted_at":"2025-09-01T22:50:55Z","title":"ManiFlow: A General Robot Manipulation Policy via Consistency Flow Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:15:01.261741Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.01819"},"observation_digest":"sha256:173bc5952bf47625a48bc9bcceeebe47ba916055c64e0ad5bf2370060fb5e8f9","observation_id":"d7462c27-1579-4723-8cbf-57fbdbba4f08","resolution":{"observed_at":"2026-08-05T12:15:01.261741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T12:02:28.253604Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02055","last_updated":"2025-09-05T06:24:50Z","snapshot_observed_at":"2026-08-05T12:02:25.039196Z","submitted_at":"2025-09-02T07:51:59Z","title":"Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:02:28.253604Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.02055"},"observation_digest":"sha256:a0f0c3d6a410b623aa1127ee34cf8bb65c8ffdd2a6fb2dcdbb02886cf17f9662","observation_id":"e74e5446-8423-4ded-ae86-5794975f9c70","resolution":{"observed_at":"2026-08-05T12:02:28.253604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T11:00:38.071920Z","title":"π0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03383","last_updated":"2025-09-03T15:00:28Z","snapshot_observed_at":"2026-08-06T10:29:35.248509Z","submitted_at":"2025-09-03T15:00:28Z","title":"ANNIE: Be Careful of Your Robots","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:00:38.071920Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.03383"},"observation_digest":"sha256:f6bd38bfdc12cb94b77ef8e41efe4bb99c6ae9ef3b1c754f0590901e0422f878","observation_id":"d79fd5b3-b3f2-44a5-bc6f-25749d7b6fcf","resolution":{"observed_at":"2026-08-05T11:00:38.071920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T10:30:23.469543Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.469543Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:5ce1def0e50d676a24971595fd59dbfda0125ac541f8c867f1659cfe86eb5a76","observation_id":"49033faf-97a7-4f53-9d63-22125454ec02","resolution":{"observed_at":"2026-08-05T10:30:23.469543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T05:48:47.041197Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:47.041197Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:7b0d29dc8bccbe27053a31209e45b882f952aa435ca98ba7f4482c358689d439","observation_id":"425dfa97-a135-4d41-b75e-c7ccac9bfb33","resolution":{"observed_at":"2026-08-05T05:48:47.041197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T00:02:31.054355Z","title":"π 0: A vision- language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06191","last_updated":"2025-09-07T20:00:59Z","snapshot_observed_at":"2026-08-06T15:50:04.529304Z","submitted_at":"2025-09-07T20:00:59Z","title":"Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:02:31.054355Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.06191"},"observation_digest":"sha256:2107968bbb790e4af0f330e0a6f72c70ed7ae4cbb6686c9624d01b925476832a","observation_id":"5f54cd02-6b84-4070-bf28-5ec13872ec76","resolution":{"observed_at":"2026-08-05T00:02:31.054355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T22:55:29.811254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06932","last_updated":"2025-09-10T14:34:25Z","snapshot_observed_at":"2026-08-04T22:55:29.306356Z","submitted_at":"2025-09-08T17:45:40Z","title":"LLaDA-VLA: Vision Language Diffusion Action Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:29.811254Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.06932"},"observation_digest":"sha256:d942050eae0f7df5ac8eb7c1d534f99dca29b811e3d3db5ef4d12445f2e23f59","observation_id":"50b658f0-973b-4902-9b3b-55aff3ec7ea7","resolution":{"observed_at":"2026-08-04T22:55:29.811254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T21:32:55.710564Z","title":"URLhttps://arxiv.org/abs/2410.24164","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-04T21:32:53.985511Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:55.710564Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:3abdbaa0e2d610fa57016091be9fb0418b39013e6ae474b9b9f0b3b3f3bcdfcb","observation_id":"85bfc1e7-8b0f-4d81-b632-90a41036c302","resolution":{"observed_at":"2026-08-04T21:32:55.710564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T21:29:06.758383Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07962","last_updated":"2025-09-09T17:50:37Z","snapshot_observed_at":"2026-08-04T21:29:05.648300Z","submitted_at":"2025-09-09T17:50:37Z","title":"TA-VLA: Elucidating the Design Space of Torque-aware Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T21:29:06.758383Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.07962"},"observation_digest":"sha256:f2430b53167af58e43a95d3e7e6eb44c2bfc67fc1f281d7d28e5c3cfa237f3d4","observation_id":"f4b573ec-1b5c-4aa9-8bd7-c69c315de236","resolution":{"observed_at":"2026-08-04T21:29:06.758383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T21:05:26.681426Z","title":"π0: A Vision-Language-Action Flow Model for General Robot Control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08226","last_updated":"2025-09-10T01:59:00Z","snapshot_observed_at":"2026-08-04T21:05:19.133506Z","submitted_at":"2025-09-10T01:59:00Z","title":"Input-gated Bilateral Teleoperation: An Easy-to-implement Force Feedback Teleoperation Method for Low-cost Hardware","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T21:05:26.681426Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.08226"},"observation_digest":"sha256:db0f506ad285699c283df824ba6ffbe632899d9a1c9ff169afefcb83833848f4","observation_id":"7b60584e-c3f0-43a7-a7a5-a7e828dfa9bf","resolution":{"observed_at":"2026-08-04T21:05:26.681426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:12e3bb136d209abbc5ba2837ba5fba0d647b72aad176f7ad86c9892489a37fdb","observation_id":"376dd412-306a-4f14-bfa4-4169b96b7374","resolution":{"observed_at":"2026-05-18T00:02:24.981459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T19:47:08.802413Z","title":"9 SQAP-VLAA PREPRINT Amir Gholami, Sehoon Kim, Zhen Dong, Zhewei Yao, Michael W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-04T19:47:08.413522Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.802413Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:913844a66e44eb73accba641c19f208fe4ef14809e22943c441a1300ca6b921f","observation_id":"5f3307b6-c5a2-47da-816b-9ff403a6365d","resolution":{"observed_at":"2026-08-04T19:47:08.802413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:cb16dc30bc4a70e7546ded1a034bd24c8f3fb7a92bc0b02ac42ef4aad8743f77","observation_id":"2cae877f-7bf8-4f35-ab0b-a02106c52495","resolution":{"observed_at":"2026-05-15T08:02:11.305433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T16:17:25.973193Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.15061","last_updated":"2026-07-03T09:06:35Z","snapshot_observed_at":"2026-08-04T16:17:25.317291Z","submitted_at":"2025-09-18T15:25:31Z","title":"Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:17:25.973193Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.15061"},"observation_digest":"sha256:ce20a13c06ab65afe624683b96f71b0470ea6dc079a2cb8e80e13edd17df5aa2","observation_id":"dcf27dbb-763d-4fc4-99d6-8988c21531b6","resolution":{"observed_at":"2026-08-04T16:17:25.973193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T15:46:03.494365Z","title":"0: A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.18671","last_updated":"2026-06-22T07:55:30Z","snapshot_observed_at":"2026-08-04T15:45:46.658205Z","submitted_at":"2025-09-23T05:41:59Z","title":"N2M: Bridging Navigation and Manipulation by Learning Pose Preference from Rollout","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T15:46:03.494365Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.18671"},"observation_digest":"sha256:17d4d94605bd36df3301a5c0d578ffcdfc546adee89a54651085b0e902733635","observation_id":"6e62abb8-f959-492c-b8de-133fde6de60c","resolution":{"observed_at":"2026-08-04T15:46:03.494365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2509.21723","last_updated":"2026-05-01T09:02:01Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T00:47:39Z","title":"VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T13:47:30.943307Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.21723"},"observation_digest":"sha256:8b14e7e69ab169dccff6a8b83a7bb6c82392c5819bbd44412165e16ac6d43f90","observation_id":"a98ca1ea-ef4c-4ea7-867f-30f951b895c6","resolution":{"observed_at":"2026-05-18T13:51:25.708500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.24164/citation-record","integrity":"/paper/2410.24164/integrity","json":"/paper/2410.24164/citation-record.json","paper":"/paper/2410.24164"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:6d609e59f707ebb8deeff7384f725c2bd20362ca8441dc08bab9c844bd80e494","observation_id":"186b835d-ff67-4533-a818-63179ffb2719","resolution":{"observed_at":"2026-05-10T12:38:24.569269Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:7a10a6b8840bd8eaa29fb0717d87c74bf01d57443d8625a0323864a0333aab9c","observation_id":"66483837-3208-4533-b954-885452a870d2","resolution":{"observed_at":"2026-05-10T22:24:06.862904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"cdf125de-96e3-4aae-ab95-55cc706ec7e8","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:dafa1a32b1d67437ce2929aa962af2cf671ac50be5d41cec25360e848b2900f7","observation_id":"ef7df772-5ad9-49ca-aee2-1b4cb0812fbe","resolution":{"observed_at":"2026-05-10T12:38:24.599723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02292","last_updated":"2024-02-07T23:58:10Z","snapshot_observed_at":"2026-08-03T19:36:04.243051Z","submitted_at":"2024-02-07T23:58:10Z","title":"ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation","version":1},"cited_work":{"arxiv_id":"2405.02292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02292","snapshot_observed_at":"2026-07-04T10:59:46.588023Z","title":"Aloha 2: An enhanced low-cost hardware for bimanual teleoperation","venue":null,"work_id":"fed7eb09-a45e-4bd9-b515-58c9e907bce4","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2405.02292","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:3279abfbfe344775f0fd4ccb461e43e9192cc107c6b4d349f3bbc32f65ab307d","observation_id":"cbcf5aaa-8a08-4d47-bb32-87102fe28d44","resolution":{"observed_at":"2026-05-10T12:38:24.572972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:c348427571c118380742156db21eefb107444f2f8d98da9805e9090ec674efc6","observation_id":"4c39feb4-ebb1-4228-9a90-81ca3f3fbecb","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoboAgent: Generalization and efficiency in robot ma- nipulation via semantic augmentations and action chunk- ing","venue":null,"work_id":"eb7e0f8b-8932-4d9a-8a53-7b2b88e206d8","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:4828b0be6e69b36fa243cd89f55baef63296b852059382d09c242f839a3af117","observation_id":"7a4fdabc-a9db-4f26-876f-0ec0a1a75656","resolution":{"observed_at":"2026-05-10T12:38:24.607672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:1d04839eb601356f8905cfd4289a61b5c29659043ddbf28c310ccd9cc6e965bb","observation_id":"0ead8dff-ba03-423b-94af-1257f7b9ddca","resolution":{"observed_at":"2026-05-10T22:36:04.729348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12200","last_updated":"2020-06-04T11:00:06Z","snapshot_observed_at":"2026-08-06T05:31:57.476497Z","submitted_at":"2019-09-26T15:45:23Z","title":"Scaling data-driven robotics with reward sketching and batch reinforcement learning","version":3},"cited_work":{"arxiv_id":"1909.12200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12200","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling data-driven robotics with reward sketching and batch reinforcement learning.Preprint arXiv:1909.12200","venue":null,"work_id":"c44fff83-b8c4-4bf1-a47d-0f5c0046b36c","year":1909},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/1909.12200","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:e5bf2ff34cec857c79b70ce227f341eca2f39685993ff3fd6ba2f2610b5d5030","observation_id":"08636786-f950-4932-b653-6e6a3fb3aaa3","resolution":{"observed_at":"2026-05-10T12:38:24.584240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion.The International Journal of Robotics Research, page 02783649241273668","venue":null,"work_id":"b6f952af-037e-4a7c-a21d-7c1e13f31862","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:fc9a734fd4705063ae186c87fbc1d7680c0737b268fc5ec09830a9a82d50e3c6","observation_id":"4e3f9108-50b9-486a-8e69-c038619a94da","resolution":{"observed_at":"2026-05-10T12:38:24.615841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:1003c40120fdb22b87a79aab5e4905238626eea4e3f4e90d6c75d7d4f72170e0","observation_id":"fe746920-eb9e-419c-87ff-55614ada75bb","resolution":{"observed_at":"2026-05-11T17:23:25.503833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:86ec5d730759ca2d1a0fe5a325e9d7dd7b895d22994d91730e225205aca96b48","observation_id":"b201e70e-56da-42ed-9ee4-7f5f261b8aea","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"564e84f2-47f8-411c-8ecd-3194a15c5f37","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:60ee0c340a1e0fdf25b4efa343af1e40f74cf88c0b9597a70a7fe8fdebf93259","observation_id":"e905828c-e40e-48eb-bb78-ec431a8f61b9","resolution":{"observed_at":"2026-05-10T12:38:24.622903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":"2109.13396","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-07-04T08:49:42.858933Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","venue":"cs.RO","work_id":"59e728c0-b6ca-4759-a8f4-02b981f2220f","year":2021},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:9e14aded26974cc56ac5719877a10b255191100fcce83f294d7a3ea7f1e99c4c","observation_id":"d230a8ac-84f8-4fcf-a997-c1ba5c5e9e14","resolution":{"observed_at":"2026-05-13T19:55:55.512010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"1468e689-93ec-4d0d-8b20-99ba768567e3","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:ce681c77fd214707d1a4b58ac3741e842c2ee90e4685555c0e065f16099371b7","observation_id":"e4ac397a-ddf5-45f2-98e0-a1deb0a55850","resolution":{"observed_at":"2026-05-10T12:38:24.627784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05865","last_updated":"2024-09-09T17:59:50Z","snapshot_observed_at":"2026-08-02T18:32:11.602139Z","submitted_at":"2024-09-09T17:59:50Z","title":"Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments","version":1},"cited_work":{"arxiv_id":"2409.05865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05865","snapshot_observed_at":"2026-07-10T23:07:47.730125Z","title":"Robot utility models: General policies for zero-shot deployment in new environments","venue":"cs.RO","work_id":"f9ed1317-fff5-4b13-a34c-929bdd56371d","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2409.05865","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:0961c9d514536c8c0dbe6e3fee3c4b8104186d37355fa486c93d808d64f7153a","observation_id":"a08f786d-d01b-4d72-b222-95095acd3c31","resolution":{"observed_at":"2026-05-10T12:38:24.597104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learn- ing Research, 23(120):1–39","venue":null,"work_id":"3e3e2336-b9af-4657-a518-47921f5a725d","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:4b1c9242b1d0bc37e41bfbfc10f0ed473490b3eda796c16ee7efd2955fed9dfc","observation_id":"6b43814c-fe51-47c0-b32c-991389f29d7e","resolution":{"observed_at":"2026-05-10T12:38:24.633090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhao, and Chelsea Finn","venue":null,"work_id":"68900bce-25f3-4802-9917-338022c98abc","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:a98d28b618023f046b32fc50833dba9315410b9074511175404cf8a005ba0331","observation_id":"59d1a3e8-e72d-48e3-ad4a-cf9ce93cfa00","resolution":{"observed_at":"2026-05-10T12:38:24.635410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot learning in homes: Improving generalization and reducing dataset bias.Advances in neural information processing systems, 31","venue":null,"work_id":"13e6c22d-8cd7-4fcb-88e1-b840c0de36db","year":2018},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:113e1b578974f1dff35ebfcd5c04eadb67d26d508a3d5247c2413d28a8bb7643","observation_id":"d8b245be-6e70-4664-a5da-da1bc2884d80","resolution":{"observed_at":"2026-05-10T12:38:24.637941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07614","last_updated":"2024-07-11T11:05:53Z","snapshot_observed_at":"2026-08-06T02:29:21.167648Z","submitted_at":"2024-07-10T12:52:49Z","title":"MARS: Mixture of Auto-Regressive Models for Fine-grained Text-to-image Synthesis","version":2},"cited_work":{"arxiv_id":"2407.07614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07614","snapshot_observed_at":"2026-07-02T21:27:24.441164Z","title":"Mars: Mixture of auto-regressive models for fine-grained text-to-image synthesis","venue":null,"work_id":"50822597-546e-4083-9ced-932e5e1ba3e7","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2407.07614","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:5ced9158a871c959346e2a78685b12d66c1798ea819076c9ab46834a0fa0ffe3","observation_id":"c71919a8-492b-4e79-9bb8-f368a347f265","resolution":{"observed_at":"2026-05-10T12:38:24.472611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models.Advances in neural infor- mation processing systems, 33:6840–6851","venue":null,"work_id":"fdf8ee28-422e-4ff6-b77d-6266ecc6ad47","year":2020},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:7619499f0be05a2c167d3b42e8d0f34dc3347e835d00a9e5424bc0810a87959f","observation_id":"ab2caac5-d90b-4c3a-9672-bb9039cf9700","resolution":{"observed_at":"2026-05-10T12:38:24.642799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Highly accurate protein structure prediction with alphafold.Nature, 596(7873):583–589","venue":null,"work_id":"b47650e5-cbae-4298-b761-de84aa1ae0b5","year":2021},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:701fec6befa56e464dd38cfa3bd7aa9a2c467155df9eed14216463291a8416d0","observation_id":"4f90ccf7-c52b-4875-bb01-e242188cd1a5","resolution":{"observed_at":"2026-05-10T12:38:24.645800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable deep reinforcement learning for vision- based robotic manipulation","venue":null,"work_id":"4370c7b4-a6cc-47ec-bb9c-d35ddacbf972","year":2018},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:d43873eddd018b0d040d375a4cf42796ba86e418156e652cc825a70c3e7616aa","observation_id":"9ac88b53-d881-4a8e-9c0e-f27cac17364e","resolution":{"observed_at":"2026-05-10T12:38:24.648789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":"2403.12945","doi":"10.48550/arxiv.2403.12945","metadata_source":"pith","pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","venue":"cs.RO","work_id":"13253de2-3d89-415c-8c2f-3adb25d4c337","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:6ed2f5285796cf350eaeac1633efb242d2f9f1b1873bbbae8871fce29bdd6ede","observation_id":"c821c1c2-7e56-4fb3-aaea-6e86a0350b64","resolution":{"observed_at":"2026-05-11T05:51:19.504346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:6c0de2a46e681dbd1bdb3312a492530851523202209729ad8b00b8abd638f55c","observation_id":"0ed1f587-1829-415d-87ee-b0d6b91a5e2c","resolution":{"observed_at":"2026-05-10T14:46:37.168344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:28bc59a2c7239a9e3e87db9aadc7f85ad839419dec148395d4aa30ef75b6cda7","observation_id":"993eec13-d4b4-41de-8e9d-e7a161849f50","resolution":{"observed_at":"2026-05-11T02:26:45.276836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning hand-eye coor- dination for robotic grasping with deep learning and large-scale data collection.The International journal of robotics research, 37(4-5):421–436","venue":null,"work_id":"2b483bd9-5b68-4a21-9537-cfd85d91d24b","year":2018},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:d697161549e2785ad262f68243491f4f2d967dc8e39dd47482684b216acb46ae","observation_id":"5d27860a-43c1-483c-af8f-55899c72aa16","resolution":{"observed_at":"2026-05-10T12:38:24.661100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mankowitz, Esme Sutherland Robson, Push- meet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":"8ce8d38f-9a52-45e4-a7b3-6fc47c0d3ea7","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:0b6ebea1b8aa83256a326246a8b9fc014e1247758e9a1b92afe1eb0421071f13","observation_id":"c3ea40f6-eebb-476b-977b-b9b1f53527f4","resolution":{"observed_at":"2026-05-10T12:38:24.664022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:598daa9d5cfe4f780c49cc51c3e9b0687b03aa6f216235365717b7adc4b1faf2","observation_id":"1990ea1e-1107-4a4f-baf6-27a9a2b0c690","resolution":{"observed_at":"2026-05-10T12:38:24.489819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.10695","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-07-08T05:54:33.573861Z","title":"Playground v3: Improving text-to-image alignment with deep-fusion large language models","venue":"cs.CV","work_id":"0d487d5c-df2a-472b-9261-a4b8e0e1fcb0","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:92ec61d71e517bce2631663f009e0d132a587d80ca78ae02a4e8d440cb8b9067","observation_id":"2977e68d-84b7-41bd-ada7-f78dfcb54bca","resolution":{"observed_at":"2026-05-10T12:38:24.494101Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36","venue":null,"work_id":"6b8567d5-b75b-45d9-975c-f0d4ac96a3da","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:450abbed7ea8f7a678b3d8b03dbad16a516d363ff0d2af2ece379b855637bf35","observation_id":"e612d3ac-3a8d-4379-858a-e292a675148e","resolution":{"observed_at":"2026-05-10T12:38:24.610349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-04T04:35:05.950904Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":"2401.12202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-07-04T17:09:59.559023Z","title":"OK-Robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":"0ed6249b-7e12-4a76-b290-b7493420d577","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:2d65c0ced7e1feb794869f1542f3b0c9a83b4a70014fe11b86cffe863416b7f2","observation_id":"6291f803-cfe0-4280-8f77-37ef6395435d","resolution":{"observed_at":"2026-05-10T12:38:24.497934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-02T10:38:01.750409Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":"2209.14577","doi":"10.48550/arxiv.2209.14577","metadata_source":"pith","pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","venue":"stat.ML","work_id":"10529e85-31c7-446e-9dca-712d082a2bea","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:f2c55f261750d7f27bb90a12e1239452e6e9ad14d2bc19615fce93ce8b0f13c1","observation_id":"36ba374e-170f-4016-8a3d-8ace4e6915e8","resolution":{"observed_at":"2026-05-18T03:03:14.510564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoboTurk: A crowdsourcing platform for robotic skill learning through imitation","venue":null,"work_id":"52435c9a-3e71-4f4d-8fca-1e2c59a473fd","year":null},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:39e6bcab1b38a6f3b230664f5d8ef610d3e5e1422683eacc8238017196b436f7","observation_id":"1b0b3c6b-4fea-44e5-a5f9-2acfcc742e26","resolution":{"observed_at":"2026-05-10T12:38:24.620598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17596","last_updated":"2023-10-26T17:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-26T17:17:31Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2310.17596","doi":"10.48550/arxiv.2310.17596","metadata_source":"pith","pith_arxiv_id":"2310.17596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations","venue":"cs.RO","work_id":"ec7924ec-9bf2-4ccd-9901-6697dc517f84","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2310.17596","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:096cfe04b7b797eddeca69f61fdaa60f118e3a217bb75ce36b0844132e5f2609","observation_id":"585fab9f-6e5a-4453-9c01-d963c5976fdc","resolution":{"observed_at":"2026-05-17T09:47:55.567916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Advances in neural information pro- cessing systems, 35:27730–27744","venue":null,"work_id":"aa49dbbe-9aa0-4953-aa21-db40b96f8cbd","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:72dcd0b210396a7b6a8a98dfffa96d545bfff91d403134f1d16283ca01f18dc3","observation_id":"591cd36b-23c2-4c24-a64f-35b350cc45c4","resolution":{"observed_at":"2026-05-10T12:38:24.630413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffu- sion models with transformers","venue":null,"work_id":"52a30f20-2d85-4a1f-af0f-d6bd8d26262b","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:64ee6b13bdf5a4b3e542d4659e5c0b2dd492bdc7be7ff226a5c0dcf8d0655c37","observation_id":"dd073e90-aa27-4f9a-b4a7-27fce03663d1","resolution":{"observed_at":"2026-05-10T12:38:24.640505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supersizing self- supervision: Learning to grasp from 50k tries and 700 robot hours","venue":null,"work_id":"aa97a00c-08dd-4955-8012-4aa3e09ce6dc","year":2016},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:aa80dea5ac6e36a92a29fa8097c5da28171381aa5eaebab118ce52c2f2a9bdaa","observation_id":"bc38e97b-1946-4688-85a2-cec54c0688e5","resolution":{"observed_at":"2026-05-10T12:38:24.651770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:99d2b2ab2ddcdd4001dc13617b59e4cb2254ba679d417298600133b27336859e","observation_id":"c9813c43-2e1e-4bac-b39d-cbe66d9ae298","resolution":{"observed_at":"2026-05-11T14:16:26.778393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"92f24d06-2d25-4955-8705-0cc4312b5474","year":2021},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:9fb5913671bba393fd1ed06b6dd579e21bfdd90e925129ddd04d74c84fae5e36","observation_id":"194a8af6-2f32-4302-a671-22ed184741c8","resolution":{"observed_at":"2026-05-10T12:38:24.658072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"09dc568b-3618-49b6-bc4e-534208031e9d","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:a3953b2956682ddf752edd4d660a7b13032f785a2178a05911ec0b983a2c4c75","observation_id":"ef130608-d600-46b5-805b-69e522cb750d","resolution":{"observed_at":"2026-05-10T12:38:24.602234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Photorealistic text-to-image diffusion models with deep language understanding.Advances in neural information processing systems, 35:36479–36494","venue":null,"work_id":"8813831d-9d41-4184-89a3-493175bcbbe2","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:12c8c79451e94f140dcda81460e82ecd416c05761d8b18c49528920ae697803b","observation_id":"2186145a-d3ab-43db-984f-6f6a60b33e97","resolution":{"observed_at":"2026-05-10T12:38:24.604890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":"1910.01108","doi":"10.48550/arxiv.1910.01108","metadata_source":"pith","pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-07-11T02:57:46.620845Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","venue":"cs.CL","work_id":"756f9764-ecd6-4672-8043-b37c698c7ad2","year":2019},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:2d629cc023abd32e872f65fc73808c2cc60ed113fb27d8b9238f63c7edc95c95","observation_id":"c3653234-5eae-4e51-9a46-de5bf658036f","resolution":{"observed_at":"2026-05-11T05:02:34.528194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16098","last_updated":"2023-11-27T18:59:25Z","snapshot_observed_at":"2026-07-30T21:15:46.584759Z","submitted_at":"2023-11-27T18:59:25Z","title":"On Bringing Robots Home","version":1},"cited_work":{"arxiv_id":"2311.16098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16098","snapshot_observed_at":"2026-07-02T13:46:59.337867Z","title":"On bringing robots home","venue":null,"work_id":"6e3fdf89-a927-4640-9775-66c9b9d3a55b","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2311.16098","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:42aff45b0eefa2b9c4568d046fd5f80e2b7dd702f20b8235e295378563e2e4ef","observation_id":"f36a7891-6f8b-4805-bdea-83d2de6bafd8","resolution":{"observed_at":"2026-05-10T12:38:24.520342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:fe8ea91ff80dc26a5bc7fa0d9a72a06d59fa35cc9a91201ab188164c57d1a615","observation_id":"968ce4a6-e67e-4482-9899-d34d30bab563","resolution":{"observed_at":"2026-05-10T23:50:20.836519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:b0f94ea8ab1fd28d7f94156af8b1c1cef5a75bd5c260ce987469ecfcb10e572b","observation_id":"d582be40-13d5-4787-9012-f91b99942e81","resolution":{"observed_at":"2026-05-10T12:38:24.528600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"a54b167b-bbe2-42e9-b14d-9cfeeb2c3a32","year":2015},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:5bac5456c211a404580570b5e533163aa741567d2a355f8908a371bf3f511055","observation_id":"d862559d-2aa1-4818-9fb6-8bb4ff588f21","resolution":{"observed_at":"2026-05-10T12:38:24.612863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10270","last_updated":"2022-06-23T10:51:04Z","snapshot_observed_at":"2026-08-06T08:18:31.112514Z","submitted_at":"2021-06-18T17:58:20Z","title":"How to train your ViT? Data, Augmentation, and Regularization in Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.10270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.10270","snapshot_observed_at":"2026-07-01T18:15:59.170440Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":"b4cdfa0e-9daa-4ba1-9969-c9be2d1caaed","year":2021},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2106.10270","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:6a8a17548e8b8365063b0103641c0c598bac6778abb542fbf0d2b9ab922b5300","observation_id":"0a682dcd-0704-4295-8db7-3ac96b14c373","resolution":{"observed_at":"2026-05-10T12:38:24.532658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:dc59b5d6922375f9498e68d677eb5ce35631d185d1cd13544ecf5d9faece7d8e","observation_id":"ed0ae4d4-95a6-4e9d-af1f-3e513cadb8e0","resolution":{"observed_at":"2026-05-10T12:38:24.536160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:64e765a2b69185401f0a3a44b40596f57e8a545f4317a67d9681fb7b36e1675a","observation_id":"fad6ce8d-bf4c-4f20-9b99-f2551f9157fb","resolution":{"observed_at":"2026-05-10T15:54:09.189864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:5d94c14977bc25f2115a8eedbf5aaf57f09024b3ea1d705156c8c7b5f0e1bbf3","observation_id":"9d15a7cb-73ed-4287-ba12-1d7bf67cb273","resolution":{"observed_at":"2026-05-11T00:26:16.174119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"1e26d76a-02a4-4e78-866f-1fb7268eb18d","year":2017},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:bcab02806ab44c56c8f74da43b3eb5549ecbb7c8cad430cf104e882e532979ab","observation_id":"1a5ff08e-4d11-417d-ab61-52ab4e1dfe64","resolution":{"observed_at":"2026-05-10T12:38:24.625303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BridgeData v2: A dataset for robot learning at scale","venue":null,"work_id":"6355dea5-75c2-4409-a592-20bad5f43736","year":null},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:65e2df9af17ae0c42dcebb4539ef7c1677ae34d034cd59352ab681c134f48295","observation_id":"731de74b-d4ae-4f11-96b0-a6ec05cfd17a","resolution":{"observed_at":"2026-05-10T12:38:24.654745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:358329e44e86d2758048143d3a02c27df0f5351e56cce12c605e951ef87c7150","observation_id":"c2530f8f-9bde-406f-a677-67c537ab8965","resolution":{"observed_at":"2026-05-10T21:14:13.786069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":"2206.07682","doi":"10.48550/arxiv.2206.07682","metadata_source":"pith","pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergent Abilities of Large Language Models","venue":"cs.CL","work_id":"6ea3375b-837c-4640-a175-be7525aa3c6d","year":2022},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:43c8aa7302ffe9e3c7c748cce5146f20d3d75be673bd43f087637c7c9bb01692","observation_id":"15e242e8-bc3a-40c0-ab24-f0b2209e5ceb","resolution":{"observed_at":"2026-05-11T07:38:38.557341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":"2409.12514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-07-04T04:29:35.761670Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"20b3dc32-113f-4f7b-8826-52a8d03fd6b3","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:baab965ee78d28d464bb5e16e11a0457720994805ab8f5b281701e87ec43ad0c","observation_id":"fea1c6ba-967d-4da8-b23a-dbf12b3f90b3","resolution":{"observed_at":"2026-05-17T16:12:26.208161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More than a million ways to be pushed","venue":null,"work_id":"c301ca67-2fff-4497-8d82-bc2ef20dc553","year":2016},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:0a810f5b475769a5710c5503d02fda730af3bac05768188b687c475598b8b445","observation_id":"f60ea528-103c-41d6-8a6e-be2b0cf4ed97","resolution":{"observed_at":"2026-05-10T12:38:24.618132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:a619c406a7c7911c5d90d3b933a0c4d61828e481697df725d70e50d7e9d4a5be","observation_id":"7ec7b2e4-0148-4062-a61c-5fa50c4f4f64","resolution":{"observed_at":"2026-05-11T04:15:36.384383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-05T13:44:48.719708Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":"2410.13126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-07-04T19:30:08.155799Z","title":"Aloha unleashed: A simple recipe for robot dexterity","venue":null,"work_id":"db13f99b-32b7-4745-adc2-d4cfb5799638","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:3ca064838ae325542db7b77ebf0f1a3d9e5efa71d3765f33688e5f5dc5035028","observation_id":"9ba0329b-450c-4bef-bc07-42e62e18d6d4","resolution":{"observed_at":"2026-05-10T12:38:24.562457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:8a2df9428842f671ca36fabeeebe6bdf7a4c74c0b724030bf6c76d22de01c8cd","observation_id":"f260777d-b39d-4545-bdb6-2db9fd5f0c7a","resolution":{"observed_at":"2026-05-13T05:57:27.005672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14411","last_updated":"2024-11-14T11:59:09Z","snapshot_observed_at":"2026-07-06T19:19:24.759288Z","submitted_at":"2024-09-22T12:14:16Z","title":"Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2409.14411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.14411","snapshot_observed_at":"2026-07-08T19:25:32.475862Z","title":"Scaling diffusion policy in trans- former to 1 billion parameters for robotic manipulation","venue":"cs.RO","work_id":"00ad32a8-7080-40ef-9a74-44b91fa21bb0","year":2024},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2409.14411","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:754c642f5781cb9072fdab37c2980772830291bdc305312d65e5a0466dd2d0df","observation_id":"fbfb63a1-1f00-4bd2-83ae-ad56fe9b29c9","resolution":{"observed_at":"2026-05-10T12:38:24.460447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":35,"verified_fuzzy":25},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 100 inbound Pith citation observations for arXiv:2410.24164."}