{"as_of":"2026-08-18T20:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fa542ecfa59a90306df08587e3cb1d3d90f1b7ce31179954af7c84ae455247f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":638,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:12:55.725471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":270,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2309.02427","last_updated":"2024-03-15T15:44:11Z","snapshot_observed_at":"2026-08-18T07:01:35.707347Z","submitted_at":"2023-09-05T17:56:20Z","title":"Cognitive Architectures for Language Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T19:33:44.146134Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2309.02427"},"observation_digest":"sha256:784abdbda003c204cc1d503ab2171f1387de01c318ea684967f1c293032b3889","observation_id":"96658184-8130-456b-a56a-c52d5da317bc","resolution":{"observed_at":"2026-05-16T19:33:44.278357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-08-14T07:41:23.792152Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:31.928650Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.01415"},"observation_digest":"sha256:1a341436f50dd8d49c75832b22e70ebe57d3295ea4915919c3d0092729f71307","observation_id":"ef194d76-9d83-44ad-b50e-1b4cf63ca8b8","resolution":{"observed_at":"2026-05-15T15:05:31.982543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.02635","last_updated":"2026-04-23T15:06:38Z","snapshot_observed_at":"2026-08-13T01:30:04.160043Z","submitted_at":"2023-10-04T07:56:42Z","title":"Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T06:40:00.328012Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.02635"},"observation_digest":"sha256:bbcc03f8622a99a78c1164d805894b2e3e181212c5d24d50d8c61fa8802ce96e","observation_id":"f50b1ee2-ebe6-4ea7-b375-ed4d48be7db3","resolution":{"observed_at":"2026-05-24T06:44:02.621634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-08-13T12:06:46.989903Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:8303c68fb7e277dbded9661c4f4aa5193c04700ec1758173b01da79961447cb8","observation_id":"649fbcd2-8058-433b-a436-24504b3c9aae","resolution":{"observed_at":"2026-05-16T02:15:18.658514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T17:23:24.255829Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.08864"},"observation_digest":"sha256:8d78a8909fb5d5196da7143c9dcc5a69ac519c1e2b0d18b51a3bfd61179d6b1d","observation_id":"23bba126-a8fd-4f01-b6e9-09e8094c89de","resolution":{"observed_at":"2026-05-11T17:23:24.449479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T05:54:58.940428Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.10639"},"observation_digest":"sha256:f94c8daa90d8007c6ee2ae6c659e73d1cbf6f0d2de567c0d6e4bef256e6b852f","observation_id":"38c972c4-232c-4ccb-9a83-c2208992c99e","resolution":{"observed_at":"2026-05-16T05:54:59.000154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-14T17:27:35.733800Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2310.16828"},"observation_digest":"sha256:27d2bb9da42468ed52e0bed8dc248c68ada7df94a1f4e8be7eeb5aa247996bdd","observation_id":"3fd271d6-e777-4d79-844f-8ab2ab44ba53","resolution":{"observed_at":"2026-05-14T17:27:35.993143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-08-13T00:43:50.403870Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:2bf27097df0d5e3120930a8be3b879f9c0b28fb3a76f80a53b66e42ddddd5499","observation_id":"21e3ab03-a12d-4689-9be7-9794c12146e1","resolution":{"observed_at":"2026-05-16T21:44:27.605460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T16:32:05.538507Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2312.13139"},"observation_digest":"sha256:ba8f14778162fb590e9a1c8c1e1d3a064ecfc723f038d9933f3f4552adb157aa","observation_id":"e5f92c29-2975-4e70-9586-65035dd4c01b","resolution":{"observed_at":"2026-05-13T16:32:05.595167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-16T14:32:38.574557Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-17T10:16:43.364787Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2312.13771"},"observation_digest":"sha256:81d278af3dd553706d341544cc5b548ab44b931c25759742f98d1c90442bc251","observation_id":"73ce41a8-5064-48c6-80d9-0e4fd8e93486","resolution":{"observed_at":"2026-05-17T10:16:43.896074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2401.02117","last_updated":"2024-01-04T07:55:53Z","snapshot_observed_at":"2026-08-15T12:54:53.410743Z","submitted_at":"2024-01-04T07:55:53Z","title":"Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T22:02:55.240949Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2401.02117"},"observation_digest":"sha256:ea196ec68d41be6e4730376ae0f833fa14c492e8bd012ef02ee17e16bb6efc79","observation_id":"bef27680-7526-4a59-889c-cf316c3614fa","resolution":{"observed_at":"2026-05-14T22:02:55.532844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-08-12T12:11:22.336410Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:c6097f6031d82737c890c90cbf916d852ec3b0221f88f111d8d824772333a3c0","observation_id":"916b2d1a-9167-419b-aad0-b5a2b05d2e1a","resolution":{"observed_at":"2026-05-18T14:25:59.347132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T19:22:35.305220Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2402.12289"},"observation_digest":"sha256:c76c0b5ccdbd547bbda61a845a1e3710a6232980b50a9a7cd9694ba9ea4b4a06","observation_id":"f022c4e6-8fd8-4677-aec9-aeda741ec060","resolution":{"observed_at":"2026-05-12T19:22:35.424710Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-08-18T12:12:42.503422Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:4417147af59f6b5075479860de85f736a5117a0743ba513d2f9d90dc28f1f149","observation_id":"b58cb528-c895-49c0-87a0-a7c36819cb45","resolution":{"observed_at":"2026-05-18T04:55:20.422893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-08-15T10:07:25.118684Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T06:53:27.642020Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2403.01823"},"observation_digest":"sha256:0c701e1e69cfca7f810bdf35294f924313f23a6ef76b273613df44fd2921e849","observation_id":"30ab2bec-9c11-49af-ba4c-a82f90499660","resolution":{"observed_at":"2026-05-17T06:53:27.772992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-13T15:09:51.205767Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:6d7c574944bfc78d0154c9723947217dfe913d452ccd2756924ae51776080353","observation_id":"fb41528e-1b26-46b0-ae0e-888efea28365","resolution":{"observed_at":"2026-05-13T18:18:27.264601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-14T22:26:00.902198Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:adcb9ffaf0a8c5f8ffc99cd253efb029a696faabd22056eccd70eb774f4cb7dd","observation_id":"37a39ef4-f617-4a6d-abd2-6c000a0eaf42","resolution":{"observed_at":"2026-05-13T01:19:32.450810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"reference_index":219,"source":"arxiv_source","source_observed_at":"2026-05-15T06:03:56.328012Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2405.07987"},"observation_digest":"sha256:e7bf72ae67833c548d35fd05d358c8650022fb61080f1178ca21c4f986ca857e","observation_id":"4882d3c3-7a9d-4410-9107-ade4035e05b6","resolution":{"observed_at":"2026-05-15T06:03:56.818142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:4bbc6a3a47807dfa51451a40bb396424cd63ac1f92b3cfa4bf0537b27c301292","observation_id":"cdb17367-46f1-4777-8115-4007acb99935","resolution":{"observed_at":"2026-05-24T01:25:54.285080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:5213f43efcb3c1b8f86fe7cc354e0603aeac25fe00bfc9bbdce668522ea2c086","observation_id":"69f71b86-68fc-4236-957a-6ae74cb5af71","resolution":{"observed_at":"2026-05-10T22:36:04.729348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:7a7b63d7216938d88c3f7178198737bcd47ed37deb4b382947396a497d41a699","observation_id":"54bf625c-a741-4d60-81c8-4c46b7298ba1","resolution":{"observed_at":"2026-05-17T03:51:25.440421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-16T08:25:17.847571Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2409.01652"},"observation_digest":"sha256:354af298f30cb0a18506c9279229e779854876f1ea81780e6b4e4f5fc8046670","observation_id":"8158301a-499c-477b-ba24-38f401b22131","resolution":{"observed_at":"2026-05-16T08:25:17.975301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T16:12:25.980853Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2409.12514"},"observation_digest":"sha256:00a374f060543f2477d6029b2023e113e2aad6f4e9c5351d9921bc2d293aaced","observation_id":"6bb2cd43-b995-43ca-9603-ddb731b32873","resolution":{"observed_at":"2026-05-17T16:12:26.080139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:47ae017ee7c114cf4054e79ab17e03b583ab5720007a17c13095a51e622e6dee","observation_id":"a130f85b-dd09-4f7b-9b58-01a4f0dcb0df","resolution":{"observed_at":"2026-05-17T12:04:10.698283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2409.13107","last_updated":"2026-05-11T01:55:34Z","snapshot_observed_at":"2026-08-16T16:50:58.134735Z","submitted_at":"2024-09-19T22:24:46Z","title":"Towards Robust Surgical Automation via Digital Twin Representations from Foundation Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T20:19:20.382009Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2409.13107"},"observation_digest":"sha256:9a316f6c570804d946517ed220fd10e076f6bbc13fdf99e5c9d6b619ae172429","observation_id":"668a0c42-cfd3-4db6-ab7e-484a94654fc8","resolution":{"observed_at":"2026-05-23T20:23:24.873272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:09:33.761708Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.06158"},"observation_digest":"sha256:03b0a723c55cb759da336908d31519d01e935bb7a98dae5a0905db09e384652f","observation_id":"cb94fd1d-303c-4ee1-8144-d70b041977cc","resolution":{"observed_at":"2026-05-12T01:09:33.896519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.14022","last_updated":"2026-05-10T15:05:10Z","snapshot_observed_at":"2026-08-15T03:48:24.026212Z","submitted_at":"2024-10-17T20:49:45Z","title":"Language Conditioned Multi-Finger Dexterous Manipulation Enabled by Physical Compliance and Switching of Controllers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T19:06:58.600946Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.14022"},"observation_digest":"sha256:3ab72c51cdb8ae41bc378365d7da78cf80795b24386c0c41103cc0ca55bbc2af","observation_id":"f9ac1071-0598-4bd7-bc05-8314ca9f4cb9","resolution":{"observed_at":"2026-05-23T19:08:21.025254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-18T19:02:31.209289Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T09:29:27.173784Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.23218"},"observation_digest":"sha256:bae8e2f6dfb27e7cfa5c9b0d5582cafd767f77020105d5a89d8009cd6dde4063","observation_id":"9e164021-00cd-4c88-bc85-f7c0beeb88f3","resolution":{"observed_at":"2026-05-13T09:29:27.362147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:600317f464eedef221ab2424313768baf51ee0b184d99d43b0313210aa0f95c1","observation_id":"0ead8dff-ba03-423b-94af-1257f7b9ddca","resolution":{"observed_at":"2026-05-10T22:36:04.729348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2411.04983","last_updated":"2025-02-01T02:40:49Z","snapshot_observed_at":"2026-08-13T16:10:49.002039Z","submitted_at":"2024-11-07T18:54:37Z","title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T16:06:09.448517Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.04983"},"observation_digest":"sha256:34b6d11239a65f414acda4c59e6ac3750ff93d9e2adced86dc6c55c63171d8da","observation_id":"ea61dd21-5e13-46dc-98ab-88fb0eb5a5a4","resolution":{"observed_at":"2026-05-17T16:06:09.618905Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T21:12:55.725471Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09022","last_updated":"2025-03-04T07:42:22Z","snapshot_observed_at":"2026-08-16T23:58:25.771206Z","submitted_at":"2024-11-13T20:59:30Z","title":"DART-LLM: Dependency-Aware Multi-Robot Task Decomposition and Execution using Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:12:55.725471Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.09022"},"observation_digest":"sha256:0d524dba8442b61465a4d456fea649601225f4b3a5b3bb5101634312ecc72a36","observation_id":"8ff72640-c87b-4848-8c52-9699682fb933","resolution":{"observed_at":"2026-08-12T21:12:55.725471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T21:10:46.109001Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09052","last_updated":"2024-11-13T22:15:31Z","snapshot_observed_at":"2026-08-16T02:42:01.659737Z","submitted_at":"2024-11-13T22:15:31Z","title":"ClevrSkills: Compositional Language and Visual Reasoning in Robotics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:10:46.109001Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.09052"},"observation_digest":"sha256:6477456f107746eeb835b05d2ab76cf6895c0188e65ce2aeb7f161c6bb391704","observation_id":"6caea9b3-b158-49f0-9e63-62b1e085c5b6","resolution":{"observed_at":"2026-08-12T21:10:46.109001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T21:04:21.793522Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09153","last_updated":"2024-11-14T03:13:26Z","snapshot_observed_at":"2026-08-17T17:11:35.275111Z","submitted_at":"2024-11-14T03:13:26Z","title":"VidMan: Exploiting Implicit Dynamics from Video Diffusion Model for Effective Robot Manipulation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T21:04:21.793522Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.09153"},"observation_digest":"sha256:840bdde36924a3dbef30bdab2beaf90c2905aaf4978301051a1ad38671bc9507","observation_id":"a77a7c43-8faa-4108-ae38-69fb5e90ff21","resolution":{"observed_at":"2026-08-12T21:04:21.793522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2411.10446","last_updated":"2026-04-16T20:29:38Z","snapshot_observed_at":"2026-08-16T04:57:33.155892Z","submitted_at":"2024-11-15T18:59:51Z","title":"VeriGraph: Scene Graphs for Execution Verifiable Robot Planning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T17:12:31.645346Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.10446"},"observation_digest":"sha256:51095456854dc399dd2453634762f0081ab66ce9557fb36bf7e84f43f32f9a8a","observation_id":"afa4cfbc-ac71-4591-86be-8a12bd8caafb","resolution":{"observed_at":"2026-05-23T17:13:13.782190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T19:10:14.525121Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10943","last_updated":"2024-11-17T02:44:56Z","snapshot_observed_at":"2026-08-16T10:37:51.980574Z","submitted_at":"2024-11-17T02:44:56Z","title":"Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T19:10:14.525121Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.10943"},"observation_digest":"sha256:4478def2f781412916ae878cdad5bac383369538491a159d85dfb7390e3f3a16","observation_id":"48753607-abc0-47e3-afbd-49236c0fdff5","resolution":{"observed_at":"2026-08-12T19:10:14.525121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T17:47:39.697108Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12293","last_updated":"2024-11-19T07:26:30Z","snapshot_observed_at":"2026-08-14T09:37:41.665043Z","submitted_at":"2024-11-19T07:26:30Z","title":"Generative Timelines for Instructed Visual Assembly","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:47:39.697108Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.12293"},"observation_digest":"sha256:ef55f0cb1b712eec5b19aa75e8b1c45dc08895cbac85941ef2f3e4c587867bbb","observation_id":"b0b3482d-54be-4f3a-b3bc-955f090c82cb","resolution":{"observed_at":"2026-08-12T17:47:39.697108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T17:06:34.128646Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12960","last_updated":"2024-11-20T01:27:56Z","snapshot_observed_at":"2026-08-14T05:03:50.107435Z","submitted_at":"2024-11-20T01:27:56Z","title":"I Can Tell What I am Doing: Toward Real-World Natural Language Grounding of Robot Experiences","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:06:34.128646Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.12960"},"observation_digest":"sha256:7d55964617080cc30d975f3b78af69f6ec553dbe496728d93b3d9d5c80444c8b","observation_id":"4f109449-c97b-4e95-a2f2-ca3fef466c4b","resolution":{"observed_at":"2026-08-12T17:06:34.128646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T15:24:14.226207Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14519","last_updated":"2025-04-01T17:59:17Z","snapshot_observed_at":"2026-08-16T14:43:25.444845Z","submitted_at":"2024-11-21T16:45:43Z","title":"Tra-MoE: Learning Trajectory Prediction Model from Multiple Domains for Adaptive Policy Conditioning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:24:14.226207Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.14519"},"observation_digest":"sha256:c6d98dbfc31e2f3158eeda371eb7366dd6d07f5849b009bf4b1f23b41dc8c637","observation_id":"91d73b72-41e1-486c-8197-770a754d7160","resolution":{"observed_at":"2026-08-12T15:24:14.226207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T12:44:26.364806Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16959","last_updated":"2025-05-20T01:17:09Z","snapshot_observed_at":"2026-08-18T03:26:46.303144Z","submitted_at":"2024-11-25T21:57:15Z","title":"RoCoDA: Counterfactual Data Augmentation for Data-Efficient Robot Learning from Demonstrations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:44:26.364806Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.16959"},"observation_digest":"sha256:65e24db899ecfaaf958fd2ba2c548a9d8b16d1b8934db0d752bc75c7d7142285","observation_id":"245c755d-aa35-49be-a360-233464c34a6a","resolution":{"observed_at":"2026-08-12T12:44:26.364806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T12:10:40.319251Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-08-16T10:14:53.516684Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:40.319251Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.17465"},"observation_digest":"sha256:f9e62a2f30c379a6d6982bbc6e118a1e1938492e12488aa75a75e24fe1ab9f0f","observation_id":"a76e26a7-79d4-4e8a-83e5-5a2e6a124367","resolution":{"observed_at":"2026-08-12T12:10:40.319251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T11:29:20.708898Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18179","last_updated":"2024-11-27T09:54:58Z","snapshot_observed_at":"2026-08-17T18:19:44.327070Z","submitted_at":"2024-11-27T09:54:58Z","title":"Prediction with Action: Visual Policy Learning via Joint Denoising Process","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:29:20.708898Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.18179"},"observation_digest":"sha256:05af6ced7787c71fdb7b5999f8140d2e956f9269573ea4fd45596d1c2db4e898","observation_id":"41614331-65d7-47e0-8eeb-976ab87d2f51","resolution":{"observed_at":"2026-08-12T11:29:20.708898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T11:05:51.525177Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18676","last_updated":"2025-02-10T16:32:27Z","snapshot_observed_at":"2026-08-12T17:46:44.125544Z","submitted_at":"2024-11-27T18:57:26Z","title":"Embodied Red Teaming for Auditing Robotic Foundation Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:05:51.525177Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.18676"},"observation_digest":"sha256:fdd9535239b7970bb527c736da1761fe723d134009176da5f6f68def77aff63b","observation_id":"fe84e8a9-6e0b-499a-9e62-6641a5e5dfe5","resolution":{"observed_at":"2026-08-12T11:05:51.525177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T10:23:15.557889Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-08-16T20:04:28.114227Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T10:23:15.557889Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.19309"},"observation_digest":"sha256:ca4750ebea3ac55b6b69e367122732aff7da5b7f572ac7721778bffcde206309","observation_id":"0194a111-af39-4318-8b9b-20d84a1e7633","resolution":{"observed_at":"2026-08-12T10:23:15.557889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T07:33:25.188358Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2411.19650"},"observation_digest":"sha256:478d9abe5a144cdaca4499ba4126c886a0f84902dbc2eec60e2dc67b02409976","observation_id":"929fd749-adcc-45c6-a506-7b00056469fe","resolution":{"observed_at":"2026-05-12T07:33:25.432800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T05:29:02.547059Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00395","last_updated":"2024-12-17T12:04:32Z","snapshot_observed_at":"2026-08-14T05:14:40.393379Z","submitted_at":"2024-11-30T08:34:10Z","title":"On Foundation Models for Dynamical Systems from Purely Synthetic Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:29:02.547059Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.00395"},"observation_digest":"sha256:0c5f96c34ef74bb3fdcd142cf52fbdf5d7a7af1b4aef87fd0b407b07c82d95dc","observation_id":"4561561e-a90b-4a51-905b-8febd9491325","resolution":{"observed_at":"2026-08-12T05:29:02.547059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T04:54:54.400442Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00949","last_updated":"2024-12-01T19:48:57Z","snapshot_observed_at":"2026-08-15T18:52:24.945260Z","submitted_at":"2024-12-01T19:48:57Z","title":"STEVE-Audio: Expanding the Goal Conditioning Modalities of Embodied Agents in Minecraft","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:54:54.400442Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.00949"},"observation_digest":"sha256:174de2edf3195a8e430b12fdcb4a908608ce7faf27a8faabd695944f10ed2b42","observation_id":"728e2d13-d0aa-4087-a869-d3d9acaae1ef","resolution":{"observed_at":"2026-08-12T04:54:54.400442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-12T04:48:33.574671Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01034","last_updated":"2024-12-02T01:33:49Z","snapshot_observed_at":"2026-08-14T15:17:01.572742Z","submitted_at":"2024-12-02T01:33:49Z","title":"Quantization-Aware Imitation-Learning for Resource-Efficient Robotic Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:48:33.574671Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.01034"},"observation_digest":"sha256:e90bfd6d41e11e0c6acda177a1294e131f9ee5734fcc24e808d903a89451f514","observation_id":"31b84b8e-6667-41da-a7ae-07a1a67e814a","resolution":{"observed_at":"2026-08-12T04:48:33.574671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.02125","last_updated":"2026-05-01T15:42:42Z","snapshot_observed_at":"2026-08-17T03:55:38.085306Z","submitted_at":"2024-12-03T03:27:48Z","title":"Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T08:20:05.898025Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.02125"},"observation_digest":"sha256:1fe510379e0a57ad971a001f33e28c045ad30aaa94896d74c88123301c9322a0","observation_id":"7da82f87-4651-4a8b-8fc2-a7b3a5b42c37","resolution":{"observed_at":"2026-05-23T08:22:44.360642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.02818","last_updated":"2026-05-18T18:24:46Z","snapshot_observed_at":"2026-08-17T08:39:33.945155Z","submitted_at":"2024-12-03T20:34:51Z","title":"RoboMD: Uncovering Robot Vulnerabilities through Semantic Potential Fields","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T07:49:37.878395Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.02818"},"observation_digest":"sha256:2eedf0ed34c01381efab637f5df37386aa733a69f8ec0832d9e8bc9d3c89130e","observation_id":"abfa9331-448a-47a8-98cf-831b0e642247","resolution":{"observed_at":"2026-05-23T07:52:43.886679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T22:38:30.997068Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03293","last_updated":"2025-06-04T08:30:06Z","snapshot_observed_at":"2026-08-16T21:12:40.974751Z","submitted_at":"2024-12-04T13:11:38Z","title":"Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T22:38:30.997068Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.03293"},"observation_digest":"sha256:831e43f9f357b72c8f7724a5df8bc415bb13c2049501dc00a73ccd44c2d1c769","observation_id":"d68b3fe0-05ac-4fab-8d7e-8ada58bf5b1b","resolution":{"observed_at":"2026-08-11T22:38:30.997068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T22:02:03.768214Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03937","last_updated":"2025-04-05T21:29:28Z","snapshot_observed_at":"2026-08-18T18:33:45.901323Z","submitted_at":"2024-12-05T07:35:19Z","title":"AIpparel: A Multimodal Foundation Model for Digital Garments","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:02:03.768214Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.03937"},"observation_digest":"sha256:238ad14c6d0c90df7a8cb66cc4b67232640b725b9f755a45623e14be40b5fcf4","observation_id":"27a61242-1ec9-4906-bc25-7f33746c3a3d","resolution":{"observed_at":"2026-08-11T22:02:03.768214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T21:29:55.478603Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04571","last_updated":"2025-03-03T17:15:10Z","snapshot_observed_at":"2026-08-14T22:13:21.409194Z","submitted_at":"2024-12-05T19:28:35Z","title":"Dissociating Artificial Intelligence from Artificial Consciousness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:55.478603Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.04571"},"observation_digest":"sha256:b9e98bfcb3b487b1ace57f25bcc0bb8b36425f8814f0f28e79e9d2e4cd1c24f8","observation_id":"b2b8ee52-f021-44c8-9733-42242a134d02","resolution":{"observed_at":"2026-08-11T21:29:55.478603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T20:37:54.614751Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-08-16T14:41:18.143042Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:37:54.614751Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.05563"},"observation_digest":"sha256:ffc770c808e7ee2ac7c25c209f29d8eef24b47f972c2cc0b0dec9cef0a4c116a","observation_id":"801fa62b-b580-48a0-9527-024e954c2582","resolution":{"observed_at":"2026-08-11T20:37:54.614751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T20:35:32.921030Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05625","last_updated":"2024-12-07T11:36:40Z","snapshot_observed_at":"2026-08-17T18:37:54.831883Z","submitted_at":"2024-12-07T11:36:40Z","title":"Can Large Language Models Help Developers with Robotic Finite State Machine Modification?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:35:32.921030Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.05625"},"observation_digest":"sha256:ced224a4e0e496af20977c687043fb3a07b55099ee076001cf81bbbf1e215d86","observation_id":"09ae7cd0-ac43-4720-b14d-2d730d95ad82","resolution":{"observed_at":"2026-08-11T20:35:32.921030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-16T16:28:01.153501Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T19:51:36.137985Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.06224"},"observation_digest":"sha256:d87ccb88aba22a9f5ffce114e009fa284a8950e199e692d7f63243edf56dc1be","observation_id":"5457b199-a646-4e3c-8f33-a7ca63a66dbb","resolution":{"observed_at":"2026-05-16T19:51:36.238946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T19:52:15.134730Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06324","last_updated":"2025-01-02T04:14:58Z","snapshot_observed_at":"2026-08-14T09:46:34.875823Z","submitted_at":"2024-12-09T09:18:58Z","title":"World knowledge-enhanced Reasoning Using Instruction-guided Interactor in Autonomous Driving","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T19:52:15.134730Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.06324"},"observation_digest":"sha256:286854233fa96108d0f9b5e266540c07c2f86f210f5eea2451a7605f73769efc","observation_id":"8083658f-daf3-49e9-8445-d586424e8d39","resolution":{"observed_at":"2026-08-11T19:52:15.134730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T19:22:28.172355Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06782","last_updated":"2025-08-10T06:09:58Z","snapshot_observed_at":"2026-08-17T08:56:24.817214Z","submitted_at":"2024-12-09T18:59:18Z","title":"CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:28.172355Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.06782"},"observation_digest":"sha256:7ca38f30f36b37f20c662a1512d5ab380821ffd54f8618e9f518909291048212","observation_id":"b519844a-7607-41f4-8b74-1cd4eb869f43","resolution":{"observed_at":"2026-08-11T19:22:28.172355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T19:23:12.074697Z","title":"Brohan, A., Brown, N., Carbajal, J., Chebotar, Y ., Chen, X., Choromanski, K., Ding, T., Driess, D., Dubey, A., Finn, C., Florence, P., Fu, C., Arenas, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06877","last_updated":"2025-06-06T11:05:49Z","snapshot_observed_at":"2026-08-15T23:41:41.652533Z","submitted_at":"2024-12-09T18:43:56Z","title":"The Synergy of LLMs & RL Unlocks Offline Learning of Generalizable Language-Conditioned Policies with Low-fidelity Data","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T19:23:12.074697Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.06877"},"observation_digest":"sha256:e15e9b4b60de0634c27bf4370aa74274d57c4cd1eed54f1e3094c680989291a3","observation_id":"da14a212-209f-4beb-88aa-6134e084f8d5","resolution":{"observed_at":"2026-08-11T19:23:12.074697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T17:55:13.202991Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08442","last_updated":"2024-12-11T15:06:25Z","snapshot_observed_at":"2026-08-16T15:18:46.024318Z","submitted_at":"2024-12-11T15:06:25Z","title":"From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:55:13.202991Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.08442"},"observation_digest":"sha256:9a037a5ba22445cc60bab454c7a94dbc72b59a05675bb4f5b84af0d0b9865b58","observation_id":"f51e188b-b378-4b15-b5b3-e540e52c8e9b","resolution":{"observed_at":"2026-08-11T17:55:13.202991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T17:09:58.177565Z","title":"R T -2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09286","last_updated":"2025-05-21T03:15:25Z","snapshot_observed_at":"2026-08-12T22:04:59.210825Z","submitted_at":"2024-12-12T13:56:36Z","title":"Learning Novel Skills from Language-Generated Demonstrations","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:09:58.177565Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.09286"},"observation_digest":"sha256:f74f7e617d83e4398fa17dd53a750033c3dcd40f8b77cf5588aa18c70727a3a9","observation_id":"fb39e0f2-581a-4627-b27e-05764f095e0d","resolution":{"observed_at":"2026-08-11T17:09:58.177565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T16:58:05.438400Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-17T19:44:42.836082Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:05.438400Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.09600"},"observation_digest":"sha256:98e8c4d3f01b23b699ba1a4b725f40ed36c9f503469bae2efd4a70a0941b23c4","observation_id":"1b262064-4d81-44c2-b0f3-38a88d99d9f2","resolution":{"observed_at":"2026-08-11T16:58:05.438400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T16:54:39.688502Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09620","last_updated":"2024-12-12T18:59:54Z","snapshot_observed_at":"2026-08-18T18:18:20.201503Z","submitted_at":"2024-12-12T18:59:54Z","title":"Learning Camera Movement Control from Real-World Drone Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:54:39.688502Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.09620"},"observation_digest":"sha256:32d339c85ef31a71646e77348faf40ca0f593857c8aa5e1369c32a6df96f585e","observation_id":"14a40144-bb53-4fc7-8b60-7c81d6f01980","resolution":{"observed_at":"2026-08-11T16:54:39.688502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T16:55:42.161217Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09627","last_updated":"2024-12-12T18:59:59Z","snapshot_observed_at":"2026-08-14T07:24:23.254068Z","submitted_at":"2024-12-12T18:59:59Z","title":"Doe-1: Closed-Loop Autonomous Driving with Large World Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:55:42.161217Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.09627"},"observation_digest":"sha256:37c60e0d918c7e228fc7efaf485dc641197a7ffd1e5eb4dbc6f94dd30e1c4fa9","observation_id":"c7e826cf-3740-4b27-a9a6-83344279e1bd","resolution":{"observed_at":"2026-08-11T16:55:42.161217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T16:45:08.178444Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09858","last_updated":"2024-12-13T04:57:55Z","snapshot_observed_at":"2026-08-15T17:49:17.818572Z","submitted_at":"2024-12-13T04:57:55Z","title":"RLDG: Robotic Generalist Policy Distillation via Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:08.178444Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.09858"},"observation_digest":"sha256:90f9a5697b2979e011c9dc85961520a504c7d46249a0b99a7241395b8ecc0495","observation_id":"4d00c172-07b8-4636-b490-b7b01f03a7f9","resolution":{"observed_at":"2026-08-11T16:45:08.178444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-12T18:17:40.083518Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:ecc89d911fca92dacf34edb9b7d81a387c9856a4dfa73eef6d41840ddb254883","observation_id":"f09baac6-b13e-4ac8-9ffd-647ba224fe8e","resolution":{"observed_at":"2026-05-15T18:27:22.867493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T20:41:45.013831Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-18T17:13:15.808276Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.013831Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:b06814c89075246a2381f9cc01a7959f974b114f804cd79c0b9f7d83ba5d1427","observation_id":"1732c799-21f6-4b38-b370-1f9ef5864090","resolution":{"observed_at":"2026-08-11T20:41:45.013831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T15:05:13.175421Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11337","last_updated":"2024-12-15T23:05:16Z","snapshot_observed_at":"2026-08-18T15:44:45.483483Z","submitted_at":"2024-12-15T23:05:16Z","title":"Modality-Driven Design for Multi-Step Dexterous Manipulation: Insights from Neuroscience","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:05:13.175421Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.11337"},"observation_digest":"sha256:0ff76cc0b12c7be6ca82a4183c33dcf5ecc150849888f1f37e7575421eabc1d2","observation_id":"ce788729-3152-4c03-b513-db31a68808d6","resolution":{"observed_at":"2026-08-11T15:05:13.175421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T14:29:18.238803Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11974","last_updated":"2024-12-17T14:12:56Z","snapshot_observed_at":"2026-08-12T14:28:34.481864Z","submitted_at":"2024-12-16T16:58:28Z","title":"Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:29:18.238803Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.11974"},"observation_digest":"sha256:06b50fdcb19a4ba501f39fbe07c7cb9a0f95fa8f980ef1e6055bf8b3f974a7b7","observation_id":"7cc30af0-d5ea-43f4-8c55-f0707043de11","resolution":{"observed_at":"2026-08-11T14:29:18.238803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T18:34:45.132484Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12147","last_updated":"2024-12-10T19:10:17Z","snapshot_observed_at":"2026-08-15T11:21:02.686128Z","submitted_at":"2024-12-10T19:10:17Z","title":"Meta-Controller: Few-Shot Imitation of Unseen Embodiments and Tasks in Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:34:45.132484Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.12147"},"observation_digest":"sha256:35db2075a96acd80d5485d951c91a1259cedae12135fa015d5f9412ed2e15a08","observation_id":"69986738-ce32-4f7d-a3b5-9c5142ebea0b","resolution":{"observed_at":"2026-08-11T18:34:45.132484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T14:08:35.019456Z","title":"RT-2 : Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12448","last_updated":"2025-04-09T16:54:38Z","snapshot_observed_at":"2026-08-16T22:12:21.583643Z","submitted_at":"2024-12-17T01:24:02Z","title":"Task-Parameter Nexus: Task-Specific Parameter Learning for Model-Based Control","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:08:35.019456Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.12448"},"observation_digest":"sha256:eb8e52d04fee437aed2856fdd9bae0fab5a05bf381fb39da41db5d7940323d4b","observation_id":"d68e3086-cdbd-443c-bf8d-f0aa26cbe441","resolution":{"observed_at":"2026-08-11T14:08:35.019456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T13:38:41.081209Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12953","last_updated":"2024-12-17T14:34:51Z","snapshot_observed_at":"2026-08-15T00:08:31.858899Z","submitted_at":"2024-12-17T14:34:51Z","title":"Efficient Diffusion Transformer Policies with Mixture of Expert Denoisers for Multitask Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:41.081209Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.12953"},"observation_digest":"sha256:d38a6c1a19667d6b59eb8125a64734ff48830df338ee9daf02c999c25daacda6","observation_id":"d2f43dcf-3eab-497d-80b0-bbe697b6ac30","resolution":{"observed_at":"2026-08-11T13:38:41.081209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T13:25:27.337527Z","title":"Rt- 2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13187","last_updated":"2024-12-18T15:19:55Z","snapshot_observed_at":"2026-08-18T19:18:08.134932Z","submitted_at":"2024-12-17T18:58:33Z","title":"HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T13:25:27.337527Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.13187"},"observation_digest":"sha256:1f08ccf02e40508edfb1c57d305bebb528185ee3bffc8e406dee79a4d3566068","observation_id":"635f13ad-a235-49ee-8cee-bfc845328e1a","resolution":{"observed_at":"2026-08-11T13:25:27.337527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.14058","last_updated":"2026-02-13T02:05:15Z","snapshot_observed_at":"2026-08-17T09:33:59.536762Z","submitted_at":"2024-12-18T17:07:20Z","title":"What Matters in Building Vision-Language-Action Models for Generalist Robots","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:50.617813Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.14058"},"observation_digest":"sha256:e3917521e94fc341e10e5350452334fefaa1ad471fbb3e84b140467d5c1b13ba","observation_id":"8f70d6d8-e7a0-4264-823a-6d06bd4319d0","resolution":{"observed_at":"2026-05-17T21:37:50.706165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T12:20:28.032342Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14401","last_updated":"2025-05-23T21:41:56Z","snapshot_observed_at":"2026-08-16T19:48:06.405152Z","submitted_at":"2024-12-18T23:15:41Z","title":"The One RING: a Robotic Indoor Navigation Generalist","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:20:28.032342Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.14401"},"observation_digest":"sha256:06529498b5d3918925a2011bffebc239548f108fde4ceb00db6d990e339835fa","observation_id":"efb69738-553e-4497-a1e3-e7834093d8a5","resolution":{"observed_at":"2026-08-11T12:20:28.032342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-08-13T21:27:22.538668Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-12T18:38:11.110166Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.14803"},"observation_digest":"sha256:5dacf599abe89b186f7a4dcb838dd90d2484c380f33dc0c910ef5d59a77fad72","observation_id":"870883cb-c452-47dd-b7f6-86fa504fe8fa","resolution":{"observed_at":"2026-05-12T18:38:11.219125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T11:12:32.723483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15714","last_updated":"2024-12-23T10:45:32Z","snapshot_observed_at":"2026-08-14T05:36:41.603996Z","submitted_at":"2024-12-20T09:37:02Z","title":"AutoLife: Automatic Life Journaling with Smartphones and LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:12:32.723483Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.15714"},"observation_digest":"sha256:5f778e42528270c6fb6f31a67071cc7075e1281ebc9aaabb6f11b8119a88738d","observation_id":"7e666c42-3e23-4fbd-8ecd-6c47303b384c","resolution":{"observed_at":"2026-08-11T11:12:32.723483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T05:58:54.961904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16964","last_updated":"2024-12-24T11:43:25Z","snapshot_observed_at":"2026-08-17T16:43:01.758405Z","submitted_at":"2024-12-22T10:49:27Z","title":"System-2 Mathematical Reasoning via Enriched Instruction Tuning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:58:54.961904Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.16964"},"observation_digest":"sha256:375b572194dbd34df8a6b4351bdaa5862cb7719bbe8251eca29fc1997603b95c","observation_id":"462edb99-56b0-4f08-b2a2-3ab34c1da5ce","resolution":{"observed_at":"2026-08-11T05:58:54.961904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T05:08:17.537399Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.537399Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0ebe66d34bb07c7451554cc6270cafbce01be83f516cb5be48bf281bad1d93bf","observation_id":"1d4422b2-3183-4872-b068-6c6730d3f162","resolution":{"observed_at":"2026-08-11T05:08:17.537399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T05:00:46.620506Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18194","last_updated":"2024-12-24T06:03:42Z","snapshot_observed_at":"2026-08-15T19:11:06.150955Z","submitted_at":"2024-12-24T06:03:42Z","title":"VLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:00:46.620506Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.18194"},"observation_digest":"sha256:a38c115c2c76c94c4c3fc1ef1d8edea884a701a265d313d7427d750b63024d6c","observation_id":"ddba8c1b-5791-42cf-9a91-2b6cc081af45","resolution":{"observed_at":"2026-08-11T05:00:46.620506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T14:59:01.245779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-17T08:41:51.069276Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.245779Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:82ef52f3bf75ea41f3c90652f71dd10723d35657edced0c8ada91377570d713f","observation_id":"ce96daae-8f69-4ae3-b931-b06f74a29a5f","resolution":{"observed_at":"2026-08-11T14:59:01.245779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T23:27:21.391885Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20297","last_updated":"2024-12-28T23:26:52Z","snapshot_observed_at":"2026-08-14T09:21:28.486225Z","submitted_at":"2024-12-28T23:26:52Z","title":"FaGeL: Fabric LLMs Agent empowered Embodied Intelligence Evolution with Autonomous Human-Machine Collaboration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:27:21.391885Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.20297"},"observation_digest":"sha256:24e82dbdc40cfc0d235d1e8ec86996b278be9a09b0ca0c14ece2abf1accdc233","observation_id":"6322b4e8-2a9f-46d4-ad72-c8609b6e963c","resolution":{"observed_at":"2026-08-10T23:27:21.391885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T23:26:37.339539Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-18T10:46:45.282704Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:26:37.339539Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.20451"},"observation_digest":"sha256:a917901924c66eb28763afb2da62617e227c9e3caf8594929d34b57abfbdc5aa","observation_id":"afa221d4-4a07-4cff-aeff-66825466c7bf","resolution":{"observed_at":"2026-08-10T23:26:37.339539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T23:16:54.991648Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20750","last_updated":"2026-07-03T08:31:34Z","snapshot_observed_at":"2026-08-16T07:26:08.250432Z","submitted_at":"2024-12-30T06:44:25Z","title":"Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:16:54.991648Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.20750"},"observation_digest":"sha256:30b99f1974faa87f472caaed05e4e65083f208f1ed04a426acd4a4295b1388b8","observation_id":"1c5ee29e-1ccd-49a0-9ad1-fff95276bad7","resolution":{"observed_at":"2026-08-10T23:16:54.991648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:50:41.032130Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03841","last_updated":"2025-01-07T14:50:33Z","snapshot_observed_at":"2026-08-17T23:46:16.951630Z","submitted_at":"2025-01-07T14:50:33Z","title":"OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:50:41.032130Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.03841"},"observation_digest":"sha256:097607e702b5f30b54bd90745a6286347ef433bee4d355f0f67db3ff2cc12510","observation_id":"ec9c6166-5c3c-4088-9934-5f9b2747f732","resolution":{"observed_at":"2026-08-10T21:50:41.032130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:44:55.692943Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04003","last_updated":"2025-01-07T18:59:55Z","snapshot_observed_at":"2026-08-17T18:35:59.270100Z","submitted_at":"2025-01-07T18:59:55Z","title":"Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:44:55.692943Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.04003"},"observation_digest":"sha256:67a70d9cdc2bd069328eb48078047610bd1b2972bebeea687252ebaa57cabc3d","observation_id":"b3bb3328-d326-4921-952d-9afe55280f7d","resolution":{"observed_at":"2026-08-10T21:44:55.692943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:41:28.989604Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04268","last_updated":"2025-01-08T04:30:45Z","snapshot_observed_at":"2026-08-15T00:07:57.337651Z","submitted_at":"2025-01-08T04:30:45Z","title":"Robotic Programmer: Video Instructed Policy Code Generation for Robotic Manipulation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:28.989604Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.04268"},"observation_digest":"sha256:b185d5d00f7f5e340c44c4ef67be78082801b450dd3425efae5b3948a6a4fd44","observation_id":"db453c77-7842-449e-8aad-968d3c912f7a","resolution":{"observed_at":"2026-08-10T21:41:28.989604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:37:05.443176Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04437","last_updated":"2025-01-08T11:37:35Z","snapshot_observed_at":"2026-08-15T15:09:52.340962Z","submitted_at":"2025-01-08T11:37:35Z","title":"Integrating LLMs with ITS: Recent Advances, Potentials, Challenges, and Future Directions","version":1},"reference_index":273,"source":"pdf_text","source_observed_at":"2026-08-10T21:37:05.443176Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.04437"},"observation_digest":"sha256:224a7a8168fd11b134bddbdf77e056e6753e717b9f484a88589ea94d8ea99e02","observation_id":"14aca93b-3052-4b89-83b0-feb16f436a09","resolution":{"observed_at":"2026-08-10T21:37:05.443176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:30:20.698532Z","title":"Rt-2: Vision- language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04693","last_updated":"2025-01-14T22:28:39Z","snapshot_observed_at":"2026-08-16T01:02:07.469457Z","submitted_at":"2025-01-08T18:57:33Z","title":"Beyond Sight: Finetuning Generalist Robot Policies with Heterogeneous Sensors via Language Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:20.698532Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.04693"},"observation_digest":"sha256:35678c6c2383afa5eededd910318a468e1c6eb0c6d06e276dc56184e5fcdf2be","observation_id":"b557a1db-8b23-4c04-b92a-d3b8486721ca","resolution":{"observed_at":"2026-08-10T21:30:20.698532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T21:23:29.333458Z","title":"RT-2: Vision-Language-Action Mod- els Transfer Web Knowledge to Robotic Control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05014","last_updated":"2025-05-13T06:54:45Z","snapshot_observed_at":"2026-08-15T08:02:57.745642Z","submitted_at":"2025-01-09T07:15:59Z","title":"UAV-VLA: Vision-Language-Action System for Large Scale Aerial Mission Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:29.333458Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.05014"},"observation_digest":"sha256:e7746d2bee04e8ced5643b5677cf878941564d454c8270edf9f2597d3a78d308","observation_id":"12713fc5-4687-4d6c-baa2-32f687342492","resolution":{"observed_at":"2026-08-10T21:23:29.333458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T20:53:25.875000Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06919","last_updated":"2025-01-12T20:07:22Z","snapshot_observed_at":"2026-08-10T20:47:37.671873Z","submitted_at":"2025-01-12T20:07:22Z","title":"Shake-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Manipulations and Liquid Mixing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:25.875000Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.06919"},"observation_digest":"sha256:fea3338da6d698d28b02ed5e8bff70612d8fb8f2565657413a4342297ebdeade","observation_id":"14c7e728-3a75-436b-9d65-cdf6aa305cc5","resolution":{"observed_at":"2026-08-10T20:53:25.875000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T20:43:09.918001Z","title":"Brohan, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07468","last_updated":"2025-03-02T16:57:11Z","snapshot_observed_at":"2026-08-16T03:54:22.575337Z","submitted_at":"2025-01-13T16:35:52Z","title":"From Screens to Scenes: A Survey of Embodied AI in Healthcare","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:43:09.918001Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.07468"},"observation_digest":"sha256:5ede72ce346bc953208933f026b3b0c09818682415417ef2d76f3c04122a650e","observation_id":"7b1adefa-12e1-468b-903b-79afe464c0f0","resolution":{"observed_at":"2026-08-10T20:43:09.918001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T20:27:05.556413Z","title":"Rt-2: Vision-language- action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08558","last_updated":"2025-01-15T03:49:08Z","snapshot_observed_at":"2026-08-15T01:55:50.264269Z","submitted_at":"2025-01-15T03:49:08Z","title":"LAMS: LLM-Driven Automatic Mode Switching for Assistive Teleoperation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:27:05.556413Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.08558"},"observation_digest":"sha256:bdf3c135e5ca357b6093e132c2282d914f2875ae88123d723708fc95036fde6c","observation_id":"289d7746-07bd-40cb-9d58-e247f5c2a9cd","resolution":{"observed_at":"2026-08-10T20:27:05.556413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T20:20:48.502809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08861","last_updated":"2025-01-15T15:20:46Z","snapshot_observed_at":"2026-08-13T14:16:32.035959Z","submitted_at":"2025-01-15T15:20:46Z","title":"Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:20:48.502809Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.08861"},"observation_digest":"sha256:28c771a6f3c3e09b0bf91aed508950029c893d9f13c21a610a46b32bfe41d66b","observation_id":"447861ab-e23e-4abc-8f8a-4e8759b184d7","resolution":{"observed_at":"2026-08-10T20:20:48.502809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T20:15:04.519489Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09167","last_updated":"2025-01-15T21:36:19Z","snapshot_observed_at":"2026-08-15T14:06:19.800460Z","submitted_at":"2025-01-15T21:36:19Z","title":"Embodied Scene Understanding for Vision Language Models via MetaVQA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:04.519489Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.09167"},"observation_digest":"sha256:ce8c967e5a073ab2d28afd70e07280b3b0846f1ccf4b56081e9d154264b7253a","observation_id":"d489a10d-73b8-4a93-985f-b51d0b174dad","resolution":{"observed_at":"2026-08-10T20:15:04.519489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:13dd0eb7c113f6b4469735c92eda5699e73fd44667dfa4db84d2df28ab8eaeb0","observation_id":"e0b41df9-e0d6-4477-9494-b451fa7e1ab9","resolution":{"observed_at":"2026-05-11T08:52:31.904673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T19:47:36.403062Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09783","last_updated":"2025-01-16T18:59:51Z","snapshot_observed_at":"2026-08-15T10:36:09.653529Z","submitted_at":"2025-01-16T18:59:51Z","title":"GeoManip: Geometric Constraints as General Interfaces for Robot Manipulation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T19:47:36.403062Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.09783"},"observation_digest":"sha256:cc1ea0092e18c21c7ef4a28e282a774ff80b040023b6c6e111c5574c5e1b2029","observation_id":"0f9a2674-08bf-4b9d-a39a-624b30438b75","resolution":{"observed_at":"2026-08-10T19:47:36.403062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T19:29:39.705636Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-14T09:40:41.520844Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:39.705636Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.10105"},"observation_digest":"sha256:e820bd2507a51c06802573da79900c6c1d336eae5b0f0073c0261e5436722e6d","observation_id":"065db545-3594-4e8d-a719-9ef9786643fc","resolution":{"observed_at":"2026-08-10T19:29:39.705636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T18:04:33.831351Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:33.831351Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:51f2d42aefca20bebb9863b81bc086c5251a1269887386c851bc43a7530014a3","observation_id":"5768a73a-6f9f-4afe-a8fe-95db8df26036","resolution":{"observed_at":"2026-08-10T18:04:33.831351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-10T14:46:02.607231Z","title":"Rt-2: Vision-language-action models trans- fer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15021","last_updated":"2025-01-25T02:01:56Z","snapshot_observed_at":"2026-08-18T00:50:04.374064Z","submitted_at":"2025-01-25T02:01:56Z","title":"AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:02.607231Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.15021"},"observation_digest":"sha256:bd7d8a11869ccc331224b33e57b9c4f0aa9a7d9515ba76906f8331133e069aec","observation_id":"e5535967-32e9-4051-8d77-8d402f89e2af","resolution":{"observed_at":"2026-08-10T14:46:02.607231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-08-17T12:53:34.218587Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T06:12:19.643111Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2501.15830"},"observation_digest":"sha256:4cd581e301e3d63456935aa17e1ec168acf45c4b8ec26ad8ce8a5447042866e2","observation_id":"bf8d3fb4-5f69-4029-a1e2-c59cca2d2d0c","resolution":{"observed_at":"2026-05-12T06:12:19.863742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2307.15818/citation-record","integrity":"/paper/2307.15818/integrity","json":"/paper/2307.15818/citation-record.json","paper":"/paper/2307.15818"},"outbound":[],"paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 100 inbound Pith citation observations for arXiv:2307.15818."}