{"as_of":"2026-08-06T09:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb56dcce0c4f34a98f5f7cd5d4dd4654f7990116caea93acda5a21f268cfdd31","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:01:16.802019Z","state":"measured"},{"denominator":128,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":128,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:52:35.528275Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T21:00:09.552907Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2605.27947","last_updated":"2026-07-14T03:37:07Z","snapshot_observed_at":"2026-08-01T02:48:11.611191Z","submitted_at":"2026-05-27T04:40:48Z","title":"SANTS: A State-Adaptive Scheduler for World Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T11:57:36.200662Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2605.27947"},"observation_digest":"sha256:be2e206053c06b0c2314db09705758fe7816ede951ed6959053c4af715853a55","observation_id":"400664ee-09ab-4b59-8374-801b7dba9be1","resolution":{"observed_at":"2026-06-29T12:03:24.124667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-15T11:04:29.593725Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27947","last_updated":"2026-07-14T03:37:07Z","snapshot_observed_at":"2026-08-01T02:48:11.611191Z","submitted_at":"2026-05-27T04:40:48Z","title":"SANTS: A State-Adaptive Scheduler for World Action Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T11:04:29.593725Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2605.27947"},"observation_digest":"sha256:6f3aee4f7ded20c3d0f4e063d97e1ebb750209b4018f36150301feecf19760f3","observation_id":"904d1ce7-50c0-463e-9bf0-46594bc5e76a","resolution":{"observed_at":"2026-07-15T11:04:29.593725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2605.28865","last_updated":"2026-07-03T06:42:37Z","snapshot_observed_at":"2026-07-12T16:11:28.265753Z","submitted_at":"2026-05-22T03:31:47Z","title":"Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T15:42:56.314557Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2605.28865"},"observation_digest":"sha256:c1e49810d8c955caa95aa9a3189c0d70e13ad066bb74997e5ff2e7b14a8b0f38","observation_id":"f45ad530-115d-4c99-ac89-84656a2c7c61","resolution":{"observed_at":"2026-06-30T15:44:48.249222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:003f5aef47e66c68f170761aaf220fff236520e1ae7ad8e4bbcdc61eefbf98d3","observation_id":"73838e77-2f03-46ef-a675-af443e7171d3","resolution":{"observed_at":"2026-07-01T21:16:14.900379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.03371","last_updated":"2026-06-25T08:09:13Z","snapshot_observed_at":"2026-07-06T23:43:36.420646Z","submitted_at":"2026-06-02T09:18:39Z","title":"See, Infer, Intervene: Proactive World Modeling for Goal-Oriented Social Intelligence","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T10:25:36.747191Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.03371"},"observation_digest":"sha256:509fa2ff24337adbb7b86bd04976f1d1abdeb270805cece0a14d5480cdeb2f52","observation_id":"d8b74d70-ba96-4eea-8482-8d329008acef","resolution":{"observed_at":"2026-07-02T02:56:29.731332Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.07089","last_updated":"2026-06-05T09:35:48Z","snapshot_observed_at":"2026-08-03T20:55:19.434948Z","submitted_at":"2026-06-05T09:35:48Z","title":"Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:59:35.783793Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.07089"},"observation_digest":"sha256:714c619c92b80da5fd6dedfe5c02c7556c9bf4b64d6aa74bc6c6ca8f6ceee29e","observation_id":"e3586fe9-adde-43e8-a8ce-42a9debc05ab","resolution":{"observed_at":"2026-07-02T17:37:14.351039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.09457","last_updated":"2026-06-24T12:51:19Z","snapshot_observed_at":"2026-08-02T02:13:19.124258Z","submitted_at":"2026-06-08T13:12:56Z","title":"$\\omega$-EVA: Envision, Verify, and Act with Latent Interactive World Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T16:10:02.176202Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.09457"},"observation_digest":"sha256:d7b474ca21df0d636fe73d1c7fee4e117c40b10387eedfd4f2388c16f4c47a8a","observation_id":"04c0af78-6ba4-44aa-a7b4-65ba0499e32d","resolution":{"observed_at":"2026-07-03T02:07:33.770339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.10040","last_updated":"2026-06-10T06:52:36Z","snapshot_observed_at":"2026-08-02T13:46:42.752891Z","submitted_at":"2026-06-08T18:14:08Z","title":"Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:04:35.615512Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.10040"},"observation_digest":"sha256:c7104e5fd8543db23481a5700fdab818b2c2235aeb06ee5de5c2a20cc9d40264","observation_id":"bc46d8c6-5282-4191-8c7f-4b838f72692c","resolution":{"observed_at":"2026-07-03T02:17:34.436601Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.12028","last_updated":"2026-06-10T12:51:25Z","snapshot_observed_at":"2026-07-06T23:51:02.805629Z","submitted_at":"2026-06-10T12:51:25Z","title":"VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T09:32:03.146878Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.12028"},"observation_digest":"sha256:df861c37e8834adca3dde72a5e444719884f21bda703d87f3f2b851e4b4cd797","observation_id":"569e4173-b8c7-485f-aea6-2f3fa94fca9f","resolution":{"observed_at":"2026-07-03T11:28:04.543397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-05T10:29:17.827399Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:47:05.236028Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.13674"},"observation_digest":"sha256:9cda8cb48848619f168903c98c097c99198da7892154d99b46fe63b113d4fc91","observation_id":"f9610b29-7b6e-45a3-8287-2f5d5575e4cb","resolution":{"observed_at":"2026-07-03T14:58:33.428954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.24742","last_updated":"2026-06-23T16:07:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-23T16:07:48Z","title":"World Value Models for Robotic Manipulation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-25T23:33:50.854261Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.24742"},"observation_digest":"sha256:fc510cb9d034199bd09cd8ed25cd86220e3cc0d2e9b7311485def1762d12f251","observation_id":"a760c1ca-7a94-494b-8d61-50e26c19ab08","resolution":{"observed_at":"2026-07-04T17:40:00.357437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T19:12:22.513577Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:be9ca429d5bed69916716a1bff8161ba3d65ee9740d8c7eafaab376c10dfe663","observation_id":"5d7d499b-0011-4a4c-bbf1-7009c3ccc06e","resolution":{"observed_at":"2026-07-04T21:00:09.554296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T05:11:07.089829Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:7a9d0f3248fa3b7335e3b91e4b807652462279e1b7cc40094097cb1c4ff66999","observation_id":"62367699-e2e5-4225-bd80-3986750b2959","resolution":{"observed_at":"2026-07-04T13:29:51.597813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-12T12:05:57.682386Z","title":"World action models: The next frontier in embodied ai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T12:05:57.682386Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:dc8317288198d2264722aee333272c7b3565725875c37be8fe9f0e6a5da38256","observation_id":"a8472bcc-b993-47b1-8e27-10ebe7917b59","resolution":{"observed_at":"2026-07-12T12:05:57.682386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.27251","last_updated":"2026-06-25T16:36:35Z","snapshot_observed_at":"2026-08-06T01:13:16.369620Z","submitted_at":"2026-06-25T16:36:35Z","title":"Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T04:52:51.524022Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.27251"},"observation_digest":"sha256:4fe50b70a1a5ec666bc53f38039bdb199f29b0c2d47055354fe8362c9af4d784","observation_id":"729382a0-a60b-4844-8820-9770810b51fd","resolution":{"observed_at":"2026-07-04T13:49:52.049957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2607.02195","last_updated":"2026-07-02T14:03:44Z","snapshot_observed_at":"2026-08-04T02:33:13.605142Z","submitted_at":"2026-07-02T14:03:44Z","title":"Bridge-WA: Predicting Where and How the World Changes for Robotic Action","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T11:28:50.286894Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.02195"},"observation_digest":"sha256:867ffa0fe929a7c4b6ee7bab33c0ac19f021773cf8a8e11856160c4482bf9b37","observation_id":"d5d3c1c8-dbc2-4f80-863b-4db211eb1306","resolution":{"observed_at":"2026-07-03T11:38:04.542408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T10:37:31.925624Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:dbaf257fcfba4e16c05c350ffc504234feaf7cfe94c23c93fd9cceebe16919f1","observation_id":"3c360508-882c-4fa8-8d1d-f6eaa5232f30","resolution":{"observed_at":"2026-07-03T10:37:56.098280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-12T08:00:25.815355Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02501","last_updated":"2026-07-03T02:16:41Z","snapshot_observed_at":"2026-07-12T08:00:25.240507Z","submitted_at":"2026-07-02T17:58:28Z","title":"Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T08:00:25.815355Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.02501"},"observation_digest":"sha256:2740779c3c5f80be1679c7fb8c91920aaeb8b73e7561136878a6e384effa584a","observation_id":"64ad0141-8c17-4c08-b7de-805a0eec352f","resolution":{"observed_at":"2026-07-12T08:00:25.815355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2607.02503","last_updated":"2026-07-02T17:58:36Z","snapshot_observed_at":"2026-08-02T23:26:02.522488Z","submitted_at":"2026-07-02T17:58:36Z","title":"VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T10:33:28.236522Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.02503"},"observation_digest":"sha256:67f5e44e2363f40d7b81a7f74e88cc8fe166f23298bbd310b1f1cb4cec344599","observation_id":"28edc7eb-59f2-4f6d-86ce-2c8ef028a9f5","resolution":{"observed_at":"2026-07-03T10:37:56.178544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-11T20:32:22.412216Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04265","last_updated":"2026-07-05T12:24:14Z","snapshot_observed_at":"2026-08-03T14:46:31.336834Z","submitted_at":"2026-07-05T12:24:14Z","title":"HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T20:32:22.412216Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.04265"},"observation_digest":"sha256:3c5f0a6afb715ab413ddc4a4e0cfb01ba3d79928d1fc025ede7585017ef9f836","observation_id":"1899715e-cec5-4a35-9f81-d73a61e7bb05","resolution":{"observed_at":"2026-07-11T20:32:22.412216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-11T14:23:57.266710Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05468","last_updated":"2026-07-06T07:10:22Z","snapshot_observed_at":"2026-07-11T14:23:54.006633Z","submitted_at":"2026-07-06T07:10:22Z","title":"Learning 4D Geometric Priors for Inference-Efficient World Action Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T14:23:57.266710Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.05468"},"observation_digest":"sha256:1f90c3ad1861c99b28ab355fbe1fa7f82bc250028fe846dd5988056c05dea7dc","observation_id":"abd1aa0b-8d13-4672-8172-523dcbdbb894","resolution":{"observed_at":"2026-07-11T14:23:57.266710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-13T06:16:27.546219Z","title":"Wang et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08857","last_updated":"2026-07-13T16:37:13Z","snapshot_observed_at":"2026-07-16T23:19:40.650747Z","submitted_at":"2026-07-09T18:27:41Z","title":"AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T06:16:27.546219Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.08857"},"observation_digest":"sha256:bf00c56c7489b5a6629c484ba1a8c6f1c88344ce7a1eae1af852f568ca11af02","observation_id":"8b303fb6-33c8-4ede-97ee-8203a2558d40","resolution":{"observed_at":"2026-07-13T06:16:27.546219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-14T15:28:10.101325Z","title":"Wang et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08857","last_updated":"2026-07-13T16:37:13Z","snapshot_observed_at":"2026-07-16T23:19:40.650747Z","submitted_at":"2026-07-09T18:27:41Z","title":"AgenticFocus: Object-Preserving Mixed Reality Synthesis from Human FPV Video for Dexterous Humanoid Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T15:28:10.101325Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.08857"},"observation_digest":"sha256:ed12ae70226836ed026addf01debeb5a7a86217a380bb9d7619afd5c10d9abda","observation_id":"03d8e224-f0d7-4545-ba45-66109aef3b19","resolution":{"observed_at":"2026-07-14T15:28:10.101325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-08-02T00:42:34.712744Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14943","last_updated":"2026-07-16T12:52:49Z","snapshot_observed_at":"2026-08-03T19:12:57.323111Z","submitted_at":"2026-07-16T12:52:49Z","title":"Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:42:34.712744Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.14943"},"observation_digest":"sha256:737d251bd8fc3bfb5533428891bc3ac6277375f67089ddc244154403a9304f96","observation_id":"7e046b83-e828-42f6-bf65-af73e8b73fac","resolution":{"observed_at":"2026-08-02T00:42:34.712744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-31T23:29:08.872529Z","title":"arXiv preprint arXiv:2605.12090 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:08.872529Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:79866c1ea1c7fb69466810c53f44abea9e2f61539f768a4f4fed2a07b64605db","observation_id":"592bd980-22c4-4a8e-b128-40f099c00b37","resolution":{"observed_at":"2026-07-31T23:29:08.872529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-08-05T14:52:35.528275Z","title":"arXiv preprint arXiv:2605.12090 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03682","last_updated":"2026-08-05T05:24:32Z","snapshot_observed_at":"2026-08-06T08:39:57.918373Z","submitted_at":"2026-08-04T13:53:48Z","title":"PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T14:52:35.528275Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2608.03682"},"observation_digest":"sha256:3db4834064cef24fa16c01296cf144aa80de5a96b7d7d19bde3a467f68b44525","observation_id":"b84cfe12-6297-4efb-90e8-a64bd191a598","resolution":{"observed_at":"2026-08-05T14:52:35.528275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-08-05T14:32:56.118567Z","title":"World action models: The next frontier in embodied ai.arXiv preprint arXiv:2605.12090, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-06T08:33:39.285386Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.118567Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:3732bf5c23d6a35844d4bca766109ba8a35cc93f0ec3882748d555f3b9319fbd","observation_id":"aafc3a52-a6d2-4bba-9431-6e76bc48dc4c","resolution":{"observed_at":"2026-08-05T14:32:56.118567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-08-05T05:44:43.007949Z","title":"World action models: The next frontier in embodied AI","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03924","last_updated":"2026-08-04T16:56:09Z","snapshot_observed_at":"2026-08-06T08:34:36.874262Z","submitted_at":"2026-08-04T16:56:09Z","title":"ETA: A New Agentic Paradigm for Embodied Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T05:44:43.007949Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2608.03924"},"observation_digest":"sha256:91d346fdf10f897671c012e82a63865b484d2fe6a3adc4105d8a8e2a063f02e5","observation_id":"4f1d3227-bae7-4d6c-b8bd-5d27974d90ee","resolution":{"observed_at":"2026-08-05T05:44:43.007949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12090/citation-record","integrity":"/paper/2605.12090/integrity","json":"/paper/2605.12090/citation-record.json","paper":"/paper/2605.12090"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0ec1a15a28c6e739fd0ae029151335288afc53e3e294d84efcc5a08bb641b6eb","observation_id":"d0db0a94-0a79-41ba-9a30-923f59a2091e","resolution":{"observed_at":"2026-05-13T05:02:17.717454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"7d81824c-b18a-4336-92e6-a72b443cb53c","year":null},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3c62ed5fcb2193852c0b28f4a12d8664f7bd7737f3b87b6a9849c001dd9a8860","observation_id":"fe20ddbe-47a4-4b93-8aec-de8731ec8aeb","resolution":{"observed_at":"2026-05-13T11:07:40.201131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:99ea5f8e4f9c6bf98fdba14b1b9afce4247cfd54a41b9f1873c245aeea9cf8cf","observation_id":"0abcb04e-8e8f-4ea2-85ef-99803828f873","resolution":{"observed_at":"2026-05-13T05:02:17.706414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3601615c2fb66945a62af34f8fc604390d8e25bb798609337c60c3b114654aeb","observation_id":"450957cc-ef1f-4417-a1be-3b38ced781b3","resolution":{"observed_at":"2026-05-13T05:02:17.719828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:f8b5371d1fa401f4414483a53cb1a09689cf66216adc6cc00d81da1a0e7b0d60","observation_id":"0cb66ad3-f730-4c76-86ee-f49f60e17458","resolution":{"observed_at":"2026-05-13T05:02:17.709173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World model- ing makes a better planner: Dual preference optimization for embodied task planning","venue":null,"work_id":"c7dc1792-89e6-4821-8aa1-95e502eeb2bc","year":null},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:6c80954ab8f3aa31797725b75033d7cb29a24ee44ec4865ada392a7a563d30ca","observation_id":"a11ffd71-03ac-4ada-ae5a-f38467e3b14c","resolution":{"observed_at":"2026-05-13T11:07:40.203184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1044","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":"799892c7-ba3e-41c2-90ea-0220787a7e35","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:a4db2f882a824f80b5071a320d4f6939d78160ddb609d550b9f89c3566e7818a","observation_id":"f057c73d-97fc-4863-9fe8-c063c4995ce2","resolution":{"observed_at":"2026-05-13T05:02:16.743493Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00111","last_updated":"2023-11-20T05:38:13Z","snapshot_observed_at":"2026-08-05T19:35:53.885395Z","submitted_at":"2023-01-31T21:28:13Z","title":"Learning Universal Policies via Text-Guided Video Generation","version":3},"cited_work":{"arxiv_id":"2302.00111","doi":"10.48550/arxiv.2302.00111","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B., Schuurmans, D., and Abbeel, P","venue":"arXiv (Cornell University)","work_id":"d5eed546-aec4-42e8-8e69-fa3e41cc741a","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2302.00111","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:48c417b809ad84e5dba88b59dfd22877fa138f3abceaa2722223c50222850978","observation_id":"c20a33b8-6968-4825-b84f-1955a7f74b3f","resolution":{"observed_at":"2026-05-13T05:02:17.703667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10625","last_updated":"2023-10-16T17:48:45Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:48:45Z","title":"Video Language Planning","version":1},"cited_work":{"arxiv_id":"2310.10625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.10625","snapshot_observed_at":"2026-07-08T03:14:31.687294Z","title":"arXiv preprint arXiv:2310.10625 (2023)","venue":"cs.CV","work_id":"9736ca18-78ad-4d25-ac93-df8f2295a1f8","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2310.10625","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:6bbe0559600d01d61a4ad7107b52c7af92c6d52f440d0127b30b5a14c297be11","observation_id":"de8ea739-8432-4caa-85c4-0f2da5bca292","resolution":{"observed_at":"2026-05-13T05:02:17.714656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08576","last_updated":"2023-10-12T17:59:23Z","snapshot_observed_at":"2026-08-05T14:38:36.869054Z","submitted_at":"2023-10-12T17:59:23Z","title":"Learning to Act from Actionless Videos through Dense Correspondences","version":1},"cited_work":{"arxiv_id":"2310.08576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08576","snapshot_observed_at":"2026-07-04T04:09:35.261339Z","title":"Learning to act from actionless videos through dense correspondences","venue":null,"work_id":"e2bb8629-96e8-41a3-bfeb-3ece8c4e89f7","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2310.08576","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3d7d97ad8aac04853ed6d07746626f1155485ccf029ead94b8a20e3ff97a2d98","observation_id":"610ccdbc-e91b-4615-b336-d6e68066a720","resolution":{"observed_at":"2026-05-13T05:02:17.821723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22007","last_updated":"2025-06-27T08:21:55Z","snapshot_observed_at":"2026-07-06T21:48:31.332481Z","submitted_at":"2025-06-27T08:21:55Z","title":"RoboEnvision: A Long-Horizon Video Generation Model for Multi-Task Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2506.22007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22007","snapshot_observed_at":"2026-07-04T04:09:35.504114Z","title":"Roboenvision: A long-horizon video generation model for multi-task robot manipulation","venue":null,"work_id":"d524d559-f402-4585-8c51-a814dcea39f0","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2506.22007","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:7567a87b85cea059ca7959dc6b10ba5e66340f5f76acb661afdfc35a84e3c1c2","observation_id":"c8055154-3b01-49ad-9700-3c6d301a2f61","resolution":{"observed_at":"2026-05-13T05:02:17.827249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10717","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.583675Z","title":"Say , dream, and act: Learning video world models for instruction-driven robot manipulation","venue":null,"work_id":"8a1070a2-2966-45bf-ae2e-e23450ddb61b","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c01132de57b0416e765f229c62911f9f1ba1ef7f1df9a24e11df2f8e19415567","observation_id":"36c4fb7f-0ca2-4fcb-bf0a-1fc6e99f0d71","resolution":{"observed_at":"2026-05-13T05:02:17.844505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:307903ac168f5ba853e551d0c3e84b4eee597eebccb06b54adf076bbcaec3628","observation_id":"d3614055-8e0c-401d-b59e-79d7e0f9619a","resolution":{"observed_at":"2026-05-13T05:02:17.882648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":"2512.15692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-10T23:07:47.631138Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","venue":"cs.RO","work_id":"cd5b191a-8f67-43d3-8816-0ade1b9a7c29","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:ecf3b4aad4b443d93bda0a7a8f65c0b0219ba734bed08550cf7e3c81039b7b14","observation_id":"1e2f769e-830e-4f20-b70a-3cabf8312d80","resolution":{"observed_at":"2026-05-15T10:41:00.438292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":"2508.00795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-07-10T12:47:05.545575Z","title":"Video Generators are Robot Policies","venue":"cs.RO","work_id":"0941f8fe-e893-4e3a-9ac6-0a72f26340e9","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:f260143b8d4e4f340e2f33dcbd2fcd3377a820f5c29fd93ccd1bf72d4e31f2ad","observation_id":"a2886d11-f120-4198-9b27-09d575610565","resolution":{"observed_at":"2026-05-15T21:43:37.585075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.326211Z","title":"S-vam: Shortcut video-action model by self-distilling geometric and semantic foresight.arXiv preprint arXiv:2603.16195","venue":null,"work_id":"1b719a24-8bf9-4612-8655-3dff47a374d9","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1c520db70e9397c3b59d7c10a1a3be1535d480fa53e09c2be3a0216be858209b","observation_id":"9fcbfffb-0e17-425a-b53e-e9dd41d9cdda","resolution":{"observed_at":"2026-05-13T05:02:17.786542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent action pretraining from videos","venue":null,"work_id":"11ed07e9-e3dd-48b4-973d-4076f6f0ade0","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:bf4e0540c127491e8f83d5f4d94343518a3487ad78cb9b25010fbf98a8068e6a","observation_id":"91f3ceca-f450-40ce-a5e0-0e511b030861","resolution":{"observed_at":"2026-05-13T11:07:40.153426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":"fd555373-0336-4454-9917-dd6ae065acd3","year":null},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:035fce1e83d75e3c785740a05b287a82a92c6ddf7b5ea9c514b9ae2f1590b15e","observation_id":"cb42705f-bbb4-4825-b0c5-d0b1b3d39002","resolution":{"observed_at":"2026-05-13T11:07:40.179123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0c5a3b7e509f6230767314d59f5b621b9bbf0a5c83a3410d265622f2026789db","observation_id":"3d0de9d8-147e-40c6-8c26-8fc9c4bb0cb5","resolution":{"observed_at":"2026-05-13T05:02:17.800744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World action models are zero-shot policies","venue":null,"work_id":"755cecae-2d28-4e1e-86d8-57f575dc3c53","year":null},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:bff1ed700648e80754ccab56f28e0e489933a293f13af502a3707962d03fbd70","observation_id":"30d308a7-d253-408c-9216-3358357682af","resolution":{"observed_at":"2026-05-13T11:07:40.160621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:4910f99a2abfaac8f92cfaab65db4625aa226039f3b45661bbd8561b69d13a4d","observation_id":"b3a1f224-543e-46e2-9260-47bc0728503b","resolution":{"observed_at":"2026-05-13T05:02:17.734254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal world modeling for robot control","venue":null,"work_id":"958ccffa-722e-4060-8cb1-4352800834d4","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:cc463951fd3391d5b745bcf94e9c270cfb428241a1f92a7b604bbcb0eb69e789","observation_id":"b353d6d8-859a-4a0e-a147-4088571df8fc","resolution":{"observed_at":"2026-05-13T11:07:40.180966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:aa10d621755ce5e7048ce2d81a3aba20fa09e92be5efb96b5ab385abd0910841","observation_id":"328cd88c-ce3f-4939-a1c4-5a58b5619157","resolution":{"observed_at":"2026-05-13T05:07:18.341097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":"2504.02792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-10T18:47:31.709153Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","venue":"cs.RO","work_id":"c181dcf1-e774-4216-a30e-e55c3f3a766c","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:ee2690c651f879ee0d33d6569355bcd1b73cec8feba40a744cbd99cc980f5e09","observation_id":"1d26c770-c2b1-4aa1-a331-f4a053b4bac7","resolution":{"observed_at":"2026-05-13T16:25:00.606134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18179","last_updated":"2024-11-27T09:54:58Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T09:54:58Z","title":"Prediction with Action: Visual Policy Learning via Joint Denoising Process","version":1},"cited_work":{"arxiv_id":"2411.18179","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18179","snapshot_observed_at":"2026-07-02T18:57:17.161071Z","title":"//arxiv.org/abs/2411.18179","venue":null,"work_id":"4680a156-0a85-4f9a-8e1b-d36265131604","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2411.18179","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:599ea318ecedbda13c08159ec575a8ffdec42e47c71f00ae33ac5ed5e243d6a2","observation_id":"776906c3-a569-4d81-bd73-e67635b3c252","resolution":{"observed_at":"2026-05-13T05:02:17.923754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00110","last_updated":"2026-04-23T12:54:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-18T14:58:18Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2603.00110","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.00110","snapshot_observed_at":"2026-07-04T04:09:34.924116Z","title":"Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation","venue":"cs.RO","work_id":"4e765031-8de8-4903-9093-755c735cfe34","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2603.00110","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c0f63fb2c8cf63ed5172764f4143f1c07b1c9f4d4254a06315f92f4db335fd69","observation_id":"d0f00b46-76a9-4147-b03e-6750e6dbdb98","resolution":{"observed_at":"2026-05-13T05:07:18.254641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15223","last_updated":"2024-10-31T08:58:08Z","snapshot_observed_at":"2026-07-06T18:19:08.871953Z","submitted_at":"2024-05-24T05:29:12Z","title":"iVideoGPT: Interactive VideoGPTs are Scalable World Models","version":3},"cited_work":{"arxiv_id":"2405.15223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.15223","snapshot_observed_at":"2026-07-04T04:09:35.376333Z","title":"ivideogpt: Interactive videogpts are scalable world models","venue":null,"work_id":"828889d5-f525-4140-ba12-ec411889c931","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2405.15223","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:5a0eae8a80fd7bdc7c913334e4b1b40c919b9406b5944b2e78bfe2578e701a1d","observation_id":"993b419c-8b00-403f-9ca9-22cb30aa54c0","resolution":{"observed_at":"2026-05-13T05:02:17.867757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10075","last_updated":"2025-05-15T08:27:16Z","snapshot_observed_at":"2026-08-05T18:52:21.852237Z","submitted_at":"2025-05-15T08:27:16Z","title":"FlowDreamer: A RGB-D World Model with Flow-based Motion Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2505.10075","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10075","snapshot_observed_at":"2026-07-04T04:09:35.181119Z","title":"Flowdreamer: A rgb-d world model with flow-based motion representations for robot manipulation","venue":null,"work_id":"2108d138-13b3-4ab7-b01b-2c8a25c14a8c","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2505.10075","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:153bbacf4817f9684fdb3f9db2e2be922a3250955f97a4383a42ab33c6a6a0d0","observation_id":"17b37493-ab6f-45bb-9a25-610c2310a3f6","resolution":{"observed_at":"2026-05-13T05:02:17.737197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:16:48.600688Z","title":"Enerverse: Envisioning embodied future space for robotics manipulation","venue":null,"work_id":"4edb56a7-cf30-48b4-b9dc-572548ad8cac","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:e4cead6fa74ef5ea76b7f0a1edaf28fea371e24521b617b68b3d44417293a73d","observation_id":"565d9095-b877-451c-b5b9-b982329d6351","resolution":{"observed_at":"2026-05-13T05:02:17.960532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.04551","last_updated":"2019-06-04T18:13:09Z","snapshot_observed_at":"2026-07-06T07:14:03.735574Z","submitted_at":"2018-11-12T04:30:10Z","title":"Learning Latent Dynamics for Planning from Pixels","version":5},"cited_work":{"arxiv_id":"1811.04551","doi":"10.48550/arxiv.1811.04551","metadata_source":"pith","pith_arxiv_id":"1811.04551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Latent Dynamics for Planning from Pixels","venue":"cs.LG","work_id":"146fc4a4-6db2-43a9-a57f-4dd133c0d315","year":2018},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/1811.04551","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:b5a3346ed2f9fc35e5883cb8268d156bf949f0864a3a4fd688acad841b087def","observation_id":"b1eec7be-e404-45cf-b546-79e829627749","resolution":{"observed_at":"2026-05-13T05:02:17.876732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09481","last_updated":"2024-11-19T16:55:55Z","snapshot_observed_at":"2026-08-03T17:09:19.060322Z","submitted_at":"2022-02-19T00:30:52Z","title":"TransDreamer: Reinforcement Learning with Transformer World Models","version":2},"cited_work":{"arxiv_id":"2202.09481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.09481","snapshot_observed_at":"2026-07-04T17:29:59.391915Z","title":"Transdreamer: Reinforcement learning with transformer world models","venue":null,"work_id":"69ab157c-da44-4997-a4fc-04e2dfce66cc","year":2022},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2202.09481","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:2441ab6ea7572df0049da82ffdbf9be05971748bbb1a052f9c43597cc7b4c083","observation_id":"5d97e352-3f56-42df-be04-923eff572587","resolution":{"observed_at":"2026-05-13T05:07:18.290142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-02T05:40:31.086014Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":"2404.08471","doi":"10.1145/3178876.3185996","metadata_source":"pith","pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","venue":"cs.CV","work_id":"f7251dcf-5341-4915-bfe7-27812387b61a","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0531e9464018daf1adcfaa60a0e587f36b0a7c4f7c3ad76e47dfcf1ee4295656","observation_id":"00435132-6950-408a-ae71-89099b7dfd99","resolution":{"observed_at":"2026-05-13T05:07:18.219899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T01:54:34.489718+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04993","last_updated":"2017-12-14T00:04:02Z","snapshot_observed_at":"2026-08-01T17:38:22.122431Z","submitted_at":"2017-07-17T03:42:17Z","title":"MoCoGAN: Decomposing Motion and Content for Video Generation","version":2},"cited_work":{"arxiv_id":"1707.04993","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.04993","snapshot_observed_at":"2026-07-04T04:09:35.346856Z","title":"MoCoGAN: Decomposing Motion and Content for Video Generation","venue":"cs.CV","work_id":"71c7ab37-3df6-4f92-83e9-c9cf69354082","year":2017},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/1707.04993","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:db32e9754aedaf6f9dff93cea44cc85fd9c07165ec52e6b8ab1bf90d3b4c4e0e","observation_id":"5a8a982c-f319-45cd-9bed-91da176b19c0","resolution":{"observed_at":"2026-05-13T05:07:18.287340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04597","last_updated":"2015-05-18T11:28:37Z","snapshot_observed_at":"2026-07-06T04:18:08.302578Z","submitted_at":"2015-05-18T11:28:37Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":"1505.04597","doi":"10.1007/978-3-662-06400-9_9","metadata_source":"pith","pith_arxiv_id":"1505.04597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"U-Net: Convolutional Networks for Biomedical Image Segmentation","venue":"cs.CV","work_id":"5c6b13d6-e704-4bf4-9df7-3a3a4d3b6950","year":2015},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/1505.04597","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:a2a9823e57231a4318b05b0289ed5ccacd0832b488a4698ebea7dd6ffe0a3291","observation_id":"a5dc2cf1-1aa9-4b15-a745-2f12036fd56d","resolution":{"observed_at":"2026-05-13T05:07:18.359422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":"2401.03048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-10T01:46:41.160163Z","title":"Latte: Latent Diffusion Transformer for Video Generation","venue":"cs.CV","work_id":"5328e907-7278-4781-a2bb-c5ef40dc87fb","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1ce34df95c7a8362b7211635253c035bbcdc88518c97c164b5a644aafc75100a","observation_id":"d0fe472d-d9d8-4983-a7d8-9ba88e782339","resolution":{"observed_at":"2026-05-13T21:45:35.835056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:2960afeaec202e9d5510fe5720aafa4d5e253e4249f202320a91af4b117cc94c","observation_id":"ccf6f7fa-1893-4f7a-9d63-e8135801d2a3","resolution":{"observed_at":"2026-05-13T05:07:18.229081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"261a60fe-6323-41c7-b59a-1cccb7dde88b","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:17e42e1b2fb8aaadada0995c64f64f3de8155dbd4ebf2b4cdc759154e0e920cf","observation_id":"6f5ae4a0-5dd1-4efa-b901-2653bd7a6322","resolution":{"observed_at":"2026-05-13T11:07:40.170575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10901","last_updated":"2023-08-21T17:59:32Z","snapshot_observed_at":"2026-08-04T16:43:50.840674Z","submitted_at":"2023-08-21T17:59:32Z","title":"Structured World Models from Human Videos","version":1},"cited_work":{"arxiv_id":"2308.10901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.10901","snapshot_observed_at":"2026-07-10T18:47:31.656458Z","title":"Structured world models from human videos","venue":"cs.RO","work_id":"4e293efc-0a0c-4eef-9f46-dc90258f3939","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2308.10901","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c5cc9ec29357cbf9f4fbd735a1bcad8b3bd0d4fb6f6df995d42e84e25f48a730","observation_id":"8b8c7a37-866f-4098-aeb1-0d4e3f508a48","resolution":{"observed_at":"2026-05-13T05:07:18.263404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2602.06949","doi":"10.48550/arxiv.2602.06949","metadata_source":"pith","pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","venue":"cs.RO","work_id":"95f2f415-c659-4084-a008-39303bea8638","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:49ce35aaf6f66d22abf978f106c9639b7ae94576e1e586365cb2bdcb230659c6","observation_id":"e331be21-3a8b-4ea5-beb9-6e393d6d4238","resolution":{"observed_at":"2026-05-16T17:02:34.576842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-02T11:29:41.147175Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":"2404.12377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-07-10T11:47:02.936864Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","venue":"cs.RO","work_id":"b1231baa-7c16-4ecf-a6a8-ef49d0875212","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c021d8af25fa5673fe90caac28ee7f32e9a1760751b8f3d036cf2b56e2896588","observation_id":"e25e87e9-00d3-4c53-a04e-4c9b04561b93","resolution":{"observed_at":"2026-05-15T20:47:30.400020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23135","last_updated":"2025-06-29T08:19:45Z","snapshot_observed_at":"2026-08-05T03:53:42.852461Z","submitted_at":"2025-06-29T08:19:45Z","title":"RoboScape: Physics-informed Embodied World Model","version":1},"cited_work":{"arxiv_id":"2506.23135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23135","snapshot_observed_at":"2026-07-04T04:09:35.073117Z","title":"Roboscape: Physics-informed embodied world model","venue":null,"work_id":"a9ab7540-f2d0-4eb9-af1c-7c06b6b5cd13","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2506.23135","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:218324d13e35fbe9aff7c062ecf6f574a9bad051e44910a358111e7fdff1004b","observation_id":"a09438cd-c62c-42c2-b86e-b460a869c4f3","resolution":{"observed_at":"2026-05-13T05:07:18.367935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2510.10125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-07-09T03:05:55.293884Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","venue":"cs.RO","work_id":"60c6a353-4bc6-4c87-8c39-372fcddd6ac0","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:7e38368d197d755273a6c48024ecdbb26cc48505f5eb3b28573f84fc0e5619a2","observation_id":"66c4bde1-1a00-4c81-8773-848201f6ac17","resolution":{"observed_at":"2026-05-16T01:14:10.607102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14957","last_updated":"2025-03-10T09:40:42Z","snapshot_observed_at":"2026-07-06T20:10:15.143454Z","submitted_at":"2024-12-19T15:38:15Z","title":"Dream to Manipulate: Compositional World Models Empowering Robot Imitation Learning with Imagination","version":2},"cited_work":{"arxiv_id":"2412.14957","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14957","snapshot_observed_at":"2026-07-04T17:29:59.475296Z","title":"Dream to manipulate: Compositional world models em- powering robot imitation learning with imagination","venue":null,"work_id":"cd082486-2936-4dfb-8b72-f6ba04a1e609","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2412.14957","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:effb0eeaf6bc35e2df87836f1c29149c4ad74876020e94f4e0a89585d2390a1f","observation_id":"1d5134cf-cc1e-4bb8-acbf-ab187233f924","resolution":{"observed_at":"2026-05-13T05:02:17.932798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-03T15:20:23.515607Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:e8da52f985d159752b61850272046c1402abf633cab659da678f08808d23fbc1","observation_id":"c6855c92-9b62-4fc1-99c8-c80545848c40","resolution":{"observed_at":"2026-05-13T05:02:17.915130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-02T12:02:13.904371Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":"2010.02193","doi":"10.48550/arxiv.2010.02193","metadata_source":"pith","pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Atari with Discrete World Models","venue":"cs.LG","work_id":"154f6f5f-bb34-456d-8107-45d5b51433ce","year":2020},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:05133835221b9bb704c6f1932da93d85a8b490c7cd8909edd274169c37ad12bf","observation_id":"adea8829-679e-4db2-b832-31a00708e585","resolution":{"observed_at":"2026-05-15T01:27:32.049853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24527","last_updated":"2025-09-29T09:42:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T09:42:27Z","title":"Training Agents Inside of Scalable World Models","version":1},"cited_work":{"arxiv_id":"2509.24527","doi":"10.48550/arxiv.2509.24527","metadata_source":"pith","pith_arxiv_id":"2509.24527","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Agents Inside of Scalable World Models","venue":"cs.AI","work_id":"f0464a07-aaee-486f-a0b1-a4bce0bbc3e4","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2509.24527","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:a7a041a382e2dafa730ed72bdba7a1f0994fd6524a6acafd59fa9469cabb8cfa","observation_id":"e6f5a955-85fe-4593-819a-a4774fcb1cef","resolution":{"observed_at":"2026-05-15T02:05:52.707385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"cited_work":{"arxiv_id":"2602.11075","doi":"10.48550/arxiv.2602.11075","metadata_source":"pith","pith_arxiv_id":"2602.11075","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","venue":"cs.RO","work_id":"4ef9012c-9ddc-4414-98c7-de172a2102f5","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2602.11075","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3e6648a8b78c6e6b1c72294c45e4f0c456ac92a15742f911c96275d668eea612","observation_id":"f8ee2a58-5045-4d76-8852-7e07623ae707","resolution":{"observed_at":"2026-05-13T05:02:17.906235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":"2301.04104","doi":"10.1126/sciadv.adu2488","metadata_source":"pith","pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mastering Diverse Domains through World Models","venue":"cs.AI","work_id":"6aeb260f-8c7c-4f9c-b98b-067cd7c59acd","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:7a9f53d7c0d68baa384a31f49e8e2465beda3093997f4ff9c2f5ccc47819963d","observation_id":"2ad832da-dadc-45ba-9055-0509a7e1e6ef","resolution":{"observed_at":"2026-05-13T05:02:17.917978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14176","last_updated":"2022-06-28T17:44:48Z","snapshot_observed_at":"2026-07-06T13:25:39.576741Z","submitted_at":"2022-06-28T17:44:48Z","title":"DayDreamer: World Models for Physical Robot Learning","version":1},"cited_work":{"arxiv_id":"2206.14176","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.14176","snapshot_observed_at":"2026-07-03T17:18:43.370025Z","title":"Daydreamer: World models for physical robot learning","venue":null,"work_id":"ca82519a-54b2-438d-bd31-8221bd3ed770","year":2022},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2206.14176","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0c13e4660bcdc5fa7b1895836aae751a2083fa33ebaaf10162995f285ed220b3","observation_id":"f1af7ded-96ed-4100-8f13-8aaa0de975a6","resolution":{"observed_at":"2026-05-13T05:02:17.963303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24948","last_updated":"2026-04-27T05:41:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T15:45:19Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","version":6},"cited_work":{"arxiv_id":"2509.24948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.24948","snapshot_observed_at":"2026-07-10T08:36:59.803669Z","title":"World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training","venue":"cs.RO","work_id":"e43fb37f-61a0-4911-b5e5-880083d7aa30","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2509.24948","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:e6e51b0c84555cff926667f177375a28b84882420b86759bb9b093ddf0a0dd9a","observation_id":"94eda5dc-5e1d-4375-b5d4-7d14f5e7616e","resolution":{"observed_at":"2026-05-13T05:07:18.222721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.082776Z","title":"Roboscape-r: Unified reward-observation world models for generalizable robotics training via rl","venue":null,"work_id":"25fd8d83-55fb-4ec7-a594-1e46dde26db0","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:9f31a58187056f1cddc38a77a538af2800c2a65012807350c0e1e6a4b6524c5a","observation_id":"97a79258-a91e-4ebd-a601-213a9a370f71","resolution":{"observed_at":"2026-05-13T05:02:17.862465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.483382Z","title":"Wmpo: World model-based policy optimization for vision-language-action models","venue":null,"work_id":"17e0dd89-e1b0-48ae-84f1-cc651f3e5349","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:d31904c15cca3bbe3029b7c0ef2db5e48a6f37a8cfbc327884d61a243841aaf3","observation_id":"4d42406f-a2cb-4ebd-a289-907edff72800","resolution":{"observed_at":"2026-05-13T05:02:17.859655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:684c7bc16611f47b10c8bdc7bf05b7592223c7b80a5b7f8d04d15efacb9a8795","observation_id":"0abef4cf-05b5-4a07-8314-2d7e30300fef","resolution":{"observed_at":"2026-06-30T02:16:14.370216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00406","doi":"10.48550/arxiv.2510.00406","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vla-rft: Vision- language-action reinforcement fine-tuning with veri- fied rewards in world simulators","venue":"ArXiv.org","work_id":"16edb51b-b4fd-415d-ac17-fa5e8a7462bd","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:6b125a39cff471df0f9edf328b1d32dc9c04fc63b7bcd4d46551871f28a8e2be","observation_id":"851cd0d5-d996-4ba3-a003-ef58b7597f03","resolution":{"observed_at":"2026-05-13T05:02:17.847252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:40:06.148303Z","title":"Reinforcement world model learning for llm-based agents","venue":null,"work_id":"6bd5285c-e1a4-4c89-9358-5ca44c2f983c","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:d6d1873ad67853dfae18c0b09d810e5db9a6e1f97db4694e976d8d57ab361a1b","observation_id":"47cbfc8c-8de6-4ade-9913-f1c506e42232","resolution":{"observed_at":"2026-05-13T05:02:17.836042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14236","last_updated":"2024-05-12T13:11:29Z","snapshot_observed_at":"2026-08-03T00:39:43.057713Z","submitted_at":"2023-09-25T15:51:29Z","title":"MoDem-V2: Visuo-Motor World Models for Real-World Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2309.14236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14236","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lancaster, N","venue":null,"work_id":"109eca2c-7b85-4efb-bfd4-19fce04e6a9d","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2309.14236","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:d60e991aecd80dce8f308e0896510aa9319b3e3277b9c8dd7d56295eea6cd5c5","observation_id":"7aad0f5e-ab3d-4c67-99cc-6c4648a8532c","resolution":{"observed_at":"2026-05-13T05:02:17.833390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:38:34.165236Z","title":"informativeness","venue":null,"work_id":"bc2392e9-f06f-4947-ba1c-becacc0be232","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:8d80789e948cc0ea87cd498313541ea01f865ad1fa21c3c0b46c17831ff47ab4","observation_id":"c04f4f1c-4f33-4a88-a8d9-9d94c3569b05","resolution":{"observed_at":"2026-05-13T05:02:17.838675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.16680","doi":"10.48550/arxiv.2504.16680","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline robotic world model: Learning robotic policies without a physics simulator","venue":"ArXiv.org","work_id":"4c1aee38-98a8-48f1-becd-605de61dcb92","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:cfd0f029668f0f77fefc3daf45264e28147a6a28cceb89c36aed6504b516d88f","observation_id":"a4ad90ce-3bbf-40a1-8382-affdbd20526e","resolution":{"observed_at":"2026-05-13T05:02:17.841387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.443652Z","title":"World4rl: Diffusion world models for policy refinement with reinforcement learning for robotic manipulation","venue":null,"work_id":"e23d3168-893b-4b69-8783-cf40191d44f1","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3cd8f68a490f5801520ff7a03cf38f09cdbea3aef9a0be1653324f043b6c16d0","observation_id":"1b55f211-529d-45db-b1b5-389824b9b5ac","resolution":{"observed_at":"2026-05-13T05:02:17.819092Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14343","last_updated":"2023-05-30T17:38:44Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-23T17:59:33Z","title":"Video Prediction Models as Rewards for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14343","doi":"10.48550/arxiv.2305.14343","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14343","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B., Goldberg, K., Lee, Y., Hafner, D., and Abbeel, P","venue":"arXiv (Cornell University)","work_id":"edb1c349-5db0-4661-ac4e-24e74271f8eb","year":2023},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2305.14343","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:ca932a5d55dedf71a7593e0ba7d16bf39b0add1113eb078ea1450b3dd6cf558a","observation_id":"b6e57756-56a3-4435-9c08-f82c8c751187","resolution":{"observed_at":"2026-05-13T05:02:17.824311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot learning from a physical world model","venue":null,"work_id":"f0c760ba-4bb2-428c-9a9f-6f0314ffb090","year":null},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1323ee970e878232d8d3bfd93c6af3820051248241e8f81033a7cc2a69e525f8","observation_id":"988a6273-2a14-47d3-b523-cd2880e64285","resolution":{"observed_at":"2026-05-13T11:07:40.167892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:29:35.664329Z","title":"Robot learning from a physical world model","venue":null,"work_id":"f12a724d-d394-45d2-b6c9-31da44d6a48e","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c05d78a87ca6c52d61a62a84b2e3f0ed5c688824d2b2345bbdb4f6e04cc1df15","observation_id":"a54ca1bf-e11a-4eb3-8e0c-ac5ef1e2d43d","resolution":{"observed_at":"2026-05-13T05:02:17.829936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14134","last_updated":"2024-08-09T03:06:42Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:55:05Z","title":"Diffusion Reward: Learning Rewards via Conditional Video Diffusion","version":3},"cited_work":{"arxiv_id":"2312.14134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14134","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion reward: Learning rewards via conditional video diffusion","venue":null,"work_id":"575d7e53-4994-4f9d-b296-3e812d1c656f","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2312.14134","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c639658b95eb5ad2043b168ecab583e69ce5b6b0e5169921b38f8523db282b08","observation_id":"307a31a0-61b3-4a57-9b24-ebac8ba00068","resolution":{"observed_at":"2026-05-13T05:02:17.879813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.00961","last_updated":"2026-04-03T07:09:55Z","snapshot_observed_at":"2026-07-06T22:37:21.536027Z","submitted_at":"2025-11-30T16:22:27Z","title":"Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2512.00961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.00961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning","venue":"cs.LG","work_id":"e242fc02-6ea4-47d3-be16-0f00239fbfc3","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2512.00961","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:117030d2a73a97bef57501dca02c5b909aadaf5cfabf14ce2a3e940d5162b619","observation_id":"0b94c3f8-375b-427b-94e7-4c5fe62c5e09","resolution":{"observed_at":"2026-05-13T05:02:17.803813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating gemini robotics policies in a veo world simulator","venue":null,"work_id":"d0f14828-95e8-40e2-b89c-51971198e10c","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0e9bebb2d9ee484fe22debc611e0d317cffdc5e7101b5c1e33488e00b2e911b1","observation_id":"6d57fe95-c6fe-4ffb-8b89-ee8321c290a8","resolution":{"observed_at":"2026-05-13T11:07:40.148245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.586020Z","title":"Interactive world simulator for robot policy training and evaluation","venue":null,"work_id":"8a2a3980-472f-4433-ac4a-ebdc041ba8e8","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:9480f3a94e5ea4d882462ea3417a703e30da1aae54b3de769f75b13c734219aa","observation_id":"deeb3f6f-0368-412d-b275-5e3ff422e3b8","resolution":{"observed_at":"2026-05-13T05:02:17.789299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-08-06T03:07:18.946160Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"cited_work":{"arxiv_id":"2505.19017","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19017","snapshot_observed_at":"2026-07-08T19:25:32.462986Z","title":"Worldeval: World model as real-world robot policies evaluator","venue":"cs.RO","work_id":"6b78a805-660c-4db9-aaf4-f2dbf2c966e8","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2505.19017","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3374ccb2f9b8958d8a35d39b01b1efffca56f9d7d05954945bd3e46803efcc2d","observation_id":"937d7e38-6f9e-42ff-b1c7-7f6257a68f18","resolution":{"observed_at":"2026-05-13T05:02:17.743642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.00613","doi":"10.48550/arxiv.2506.00613","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldGym: World Model as An Environment for Policy Evaluation","venue":"arXiv (Cornell University)","work_id":"3d0f051f-7fb2-45fb-bbd9-f2c12b0d00b2","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0b49f27f6030aead5769bab6a5ed105061ab0134b23bc52cb28b7cd8448b7be9","observation_id":"246201ff-ef28-4e8c-8d9c-fa5d45d41623","resolution":{"observed_at":"2026-05-13T05:02:17.740647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-07-06T23:08:37.811548Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"cited_work":{"arxiv_id":"2604.22152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.22152","snapshot_observed_at":"2026-07-04T04:09:35.280824Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","venue":"cs.RO","work_id":"ab041d26-d72d-4fdc-be4b-437019fcfec5","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2604.22152","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:617e19b4a455320fceb55175debc729baf8527fd09052217b326ec1c1094edc0","observation_id":"d31bfd62-94b7-4d2f-b897-ada82efd8711","resolution":{"observed_at":"2026-05-13T05:02:17.792190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05530","last_updated":"2025-05-18T04:20:01Z","snapshot_observed_at":"2026-07-06T18:42:43.011995Z","submitted_at":"2024-07-08T00:28:41Z","title":"This&That: Language-Gesture Controlled Video Generation for Robot Planning","version":2},"cited_work":{"arxiv_id":"2407.05530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05530","snapshot_observed_at":"2026-07-04T04:09:35.547027Z","title":"This&that: Language-gesture controlled video generation for robot planning.arXiv preprint arXiv:2407.05530, 2024.https://arxiv.org/abs/2407.05530","venue":null,"work_id":"e6bd83ca-a242-4b02-9c61-b8b6c40ef5b6","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2407.05530","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:a227cf86785855d795c7fbb14c5ce7ab4c2b47d48b8c4748d01aac1c0c472d4f","observation_id":"c5043df6-5097-4cf3-be5b-6efce5f0ff7b","resolution":{"observed_at":"2026-05-13T05:02:17.849904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-06T06:47:39.938557Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:bb94416ca2bc4041d04015c5d19ffa80dea21443183253d1142511f7b2ac72f9","observation_id":"bc8a2ebc-6638-4f64-ab11-80ee74ab9da2","resolution":{"observed_at":"2026-05-13T05:07:18.333533Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.09878","last_updated":"2026-05-26T17:06:15Z","snapshot_observed_at":"2026-08-03T02:45:05.244742Z","submitted_at":"2026-02-10T15:19:17Z","title":"MVISTA-4D: View-Consistent 4D World Model with Test-Time Action Inference for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2602.09878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.09878","snapshot_observed_at":"2026-07-04T04:09:35.463110Z","title":"MVISTA-4D: View-consistent 4d world model with test-time action inference for robotic manip- ulation","venue":"cs.CV","work_id":"83e6839c-3807-488c-b017-dbc7741bc98a","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2602.09878","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:ee28ee17c893e1f01d0cde2e6975d25435dd33b78c6e1911e6fa64f20eb1e1ba","observation_id":"4db02212-d871-4227-b06a-bfd8fb580806","resolution":{"observed_at":"2026-05-27T03:06:04.942822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:056cc70706bb38cae96101262a17849a96953913d531065977a7ed6597331508","observation_id":"f1b5ec9d-cefb-4681-ae82-0a3516090585","resolution":{"observed_at":"2026-05-15T12:17:01.597427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-07-06T18:49:42.663028Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":"2407.15208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-07-10T18:47:31.575403Z","title":"Flow as the cross-domain manipulation interface","venue":"cs.RO","work_id":"40196361-5c47-4912-87a6-0e600288d197","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c24a710180dabb1e27db00614563c1361cc035219a3857f1613ea5a57658334d","observation_id":"59979659-fe26-45e0-844c-b083b47a8469","resolution":{"observed_at":"2026-05-13T05:02:17.795371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06199","last_updated":"2025-06-06T16:00:31Z","snapshot_observed_at":"2026-07-06T21:38:01.195004Z","submitted_at":"2025-06-06T16:00:31Z","title":"3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model","version":1},"cited_work":{"arxiv_id":"2506.06199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06199","snapshot_observed_at":"2026-07-04T04:09:35.330869Z","title":"arXiv preprint arXiv:2506.06199 (2025)","venue":null,"work_id":"5738d36a-6508-4f82-a9ab-b22c996d8e84","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2506.06199","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:5bba1a09c0bc960abf047c79f05db42f89c0038d88b6b8eb3a8ae02a54e10a2f","observation_id":"613e048a-c865-4353-bfb9-d5e1142a4783","resolution":{"observed_at":"2026-05-13T05:02:17.761346Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.622283Z","title":"Novaflow: Zero-shot manipulation via ac- tionable flow from generated videos.arXiv preprint arXiv:2510.08568, 2025a","venue":null,"work_id":"09d6ddf4-6785-49e3-999e-daccc6f38bd8","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:7b8fc1869d93a09745f4d8df38e69f7390e212c331698db9af587d3009baef47","observation_id":"47e2f658-b4e4-443d-b7e5-a7be2a28c8fe","resolution":{"observed_at":"2026-05-13T05:02:17.806678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.619682Z","title":"Dream2flow: Bridging video generation and open-world manipulation with 3d object flow","venue":null,"work_id":"574eb7d1-d6e1-4e88-920b-5439943aee71","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:93de5cd54133266e4e406b837fd6eb6eaaf4d90b58dda2603c341a44c73794da","observation_id":"17f1d915-a873-4a02-a646-a34aeee93364","resolution":{"observed_at":"2026-05-13T05:02:17.777208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16862","last_updated":"2024-06-24T17:59:45Z","snapshot_observed_at":"2026-08-04T07:35:11.914654Z","submitted_at":"2024-06-24T17:59:45Z","title":"Dreamitate: Real-World Visuomotor Policy Learning via Video Generation","version":1},"cited_work":{"arxiv_id":"2406.16862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16862","snapshot_observed_at":"2026-07-08T02:04:26.253123Z","title":"Dreamitate: Real-world visuomotor policy learning via video generation","venue":"cs.RO","work_id":"45d8eed6-8b6f-40b3-99c2-eb10a736919a","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2406.16862","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:9794641de95fa103064326430b97666586062f478061d98a4bf2805134307c68","observation_id":"a7d0a91d-4bc0-4118-a456-d83e8cd36f80","resolution":{"observed_at":"2026-05-13T05:02:17.885588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geometry-aware 4d video generation for robot manipulation","venue":null,"work_id":"868d1cb9-790c-498d-805a-4fab2eede861","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:19236cd15c88d646451095a6189848333234c4836e684788dd8fd9d2ad17a0cf","observation_id":"7409d818-af44-4a44-933e-f903d2a1e229","resolution":{"observed_at":"2026-05-13T11:07:40.162409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00990","last_updated":"2026-05-13T01:35:48Z","snapshot_observed_at":"2026-07-06T21:50:35.488353Z","submitted_at":"2025-07-01T17:39:59Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","version":3},"cited_work":{"arxiv_id":"2507.00990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00990","snapshot_observed_at":"2026-07-04T08:19:44.671424Z","title":"Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations","venue":"cs.RO","work_id":"bef1c2df-e0c2-4201-833b-2de393be01e0","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.00990","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:e96e67006611f23192fd27377c3db1bc1137685927bbcf8c98998146524ca5da","observation_id":"c294bfe1-e0be-423d-bd24-8628b23127be","resolution":{"observed_at":"2026-05-13T05:02:17.935498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":"2512.15840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-07-10T18:47:31.628749Z","title":"Large Video Planner Enables Generalizable Robot Control","venue":"cs.RO","work_id":"6f56b125-35ab-41da-aa0c-d118d706bf3a","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1381a671e0a8f9bcf7f0815d0dbd129cffbe9b0a890bbf5a410c7fde12d64501","observation_id":"91548258-88d8-48a0-9bf5-a2333b7944c4","resolution":{"observed_at":"2026-05-13T05:02:17.873711Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"cited_work":{"arxiv_id":"2507.12898","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.12898","snapshot_observed_at":"2026-07-04T04:29:34.771221Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","venue":"cs.LG","work_id":"27ba4477-458b-442f-bbd1-17d207004d56","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.12898","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:2913df5be7df818bac2a6f6b4c85e90b8d0bae03fc36ecc06199f6024fbfc7d3","observation_id":"89f72487-c324-4b7f-b9c6-0831fd6f8b5e","resolution":{"observed_at":"2026-05-16T09:54:28.431425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04502","last_updated":"2026-04-06T07:57:52Z","snapshot_observed_at":"2026-07-06T22:53:29.118925Z","submitted_at":"2026-04-06T07:57:52Z","title":"Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?","version":1},"cited_work":{"arxiv_id":"2604.04502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04502","snapshot_observed_at":"2026-07-04T04:09:35.420708Z","title":"Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?","venue":"cs.RO","work_id":"daaa04be-7c34-4a81-819e-df72c3921a25","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2604.04502","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3c015a28be998d9824b7d578c6441647112e5a54d5b6b586c9d73ccc8e7676cd","observation_id":"723ca83d-5dbd-421f-832d-699417f40e52","resolution":{"observed_at":"2026-05-13T05:07:18.316499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":"2604.15483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-10T19:47:32.631418Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","venue":"cs.LG","work_id":"7391297f-4dff-465c-9790-cb760a2c0542","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0fa8fba387da836e359a37f8f1fd8155f8a670e155066a3470a34c1b60ec06ce","observation_id":"243e0eb2-d1f2-4541-8b35-6d1bc3c1ff45","resolution":{"observed_at":"2026-05-13T05:02:17.798098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09330","last_updated":"2026-04-10T13:59:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T13:59:54Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","version":1},"cited_work":{"arxiv_id":"2604.09330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09330","snapshot_observed_at":"2026-07-04T04:09:35.495447Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","venue":"cs.RO","work_id":"de8ef557-6536-43a9-9ae5-6afa7356bf59","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2604.09330","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:30281d04c5cc85a6e54e434f344bd051f55d81a916bb9f030549de1168a5a7bb","observation_id":"2d241684-5fd6-4c57-b569-f24393618fac","resolution":{"observed_at":"2026-05-13T05:07:18.321988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01784","last_updated":"2025-02-03T19:55:57Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-03T19:55:57Z","title":"VILP: Imitation Learning with Latent Video Planning","version":1},"cited_work":{"arxiv_id":"2502.01784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01784","snapshot_observed_at":"2026-07-04T04:09:35.431058Z","title":"Vilp: Imitation learning with latent video planning","venue":null,"work_id":"54ca5be5-9997-49e1-94bb-f1bd542e29cb","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2502.01784","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:07867b24faa04536fe74cd678d4e8eb11fc74c4058d13fd3cc7eb6dfc048678c","observation_id":"c7589c38-ec74-4858-8017-fa64635727ea","resolution":{"observed_at":"2026-05-13T05:07:18.324656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13301","last_updated":"2025-01-30T03:40:15Z","snapshot_observed_at":"2026-07-31T00:11:12.399231Z","submitted_at":"2024-06-19T07:42:02Z","title":"ARDuP: Active Region Video Diffusion for Universal Policies","version":2},"cited_work":{"arxiv_id":"2406.13301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13301","snapshot_observed_at":"2026-07-04T04:09:35.463808Z","title":"Huang, M","venue":null,"work_id":"b1a50371-21ff-437b-afbd-664ddb5e856e","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2406.13301","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:de8cbdba0472962cc12c97dfcc061ce40c5daf54c0971f003e83faa3cb829d8e","observation_id":"c3907f18-af68-418b-a486-2993ae1fd429","resolution":{"observed_at":"2026-05-13T05:07:18.293263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23682","last_updated":"2025-09-25T10:26:44Z","snapshot_observed_at":"2026-08-02T00:55:45.018424Z","submitted_at":"2025-07-31T15:57:46Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2507.23682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.23682","snapshot_observed_at":"2026-07-04T17:30:00.529444Z","title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","venue":"cs.RO","work_id":"e4e687d7-64db-4ff4-8ddf-752b58365e0f","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2507.23682","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:6b0890be0180e92e801d350cb4d0bf8f173df2abbffc9c94daef5c7bab2b3098","observation_id":"6a4d4cb6-c989-4c79-93e0-faae96578580","resolution":{"observed_at":"2026-05-15T21:52:03.356882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.19201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:47:32.598778Z","title":"Omnivta: Visuo- tactile world modeling for contact-rich robotic manipulation","venue":null,"work_id":"5ab3d65d-6d7f-4ad1-ba4b-34da9ee3860a","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:3e9c97ee59f64de6639cc9ae40d36d7c4bb9fc29a8ae089b7f77ece43e077b2f","observation_id":"7fb26480-2d41-4207-b2ec-5b0bfe79f3b0","resolution":{"observed_at":"2026-05-13T05:02:17.809600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"cited_work":{"arxiv_id":"2604.19683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19683","snapshot_observed_at":"2026-07-04T04:09:35.388712Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","venue":"cs.RO","work_id":"327c0f01-34b0-4835-856d-46306a87d75e","year":2026},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2604.19683","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:dc0438b39d88b03f0b1ab9b7e7c603ef83b5e6a822c70af222d070ec8c99841f","observation_id":"b0d1958a-bc8c-419e-8047-fa8e3695f17d","resolution":{"observed_at":"2026-05-13T05:02:17.888560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.984088Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":"65646a23-7e55-485c-8380-2d52d9bf86c5","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:1551256d487ad6b0e970add36d87e20c54fd65086494bfecab41d6a6b75da521","observation_id":"e5761d60-d442-4b8e-be36-3d27940ad715","resolution":{"observed_at":"2026-05-13T11:07:40.142675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.352643","doi":"10.1109/lra.2025.3526436","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-MG: leveraging partially- annotated data via multi-modal goal-conditioned policy","venue":"IEEE Robotics and Automation Letters","work_id":"40470d7c-12db-4784-bd62-6bc427d88cd4","year":1952},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:993ce05eb572801e53e0e07dd59f7c6f9c317898568d6c37fadfdae2008163d7","observation_id":"b8fbb6c5-04d2-4508-9905-6d4f13efa30c","resolution":{"observed_at":"2026-05-13T05:02:16.724470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:2628385808e8eac8dd3d3b2afea9dbafd01edd7f4f7492d68a772b5994717096","observation_id":"e94f52dd-197a-4f40-a927-bdf8b5818fa3","resolution":{"observed_at":"2026-05-13T05:02:17.926184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2734.2025","doi":"10.1109/cvpr52734.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Freeman, Frédo Durand, Eli Shechtman, and Xun Huang","venue":null,"work_id":"d0e5199d-8907-47b1-905a-07ab8b623a4c","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:780fabc5c677c3d384bf90435129062edb6aacc7c90ed795f785eed4bb1c83b7","observation_id":"8258046e-84cf-4227-b789-79733f8645ec","resolution":{"observed_at":"2026-05-13T05:02:16.741473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:06.316117+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-06T05:50:28.186700Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":"2506.21539","doi":"10.48550/arxiv.2506.21539","metadata_source":"pith","pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldVLA: Towards Autoregressive Action World Model","venue":"cs.RO","work_id":"d8c0c873-b2fc-44a5-a0c8-0d4a698783fb","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:2c728510c4aee976cd2282c38a613c7584d3c42f9d6fef6c2bb72c47aa4a06b5","observation_id":"8502061e-72c6-4b8c-8ac1-66d099abb87d","resolution":{"observed_at":"2026-05-13T05:07:18.190932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":"2511.17502","doi":"10.48550/arxiv.2511.17502","metadata_source":"pith","pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":"cs.RO","work_id":"f28355c2-726f-4492-899f-be74df2c09cd","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:e1b3354fc8e4d522da8a2680c1a1dce5fdf8797ec411f6082db22af9629bbca8","observation_id":"a3f0bdd1-8ee9-43b3-8a3b-5f6ee57f9cec","resolution":{"observed_at":"2026-06-02T02:03:36.254972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.617412Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model","venue":null,"work_id":"32706181-717a-461d-87e8-271938e76e0b","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:8cf3e62481c8f17882ad95349dd54d9f2cdb3be1e9fd1f95831a24849f869274","observation_id":"270183de-1f5b-4e89-bffc-bd6b31d6c789","resolution":{"observed_at":"2026-05-13T05:07:18.226290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:0be1e0591a0877dedba88c031f05e402d65128226926c3f33d03135268c27ec7","observation_id":"0411d909-d780-41bc-a0e7-2fc78609032a","resolution":{"observed_at":"2026-05-16T12:42:47.099823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videovla: Video generators can be generalizable robot manipulators","venue":null,"work_id":"4f4af3f6-daf2-4459-8a66-425c97d807ce","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:c48b3a37f25d67d936d7e883363146efafe654d6e46ecdce66436fb989c72dcc","observation_id":"13a4e612-4d84-414c-bfaa-7a655ee79e6a","resolution":{"observed_at":"2026-05-13T11:07:40.156955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-13T05:01:16.802019Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2605.12090"},"observation_digest":"sha256:4a228718d55df162a58c445b19bcd941e7be252b6824ffcf4071197b264c2134","observation_id":"f405622d-9bcd-4727-9909-dcba3367f1c5","resolution":{"observed_at":"2026-05-17T15:59:09.111136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":1,"verified_exact":79,"verified_fuzzy":11},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 28 inbound Pith citation observations for arXiv:2605.12090."}