{"as_of":"2026-08-09T02:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6120a8a24fa0b719e92bcba30bd0baf8e4c3c4b581ab3900d5ed43048054935d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:29:43.716173Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05903/citation-record","integrity":"/paper/2608.05903/integrity","json":"/paper/2608.05903/citation-record.json","paper":"/paper/2608.05903"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-07T21:29:43.488719Z","title":"V-JEPA 2 : Self-supervised video models enable understanding, prediction and planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.488719Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:7be979a5266ba75058840bf048207e6b0fa748a7e60d87e3c5aeb0bfb9242f87","observation_id":"dadd3b6d-1d1e-4b6a-b770-ea4bf7d1ae17","resolution":{"observed_at":"2026-08-07T21:29:43.488719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.371681Z","title":"How learning by reconstruction produces uninformative features for perception","venue":null,"work_id":"ef4c05eb-aca8-4dd8-a995-4a9bb1ad8183","year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.494465Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:48738ce004353a812c1e6848354df1797cc8c94ecc2766fa92aac424190f419e","observation_id":"8ba1151d-5371-452e-91b1-460c91d3130c","resolution":{"observed_at":"2026-08-07T21:29:45.376602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.356642Z","title":"Motus: A unified latent action world model","venue":null,"work_id":"5dc2d075-1ad2-4e0e-9eaf-0f728ab14b7c","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.499416Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:59f94234839479e53764e09b7d256584d104d900f62e9db54c594800aacd767b","observation_id":"67c7e4a6-42f9-43da-9f18-700d005cdf3e","resolution":{"observed_at":"2026-08-07T21:29:45.361494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-07T21:29:43.504625Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.504625Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:48813dc06d368cae513615a7ec427cbfee01afc875dff00d7063b278f43d9674","observation_id":"cbcf53da-3b48-4d9c-b612-f85f6d7918b1","resolution":{"observed_at":"2026-08-07T21:29:43.504625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T21:29:43.510016Z","title":"_0 : A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.510016Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:0889025cc85484e155f1f59c29d94d1f2b3684f1ddfe8e6d444e4f906c0c7834","observation_id":"b8465368-931f-416f-ae67-7bbf6c8fa5a7","resolution":{"observed_at":"2026-08-07T21:29:43.510016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-07T21:29:43.515393Z","title":"Univla: Learning to act anywhere with task-centric latent actions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.515393Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:91c900c229e6285877cb68da8605fe9cfd6bc1b03150384a139a63e60d483b69","observation_id":"56b810ca-046e-4980-954c-5b311bcfc8e5","resolution":{"observed_at":"2026-08-07T21:29:43.515393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-07T12:15:14.265779Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-07T21:29:43.521672Z","title":"Worldvla: Towards autoregressive action world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.521672Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:8bf871e117c22d65186522a1429cb0e9f9506d38c4c78ad0e4f324e6eb6be947","observation_id":"6f0a9ed5-f562-418b-a675-192b48f97cf1","resolution":{"observed_at":"2026-08-07T21:29:43.521672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-07T21:29:43.527696Z","title":"GR-2 : A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.527696Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:cae5ebe13ad8cd676bdf0b8c1f1d9582570fa4eec505823db533ec1bd5fd4857","observation_id":"135364b3-2784-41e8-9d24-52bafda93111","resolution":{"observed_at":"2026-08-07T21:29:43.527696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.533071Z","title":"Lawam: Latent world action models for efficient dynamics-aware robot policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.533071Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:0945718e82532cdd8ca71e77b37db50651edb47e40767aae6f8171a0955b16a3","observation_id":"b0b2a8ff-6e24-4b6d-8e96-b6f5e0e67d5f","resolution":{"observed_at":"2026-08-07T21:29:43.533071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.341403Z","title":"RoboTwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation","venue":null,"work_id":"a7801660-713e-4f3b-ad4a-10aa5cf3dddf","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.537993Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:6f67782903f7f6af1bda3bd10ebbffd3082986cb4ff53ba71aa757ff87172d57","observation_id":"2ffacfd1-4482-4b49-a70a-5cd92bd93e35","resolution":{"observed_at":"2026-08-07T21:29:45.346238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00111","last_updated":"2023-11-20T05:38:13Z","snapshot_observed_at":"2026-08-05T19:35:53.885395Z","submitted_at":"2023-01-31T21:28:13Z","title":"Learning Universal Policies via Text-Guided Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00111","snapshot_observed_at":"2026-08-07T21:29:43.542728Z","title":"Tenenbaum, Dale Schuurmans, and Pieter Abbeel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.542728Z"},"links":{"cited_paper":"/paper/2302.00111","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:a82f2160f9278759cbb770fe13ea71d17e6ecd7747779b0286f709d2f4debef1","observation_id":"3bd500e6-51b0-47d0-882e-422d7ff40af0","resolution":{"observed_at":"2026-08-07T21:29:43.542728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.325938Z","title":"LIBERO-Plus : A progressive robustness benchmark for visual-language-action models","venue":null,"work_id":"dfbb48c5-4bfc-45b2-964f-4847bff3cc6e","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.548420Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:6613c1228a5b7870f2ef9f152e6c64ce96e3aa9544b9a05ead01e63f504b4a4e","observation_id":"18d058b1-3269-4626-80b5-e1637d3d6e1c","resolution":{"observed_at":"2026-08-07T21:29:45.330846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3570","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:44.305284Z","title":"Prediction with action: Visual policy learning via joint denoising process","venue":null,"work_id":"bf84c818-678d-4e47-8e30-fb60b436b68a","year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.553241Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:81e22e2793d1cbe488d93a740b0473368a610f841b99c5f26bdf7aa8c0ac83fc","observation_id":"e4a5a6e6-f6af-4c24-b4b6-ae5c5c1629d6","resolution":{"observed_at":"2026-08-07T21:29:44.311700Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-07T21:29:43.558466Z","title":"World models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.558466Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:2a4c0eea48c1cd3715c511cea7630eb979585884db43d7fed5eed0bcdac6d6af","observation_id":"69075a04-26df-48e9-8831-73f59973086e","resolution":{"observed_at":"2026-08-07T21:29:43.558466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-07T21:29:43.564353Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.564353Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:0223df0b423fda4db2c5403f5dc5aed6358c0f9b2625b10c257d8b40fd1bd195","observation_id":"aaf21366-9a54-4ea4-b04b-31ab8df9d148","resolution":{"observed_at":"2026-08-07T21:29:43.564353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T21:29:43.569686Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.569686Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:17dcd6f79e8b14257922a5e4badfe5f3f970f517cef80c44042a010f12d26d64","observation_id":"e979e249-19c7-4436-af7f-26224d5d80cd","resolution":{"observed_at":"2026-08-07T21:29:43.569686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T21:29:43.574878Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.574878Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:446ef2bf2242d85a18cc9a0059f4cce3a560dd7723eceadb4d12fb7eb4183425","observation_id":"2ddaa7be-70ad-45ff-b1e0-ef7034bb8605","resolution":{"observed_at":"2026-08-07T21:29:43.574878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-06T02:05:52.408905Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-07T21:29:43.580212Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.580212Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:063b9cef5beedd3384aea6eb1c5e060a4d202d8d9c7a0fe1c93003c9197910d6","observation_id":"6c9121e4-53e6-4af8-a727-a5f60cdb86b7","resolution":{"observed_at":"2026-08-07T21:29:43.580212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.310393Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":"e8a9a339-f5b7-4c5d-a762-d2fe34794d3d","year":2022},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.585251Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:cec7f64c18ad4017658b83232725e3111375ef8270619327492f25de7d65ba1c","observation_id":"5b3f109b-375b-4acf-9ce0-380e1c369dd7","resolution":{"observed_at":"2026-08-07T21:29:45.315551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.590006Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.590006Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:15188911e6f52830b3be3df389711abb9d9dbcc42acbb036f178be7c3d6d2e4c","observation_id":"b2bff3e5-3f04-4815-9ee6-cba247f546c2","resolution":{"observed_at":"2026-08-07T21:29:43.590006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-07T21:29:43.594969Z","title":"Causal world modeling for robot control","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.594969Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:066afed09af1f1922da94d196b02e0a9795cbed5a8851d2267b08bb989fcab8d","observation_id":"8d18da9d-e4db-420e-a168-b1ae82dfbf52","resolution":{"observed_at":"2026-08-07T21:29:43.594969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.293519Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation","venue":null,"work_id":"5de03be2-eb40-4858-9d23-125d5f7b6f36","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.600028Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:38e64c6e29ee5177456417b4dce5f6107a1c7333919520c0a8ddc5d104f5798b","observation_id":"5d463649-3d59-4d5c-a815-917a523b357b","resolution":{"observed_at":"2026-08-07T21:29:45.299234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.276235Z","title":"Chen, Zhenyu Li, Yang Zhao, Sida Peng, Hengkai Guo, Xiaowei Zhou, Guang Shi, Jiashi Feng, and Bingyi Kang","venue":null,"work_id":"b2164c7c-1d23-4776-a2bf-fcf7a7b2af74","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.604606Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:561bfb1f49baf74c9d064875bf24253ded43421fc0124ec15ac82152b95b6341","observation_id":"484e99f4-7de3-420f-b40b-9a269da36c44","resolution":{"observed_at":"2026-08-07T21:29:45.281049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.610111Z","title":"Evo-0: Vision-language-action model with implicit spatial understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.610111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:b92d128d9772a2d2428df3773283bc19c4f86d2c7e12acaf92a42097bb672594","observation_id":"35228cce-0c13-41cd-b502-66962f22d694","resolution":{"observed_at":"2026-08-07T21:29:43.610111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-07T21:29:43.616014Z","title":"LIBERO : Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.616014Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:e1fc9415f16c43b1b708257bda9d0b1d74583b42dbf8a96d85233c608fc7c665","observation_id":"c5f95cb0-6da5-40e4-8c07-356643e01408","resolution":{"observed_at":"2026-08-07T21:29:43.616014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.260318Z","title":"LDA-1B : Scaling latent dynamics action model via universal embodied data ingestion","venue":null,"work_id":"9230cd17-090a-45ed-84e7-5e89e452bba5","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.621120Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:a60b75447a23bbac370adbcefdadd707cd8c32faa91bea31d096ecd82aca1b12","observation_id":"bba2533d-7393-4b83-bee3-32a207305913","resolution":{"observed_at":"2026-08-07T21:29:45.265287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06388","last_updated":"2026-05-07T15:05:26Z","snapshot_observed_at":"2026-08-02T19:03:40.916172Z","submitted_at":"2026-05-07T15:05:26Z","title":"Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06388","snapshot_observed_at":"2026-08-07T21:29:43.626179Z","title":"Reconstruction or semantics? what makes a latent space useful for robotic world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.626179Z"},"links":{"cited_paper":"/paper/2605.06388","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:c27910e154f914524f862633e4d895e7cbce9029c83fb1970e5b92ddca44ce29","observation_id":"6e6c2f75-f6ba-4715-a0b7-6ec689ab69e9","resolution":{"observed_at":"2026-08-07T21:29:43.626179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T21:29:43.632134Z","title":"Cosmos world foundation model platform for physical AI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.632134Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:417302b1368caae358db3d2866fd06fa26ece23a306bbf990707d0f08c860acc","observation_id":"8a6b5351-b1b3-4634-a68d-ee386ca31903","resolution":{"observed_at":"2026-08-07T21:29:43.632134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.245055Z","title":"mimic-video : Video-action models for generalizable robot control beyond VLA s","venue":null,"work_id":"9ff3cdf3-75e0-4ca9-884b-94247bef443e","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.637880Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:b99a8f2a7ca180feb7d271959f435be02396a9db843d68d8c69536199a38c1ec","observation_id":"a7c5c887-27b3-42af-8531-54ab99f2afb5","resolution":{"observed_at":"2026-08-07T21:29:45.250028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-07T21:29:43.642917Z","title":"Fast: Efficient action tokenization for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.642917Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:7fbdd63b5085f6729c98f8b76c562f819496487614f2a695b916e7818e1a677b","observation_id":"45e213d6-5519-44f7-b774-b0ffba8cc5b8","resolution":{"observed_at":"2026-08-07T21:29:43.642917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-03T05:46:19.564000Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"cited_work":{"arxiv_id":"2606.20781","doi":"10.48550/arxiv.2606.20781","metadata_source":"pith","pith_arxiv_id":"2606.20781","snapshot_observed_at":"2026-08-08T00:16:16.039225Z","title":"World Action Models: A Survey","venue":"cs.RO","work_id":"f64306f2-9d9f-495d-8b1e-0b8dee7c00fc","year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.648773Z"},"links":{"cited_paper":"/paper/2606.20781","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:3fd954cda4894ab88c5d8090eadc78680caf6e37db46bf3e72ede86b9049eab7","observation_id":"1d5ba225-53c0-4b10-acb7-8643c2b614ff","resolution":{"observed_at":"2026-08-07T21:29:44.227018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-07T21:29:43.653607Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.653607Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:f5994b482f4899a81f1f5e26ea7760046da04d270a4d6a20172f3cbd40a4ede3","observation_id":"f9fc0cc1-0cf8-45a8-82fe-d6c7cfa93588","resolution":{"observed_at":"2026-08-07T21:29:43.653607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T21:29:43.659139Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.659139Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:95c05461ab7d02f9b92c5d340c78b828635476d4557bcb74deaf4c1001420c89","observation_id":"4c9ccf9c-871d-480e-8855-c032bec94dbf","resolution":{"observed_at":"2026-08-07T21:29:43.659139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13674","last_updated":"2026-06-11T17:59:43Z","snapshot_observed_at":"2026-08-07T13:41:22.723759Z","submitted_at":"2026-06-11T17:59:43Z","title":"RepWAM: World Action Modeling with Representation Visual-Action Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13674","snapshot_observed_at":"2026-08-07T21:29:43.664306Z","title":"Repwam: World action modeling with representation visual-action tokenizers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.664306Z"},"links":{"cited_paper":"/paper/2606.13674","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:befd8fd1450d01184403ed3ba6d2e03222cfa22b237dbc1597718fa6482d0831","observation_id":"70242a4d-714c-4206-8fc4-75da2e9c50d3","resolution":{"observed_at":"2026-08-07T21:29:43.664306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-07T21:29:43.669451Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.669451Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:f4ff8ca8102f394ad637eb342f13965fd5903c9a3ff3c8f1f214d634102808a5","observation_id":"c0f16bc5-cec3-45d6-a1d0-3ae8a8e9c9dc","resolution":{"observed_at":"2026-08-07T21:29:43.669451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.674610Z","title":"FutureVLA : Joint visuomotor prediction for vision-language-action model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.674610Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:f04c04071eebd7d63dd30f07912c8a2e014bfbe863e544a076d55c80c748bfc1","observation_id":"bc730da9-3530-4efa-a002-acdfeaf777a3","resolution":{"observed_at":"2026-08-07T21:29:43.674610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11757","last_updated":"2026-04-13T17:30:01Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:30:01Z","title":"StarVLA-$\\alpha$: Reducing Complexity in Vision-Language-Action Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11757","snapshot_observed_at":"2026-08-07T21:29:43.679501Z","title":"Starvla- : Reducing complexity in vision-language-action systems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.679501Z"},"links":{"cited_paper":"/paper/2604.11757","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:41f50ea7683cec059d437a0b0be45a591afbd07f0efe54eabef076fe4d8ec885","observation_id":"c9e95fc0-2622-4818-b152-dc9f2caa9c45","resolution":{"observed_at":"2026-08-07T21:29:43.679501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-07T21:29:43.684315Z","title":"World action models are zero-shot policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.684315Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:fd8af4c91f2ef0980e0a33c142ec01fb33097e36d6b73dc71e1d97f4f120cc91","observation_id":"d783d34e-8678-412a-9584-b9dd2fee7951","resolution":{"observed_at":"2026-08-07T21:29:43.684315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T21:29:43.689632Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.689632Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:493f56106581015ff84c47ac53094893647c606eaf893c036c1ceb773f5b5121","observation_id":"f0731e72-1a6e-4ac6-beac-77035d03771e","resolution":{"observed_at":"2026-08-07T21:29:43.689632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-07T21:29:43.694843Z","title":"Fast-WAM : Do world action models need test-time future imagination? arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.694843Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:0dfe5fb96041bd2f7b09bf5a8b66fde2031dbb7c9d599603f3120b3dba6b326d","observation_id":"0eb8c335-7f3d-4abd-ad28-b1d3514f7ac1","resolution":{"observed_at":"2026-08-07T21:29:43.694843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22078","last_updated":"2026-07-30T02:24:57Z","snapshot_observed_at":"2026-08-02T23:16:34.942315Z","submitted_at":"2026-03-23T15:13:15Z","title":"Do World Action Models Generalize Better than VLAs? A Robustness Study","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22078","snapshot_observed_at":"2026-08-07T21:29:43.700343Z","title":"Do world action models generalize better than VLA s? a robustness study","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.700343Z"},"links":{"cited_paper":"/paper/2603.22078","citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:908ed7ce5d7063e6ce3e59f88c4425e33d1dbec36cdcf2a7981ce2475b0d50c2","observation_id":"972d75d3-a521-4eec-ad7b-3cbac8e87c5d","resolution":{"observed_at":"2026-08-07T21:29:43.700343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:43.706111Z","title":"FRAPPE : Infusing world modeling into generalist policies via multiple future representation alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.706111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:ca5f3201948fbbd176a93c4367153090d8f7537c7764291f52cbaef07b47871a","observation_id":"1aa7da12-0faa-48c7-9e0c-df2d820ee8ab","resolution":{"observed_at":"2026-08-07T21:29:43.706111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.228823Z","title":"FLARE : Robot learning with implicit world modeling","venue":null,"work_id":"e933186c-cb8c-43d1-8b2c-579cb1992400","year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.711111Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:eab1552278e665919f62cd584cc5a24fbd1fc88715d2314e5263ad78dacd91c4","observation_id":"950b22d0-2f92-41c5-be7a-dd5a3ef26c9c","resolution":{"observed_at":"2026-08-07T21:29:45.234084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:29:45.211930Z","title":"DINO-WM : World models on pre-trained visual features enable zero-shot planning","venue":null,"work_id":"3dc30914-372c-424f-bb65-ce2749248c71","year":2025},"citing_paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T21:29:43.716173Z"},"links":{"citing_paper":"/paper/2608.05903"},"observation_digest":"sha256:6f9ec764afbf945185a73f9de9b41cf2cf12dcfa5ef51d55c08c000c7be82bff","observation_id":"184a69f5-7483-4c00-8570-8027a257c82f","resolution":{"observed_at":"2026-08-07T21:29:45.217189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05903","last_updated":"2026-08-06T11:31:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:12:00.430952Z","submitted_at":"2026-08-06T11:31:56Z","title":"Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.05903."}