{"as_of":"2026-08-05T14:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e42a52cef98a8bb6ed4e2e5caa480d3c7cfbad29f72e2f3d9d60624265d34f94","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:02:24.792139Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:32:56.216350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:16:36.343123Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":"2606.19531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-09T22:16:36.343123Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","venue":"cs.CV","work_id":"dcabc4bf-e294-4755-a7d8-1f44ccce0d38","year":2026},"citing_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-07-12T09:22:06.947773Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-02T14:24:23.187164Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.00678"},"observation_digest":"sha256:934a26431941ecbacbfeea7ef22d072b63411e58a8423ec8f48ecb3a055291e1","observation_id":"db64921a-7e5f-4e69-8e4a-b4f9d1a4cb15","resolution":{"observed_at":"2026-07-02T14:27:03.166204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-12T09:22:08.000379Z","title":"Imagewam: Do world action models really need video generation, or just image editing?arXiv preprint arXiv:2606.19531, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-07-12T09:22:06.947773Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T09:22:08.000379Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.00678"},"observation_digest":"sha256:78d068bd33d3bdc4a24f79e43313542d801de917375bc955d72c2ca21793d306","observation_id":"65c4f8c6-d1ef-47d5-a90f-41e7a1289e64","resolution":{"observed_at":"2026-07-12T09:22:08.000379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":"2606.19531","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-09T22:16:36.343123Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","venue":"cs.CV","work_id":"dcabc4bf-e294-4755-a7d8-1f44ccce0d38","year":2026},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-07-31T14:59:13.878426Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T22:16:31.529359Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:9f5a16429da51839dc475721ae4c6569b003eac4c5cede6ce9700f047846bf61","observation_id":"71d2ccd4-84eb-47f8-b566-dfded78279e5","resolution":{"observed_at":"2026-07-09T22:16:36.344563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-13T06:48:14.554799Z","title":"Zhang, W","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-07-31T14:59:13.878426Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T06:48:14.554799Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:9c54c4e72421fe5e9610d09cc41e34c1455b990ee50e92c78285590cd5b5a1ed","observation_id":"ec7efade-5d5f-4b4f-ae57-6a1d700fdc21","resolution":{"observed_at":"2026-07-13T06:48:14.554799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-07-31T23:29:15.579570Z","title":"arXiv preprint arXiv:2606.19531 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23969","last_updated":"2026-07-30T13:06:27Z","snapshot_observed_at":"2026-08-03T18:36:45.105550Z","submitted_at":"2026-07-27T03:36:45Z","title":"LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-31T23:29:15.579570Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.23969"},"observation_digest":"sha256:72c2e98961998f39dae6dcd93cd1ad71a1594d567a36caf84e195af40ddc09c9","observation_id":"95e3db30-fa90-42e0-8294-3544737834fb","resolution":{"observed_at":"2026-07-31T23:29:15.579570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-08-01T11:27:05.681731Z","title":"Imagewam: Do world action models really need video generation, or just image editing?arXiv preprint arXiv:2606.19531, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-03T03:05:35Z","snapshot_observed_at":"2026-08-05T14:50:24.647980Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:27:05.681731Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:760babf0e193c28c3b20209f76a63c35cd4c3fb4d1159db6344cc334ac022b87","observation_id":"671ec938-b253-4260-961e-f997e3e5d774","resolution":{"observed_at":"2026-08-01T11:27:05.681731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-08-04T03:23:44.956053Z","title":"Imagewam: Do world action models really need video generation, or just image editing?arXiv preprint arXiv:2606.19531, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-03T03:05:35Z","snapshot_observed_at":"2026-08-05T14:50:24.647980Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:44.956053Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:dd7def5ea4a279ca70baf9d60b42f89ef5d9cd3dd8b5658c3b7bd328725ea2f1","observation_id":"95b61b4f-5aed-4deb-8e15-66783e7c5618","resolution":{"observed_at":"2026-08-04T03:23:44.956053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-08-05T00:44:09.563673Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00547","last_updated":"2026-08-01T09:04:43Z","snapshot_observed_at":"2026-08-05T14:41:22.313443Z","submitted_at":"2026-08-01T09:04:43Z","title":"Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:44:09.563673Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2608.00547"},"observation_digest":"sha256:dcaa6f959809e46c9799632b8a6b8d9a446355b93b86622f21e5495007f57ffa","observation_id":"c35ee440-b94a-4d52-af34-7428fc87f338","resolution":{"observed_at":"2026-08-05T00:44:09.563673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19531","snapshot_observed_at":"2026-08-05T14:32:56.216350Z","title":"Imagewam: Do world action models really need video generation, or just image editing?arXiv preprint arXiv:2606.19531, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03701","last_updated":"2026-08-04T14:06:15Z","snapshot_observed_at":"2026-08-05T14:32:51.865502Z","submitted_at":"2026-08-04T14:06:15Z","title":"LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:32:56.216350Z"},"links":{"cited_paper":"/paper/2606.19531","citing_paper":"/paper/2608.03701"},"observation_digest":"sha256:e3fd76a6e79b3d14513da8881d08bb393df53d80985332ad61a9a02342a43191","observation_id":"edd2fef7-b7a5-4217-b62b-c4a2f1b15af5","resolution":{"observed_at":"2026-08-05T14:32:56.216350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.19531/citation-record","integrity":"/paper/2606.19531/integrity","json":"/paper/2606.19531/citation-record.json","paper":"/paper/2606.19531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:498edd138f78e479f2b4c61face15098f973d396d8cc75687cbd4c8de3b56fb3","observation_id":"bb88c99b-f26e-4f06-ac68-7f8144631f14","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:6b94cae7257bda1e5d2516aa2a0bd7235118341b4ad857228208268246caac33","observation_id":"55cf8d2c-e378-446b-aafe-a18898ff0784","resolution":{"observed_at":"2026-07-04T00:39:17.467808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:bda70f25ef134e6b28f82adc561268d41f9839a4dbf0bb7b9b35bcc8d2f99b87","observation_id":"3e5fb449-95e6-44bb-a884-981bea3df0cc","resolution":{"observed_at":"2026-07-04T00:39:17.491633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.601064Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":"fbddd7d2-e7dd-47df-8f81-fdf4dd1efdd3","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:12b807449963b132d764c7026cbc6c79764200c795827ec3d469beac9ec5da1d","observation_id":"1d603c82-7b96-4ff3-9bc8-944b3ab84c57","resolution":{"observed_at":"2026-07-04T00:39:17.484291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:517ec67a2336d937e4edf377296e565296543264ca4ab688658cb66bbdb20379","observation_id":"da15809f-ac50-4c19-88ab-a4941754f2d2","resolution":{"observed_at":"2026-07-04T00:39:17.436744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.894151Z","title":"Bagelvla: Enhancing long-horizon manipulation via interleaved vision-language-action generation.CoRR, abs/2602.09849","venue":null,"work_id":"98c513cf-3c1a-415f-8acb-d897d3fcb765","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:60d14bf79bf1d1725dbd2e6e077bed6104f7bc30038c72f8d2daf22e25ee43f1","observation_id":"8806fd25-8b79-4fb0-8f2d-fbc5721e0fef","resolution":{"observed_at":"2026-07-04T00:39:17.459384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15735","last_updated":"2026-05-18T07:08:58Z","snapshot_observed_at":"2026-08-03T17:30:39.413620Z","submitted_at":"2026-05-15T08:45:37Z","title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","version":2},"cited_work":{"arxiv_id":"2605.15735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15735","snapshot_observed_at":"2026-07-04T00:39:17.456163Z","title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","venue":"cs.CV","work_id":"0fe5eec0-a1aa-4771-97f7-34e111d5670d","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2605.15735","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:2c96c0602926ced42ca1d04de8d922e391f5304b0c12930283af75f67fda14eb","observation_id":"2fc7ab0e-a2cc-4f98-8656-9c603164ae31","resolution":{"observed_at":"2026-07-04T00:39:17.457436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11135","last_updated":"2026-04-13T07:48:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T07:48:58Z","title":"AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps","version":1},"cited_work":{"arxiv_id":"2604.11135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11135","snapshot_observed_at":"2026-07-04T04:09:35.235922Z","title":"AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps","venue":"cs.RO","work_id":"129723d3-9932-4c13-9c36-40581d143aca","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.11135","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:2aa8024a3ffebbef28bff39b12a00b77e3d82bab26db144cb391a698a64d5b75","observation_id":"8745c12b-469d-43bf-befc-56524f10daa2","resolution":{"observed_at":"2026-07-04T00:39:17.489624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:06966fd880e55d18521f2b27f3a55b972a964b7c6940981dfb1ed0154a87294b","observation_id":"3cbd8d2b-fb12-46a5-a3b1-5336238b6068","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12215","last_updated":"2026-06-03T04:04:20Z","snapshot_observed_at":"2026-08-02T23:57:43.860710Z","submitted_at":"2026-02-12T17:53:51Z","title":"LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion","version":2},"cited_work":{"arxiv_id":"2602.12215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12215","snapshot_observed_at":"2026-07-09T22:16:36.379086Z","title":"Chen et al","venue":"cs.RO","work_id":"3871a208-87bb-40c9-922d-9203ad3a857f","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.12215","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:7391e7816dba30eeaa5d53cb4e469cc1499b4062712dee631a1d8b025a76dde2","observation_id":"66749db6-7b82-4394-8ced-461f35ebfd52","resolution":{"observed_at":"2026-07-04T00:39:17.385932Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16391","last_updated":"2026-03-27T17:20:10Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-27T17:20:10Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","version":1},"cited_work":{"arxiv_id":"2604.16391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16391","snapshot_observed_at":"2026-07-04T20:10:07.734151Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","venue":"cs.RO","work_id":"20d73455-d2d9-48da-8b8d-3b669cbe9873","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.16391","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:a59f0ab5bdc5db9ebcf26d1cf193e75e3768fbe4a764ae1472b1bab805111c50","observation_id":"c2350027-27ce-45d1-a687-15dbb9000079","resolution":{"observed_at":"2026-07-04T00:39:17.374363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":"2512.13030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-07-10T04:16:48.690751Z","title":"Motus: A Unified Latent Action World Model","venue":"cs.CV","work_id":"d0b2d257-524d-4d67-9daf-5fb43e5e977a","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:1831846b8b719aa00aad5c159772447d8581fc4f23e5f10d363fa762bf7e45d2","observation_id":"57a6f44a-2bea-45f8-bdf3-5c200963474c","resolution":{"observed_at":"2026-07-04T00:39:17.374184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:3a9158d9cf1920d5fbf2ebe8b6a67856798322fc13e599dbb0e8ed49065ac6df","observation_id":"25347798-464b-4aa2-8c5a-9e67c39771b9","resolution":{"observed_at":"2026-07-04T00:39:17.345770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:43.116707Z","title":"arXiv preprint arXiv:2603.17240 , year=","venue":null,"work_id":"8736c864-7f93-4004-a1b5-06d98fb2c348","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:66a6d6e1a6c8cfb1e5323acc6612b7caad417fa95f0bec83c3a72251a9c69469","observation_id":"97fae678-9072-4b65-9a4f-26a728759995","resolution":{"observed_at":"2026-07-04T00:39:17.410662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":"2606.13515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-07-09T22:16:36.389750Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","venue":"cs.CV","work_id":"d2fcfd0e-b8cb-49cc-9b46-ff189cefd27d","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:e97756e642f3e60d365867cf8529f888750e5189843784b465223d16277d2435","observation_id":"fc6a206d-370a-47f8-8eaf-08b9c22d2e2d","resolution":{"observed_at":"2026-07-04T00:39:17.382706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.12428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:16:36.364943Z","title":"Reworld: Multi-dimensional reward modeling for embodied world models.arXiv preprint arXiv:2601.12428","venue":null,"work_id":"fc8f7d03-0228-4c1a-ab9a-05d08b51ad8d","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:68d41e2ed37121eda7dcb18f43c0bbbfb03fc4ef4f7f97cd5f831c2de5853bbc","observation_id":"5c779dd0-6daf-4f43-895b-811706055d88","resolution":{"observed_at":"2026-07-04T00:39:17.379964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.317093Z","title":"Orv: 4d occupancy-centric robot video generation","venue":null,"work_id":"ebcf2f70-fab4-4f11-ae56-45d4c39afb28","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:50e21f29380eccea7c356e2b01a24a305b98edc40c2c4e161087015212b482ed","observation_id":"4468830d-c137-4bd6-a2b7-526e744b2ea5","resolution":{"observed_at":"2026-07-04T00:39:17.318561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:147dad3c35c336990c4f2b6874a6d0d81435cb8fa20abb4965222b8ff2bd2e0c","observation_id":"8a7e792b-03f0-4fe0-ae1e-fc9c18abf86b","resolution":{"observed_at":"2026-07-04T00:39:17.407562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Scene graph disentanglement and composition for generalizable complex image generation.Advances in Neural Information Processing Systems, 37:98478–98504, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:087072d50f8dc94f4ccd61d417091a1e565bd841585fd86c4f9bf2dd1e9e4bd6","observation_id":"09a1f3a2-efba-441a-bf4d-3066a5bc7ecb","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Nano banana pro.https://deepmind.google/technologies/gemini/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:d02f626d5f59c30ee4fb1b9bfe3440876d4b19c55c612cfe1986a67f504f0fe1","observation_id":"68c14e92-5f93-4d71-89ab-50c2bed12ba4","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"GPT-Image-1.5.https://openai.com/index/new-chatgpt-images-is-here/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0878c558cb418985f9ec4620055aaa0ddc221fae47f3ca96ee7a3e61fd82ce5f","observation_id":"4f02af53-4df3-4ecf-a7f9-c2c9f8353a79","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:b96363322003a6c2b304f2a800b7c3201b8eadfa3abda0f2bf02f2790b730c0d","observation_id":"4dfacc50-3044-436e-b1a1-c696d17de981","resolution":{"observed_at":"2026-07-04T00:39:17.358514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:5dd86376b068f31172b029c9ae9b16955856030c674bd017ad9a11354346bcb8","observation_id":"d3fd09fc-a1e0-4db5-9927-11331ab8be47","resolution":{"observed_at":"2026-07-04T00:39:17.443553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Glm-image.https://huggingface.co/zai-org/GLM-Image, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ccfe84a6c73e8df689b7d151b8928674c3f9faeb4fa202beb128d65a3adaf22c","observation_id":"e5ce8f5c-1ada-4a42-af99-6ebfc034226a","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10711","last_updated":"2025-08-18T15:55:23Z","snapshot_observed_at":"2026-07-06T22:13:00.029560Z","submitted_at":"2025-08-14T14:54:22Z","title":"NextStep-1: Toward Autoregressive Image Generation with Continuous Tokens at Scale","version":2},"cited_work":{"arxiv_id":"2508.10711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10711","snapshot_observed_at":"2026-07-04T00:39:17.418338Z","title":"Nextstep-1: Toward autoregressive image generation with continuous tokens at scale","venue":null,"work_id":"729ea32c-8dd9-4636-a635-97e1ebb2dcd7","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2508.10711","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:76d562c78fbc0a068c290b7337e236faccf2c69ca1e1bae852ae61cb7020d948","observation_id":"91eb9690-007e-4ce1-8383-78c7d784bd25","resolution":{"observed_at":"2026-07-04T00:39:17.419935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.882376Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":"b02143c1-c2e9-4a92-ad39-93f93fd2eba7","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:e80a527f62ed6d2e3345cf412d84ab419b75ef916aede274ae952eadd7d69e17","observation_id":"7b80f4f7-d35e-47e2-84bf-ab3887ecc7b9","resolution":{"observed_at":"2026-07-04T00:39:17.481511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21487","last_updated":"2026-05-22T09:11:59Z","snapshot_observed_at":"2026-08-02T23:57:55.080721Z","submitted_at":"2026-05-20T17:59:42Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","version":2},"cited_work":{"arxiv_id":"2605.21487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.21487","snapshot_observed_at":"2026-07-04T00:39:17.452938Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","venue":"cs.CV","work_id":"9a3028c3-1f78-402c-9755-25635c1b1d83","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2605.21487","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:6bfc3cf49ff637bcc2c3bef042ae82868e3e8de9ca4f2ccb406973fdb0f188a2","observation_id":"c5aaa63f-f241-4dcf-89ff-08905dbda029","resolution":{"observed_at":"2026-07-04T00:39:17.454286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:9196db861230ecdba9eacdbac1eaba56add8a598a9c0f7dd307659c30ed5e6c3","observation_id":"d7782d6b-c758-40a0-8a40-0e99d0d7f834","resolution":{"observed_at":"2026-07-04T00:39:17.489219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ed6b1bbe25319d109383409ee2bf55d4ab61b9f45aaf0c7aa929954ebfd4913d","observation_id":"3b2a4355-4f7a-4393-b59d-445e17d75e08","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Guiding instruction-based image editing via multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:749323cf7a4a63635e0f5848d1e8bda1ac5e34931969c3a0540eaac0f2c585b9","observation_id":"1a9bca96-0817-4ad8-8670-8541b39e6314","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Emu edit: Precise image editing via recognition and generation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:6878dcf0f422a642119d3d06ec68e5149987fdcd5e4b83128cd5bee634424a40","observation_id":"85834bbe-24b8-4385-886f-b331ea5d66a2","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:b99d86daa88c00de71eb552015ccea22aa44bc3248d98b54beae074dd39afdc9","observation_id":"60268c47-cab4-4bd4-832b-ed8b01614dc6","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":3},"cited_work":{"arxiv_id":"2604.20329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20329","snapshot_observed_at":"2026-07-11T00:07:42.154080Z","title":"Image Generators are Generalist Vision Learners","venue":"cs.CV","work_id":"71cd4d6e-573d-4c90-8835-f18259bdbaf7","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.20329","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:6e27d905884c752f9388414dccbc33593cb6a5ef15466484822128daacafbf99","observation_id":"afc015af-0f20-46b7-b41d-27add10fb77a","resolution":{"observed_at":"2026-07-04T00:39:17.438144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24575","last_updated":"2026-04-27T15:04:13Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:04:13Z","title":"Diffusion Model as a Generalist Segmentation Learner","version":1},"cited_work":{"arxiv_id":"2604.24575","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24575","snapshot_observed_at":"2026-07-04T13:19:51.083803Z","title":"Diffusion Model as a Generalist Segmentation Learner","venue":"cs.CV","work_id":"acd17843-6b6b-4520-ad14-c2e6f9b5bbf9","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.24575","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:2b3c140aa6f774ba503a41bd1bf37d4b44af8a6f5a529189f1c2b9b7289e91bd","observation_id":"d4147ffa-7d69-4dc8-95e0-276839c1df09","resolution":{"observed_at":"2026-07-04T00:39:17.422990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05627","last_updated":"2026-07-31T13:53:20Z","snapshot_observed_at":"2026-08-05T14:34:26.896643Z","submitted_at":"2026-05-07T03:28:56Z","title":"Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping","version":2},"cited_work":{"arxiv_id":"2605.05627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05627","snapshot_observed_at":"2026-07-04T00:39:17.415466Z","title":"Leveraging Image Generators to Address Training Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping","venue":"cs.CV","work_id":"386a715c-743f-4926-a8f3-ccdaca38484f","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2605.05627","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ac8a56244c0322f4546692eb776bd04c0cf9ba93d52d270e8f952c4a399561ab","observation_id":"526d87a1-7c32-4881-a54b-ddfdd7862d4b","resolution":{"observed_at":"2026-07-04T00:39:17.416927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"pi0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:3532094ec93ed7c60893e55f43c8639d38168e382d5f4dafb456ebe3954664ce","observation_id":"0509c2cc-1de9-4542-875d-ce00f9e75795","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"pi0.5: a vision-language-action model with open-world generalization.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:469f1bcdebbacfee775964756468668cf590d0689e789f8482fe53986e85e82a","observation_id":"375cd041-792b-41f4-8889-e89e8caae296","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:06086bfabd2a1ca38cd1155c3ac7fc421797c929e8836f6722c95bdcb6df454d","observation_id":"105870cd-06ae-4c3c-9d6b-c3ca971de2ec","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Dreamvla: A vision-language-action model dreamed with comprehensive world knowledge.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:a3581539edfcbaa7f6e9133ac171a1ea503284a2f9ef29971f8578c56279027e","observation_id":"fc0dc4f3-9207-42c1-bbb4-4f0c6824d81f","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Reconvla: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:93a3d7d031910f604c102566dbd2e5175cd5943d04f2df2c4d7be8848143ee33","observation_id":"fc2f5178-863e-4215-b1f6-ba371fc13ec7","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07430","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-03T21:39:13.921814Z","submitted_at":"2026-04-08T17:59:48Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","version":1},"cited_work":{"arxiv_id":"2604.07430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07430","snapshot_observed_at":"2026-07-04T00:39:17.447258Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","venue":"cs.CV","work_id":"886be7b5-70f5-462c-a757-e44686e6e0db","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.07430","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:425fc2e25c99bff7b93c2e9c2826f6241a819f7a05e74608a997b5de39bef4f0","observation_id":"c953e55b-3a7a-43a8-aae7-6005ab8d20f8","resolution":{"observed_at":"2026-07-04T00:39:17.448929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":"2602.19710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-07-04T00:39:17.424396Z","title":"Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","venue":"cs.CV","work_id":"d2079511-72ad-42e6-ad08-78eecd103fea","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ad72251d0cbc6a1790182a9f322f1157da34694d0388821ad99e3d3da5823d14","observation_id":"db88cc04-c30a-4c28-864c-8cfed2513b62","resolution":{"observed_at":"2026-07-04T00:39:17.425754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.350063Z","title":"Depthvla: Enhancing vision-language-action models with depth-aware spatial reasoning","venue":null,"work_id":"16c300ae-4c10-4266-aa06-0541694dec38","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:b3aeccfdf47dcf187b4f163bcfbf9f68b20159149f8caf98fb9595cad8148bd7","observation_id":"4928c709-4293-4dd2-a8c9-ae42f4f9e16b","resolution":{"observed_at":"2026-07-04T00:39:17.351632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ae614510bc1fb33349edc54d135321067643bd7eb782dc9a79e9115453e2a012","observation_id":"9e20d433-8483-424e-8815-44a13802bb41","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation.ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:52ec7dd03756e09cef3e795e54294d3b94f2f5299b4b94c54c176b7b42d9ba72","observation_id":"e7488449-f3a2-412a-8bc5-3ffce10961a3","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:cd922b68ef537a6cfe5539d67baf1a301ba87a00c03a09cd5fe58790ed2f96aa","observation_id":"0c0567e8-f909-4605-aefe-da49d1e3874a","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01715","last_updated":"2026-07-01T14:29:04Z","snapshot_observed_at":"2026-08-03T19:11:41.556847Z","submitted_at":"2025-12-01T14:21:15Z","title":"Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2512.01715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.01715","snapshot_observed_at":"2026-07-04T00:39:17.495456Z","title":"arXiv preprint arXiv:2512.01715 , year=","venue":"cs.RO","work_id":"80ce27e4-5955-4d6e-ba2a-be4668d207f8","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2512.01715","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:efdcbf51b5c2f57e98568dd05b9d910b39886b8d35e8d3a3bbe4ba5063617d3a","observation_id":"8d3d711b-191d-4090-a626-c0bb205772f8","resolution":{"observed_at":"2026-07-04T00:39:17.496728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Being-h0: Vision-language-action pretraining from large-scale human videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:60c0e0b2775b94f4d39d5317f851862795f1f71251f8320bac2efa904742ea22","observation_id":"3f43bd6c-0aa9-4096-9776-af5ce84dcc5b","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01718","doi":"10.48550/arxiv.2511.01718","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unified diffusion vla: Vision-language-action model via joint discrete denoising diffusion process","venue":"arXiv (Cornell University)","work_id":"9f99a8d5-3a09-44c6-ac96-e81d09b7d387","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:18622e6ea3609fa100df076eb4ed2a2b763053368f136bdfe55217ef23785857","observation_id":"61d533a4-7712-4317-b84c-043e57ea2e73","resolution":{"observed_at":"2026-07-04T00:39:17.352756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.394965Z","title":"Spatial forcing: Implicit spatial representation alignment for vision- language-action model","venue":null,"work_id":"0de0fc11-052f-4fee-af32-850d60b54a52","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:911b1ae19ffbaaba60e3e211089ae887c9c8aa3cff4b8d36533e78414a458ade","observation_id":"ab6841ed-a7aa-46b8-889c-cd84731cb13b","resolution":{"observed_at":"2026-07-04T00:39:17.361427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.617412Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model","venue":null,"work_id":"32706181-717a-461d-87e8-271938e76e0b","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:531882373baac56dae928b1eb8f5427e7a6eec60b420205554aee1eaf7345baf","observation_id":"7304a538-edaa-4395-b132-608c61fc49b8","resolution":{"observed_at":"2026-07-04T00:39:17.494341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:b4f005b71d34fa39313bd8bb8c686a6248246618fb2156c8cfa2a1e7366fdc5f","observation_id":"d5cdf597-1f76-4d68-b72a-c0f1332bb108","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:afc2d809591e07b5bc3d36414547fab85bbdeb974468923316c8395af420957c","observation_id":"a2bb38f6-3ddc-47fa-8f33-a49eaf5c2754","resolution":{"observed_at":"2026-07-04T00:39:17.379412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:7d5b04ccd4f070cd865a3cf5dd605455051d504ff52bcdffcca3a670f9cbe066","observation_id":"69cf02e9-7140-473b-b6ba-a15b7c624c4a","resolution":{"observed_at":"2026-07-04T00:39:17.411368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:e3098b316749db176ba0c56cf6772292f65e8bc7077c37ffa9887bbb612eaa2e","observation_id":"29857894-4f8e-42cd-9a14-732efa9d282d","resolution":{"observed_at":"2026-07-04T00:39:17.372041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-04T01:13:02.026321Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":"2605.30280","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-07-10T19:47:32.615085Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","venue":"cs.RO","work_id":"88b299ef-a020-4d77-898a-de62683da6ed","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:9193d0caaa2d3d7b974498bbb5f2c5fae12e23559b17cb1a43a229807b2a20a9","observation_id":"f1f3d92f-c05d-4754-b3e8-4e56ea20eac5","resolution":{"observed_at":"2026-07-04T00:39:17.315926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.11218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.627178Z","title":"Seeing to act, prompting to specify: A bayesian factorization of vision language action policy","venue":null,"work_id":"4c99817d-080d-4aec-8b87-cc96652a45b4","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0123727507f7d5a45e582727a0166fb9c92bec8b3d960add12000bea17013d00","observation_id":"11fa9e64-fa22-4e49-a0f3-d2cc74c18463","resolution":{"observed_at":"2026-07-04T00:39:17.377234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Learning universal policies via text-guided video generation.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:847d1faf76a40525175ee0a13e47d99beb645be8e827c580625b30a59cfd35da","observation_id":"6056000c-c1ab-41ad-b785-3109ca2cd912","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Zero-shot robotic manipulation with pretrained image-editing diffusion models.arXiv preprint, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ecd8035fb79361a9e20a01cfc90e64d8800a927019353fad1722699858a07a70","observation_id":"784b60f0-9eeb-43f2-8e59-4863e28530af","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Generalist bimanual manipulation via foundation video diffusion models.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:72ca6b45612774ac7378400c0ca778b76f8602b811bc09b72ce0857ca47199ec","observation_id":"78d94391-2ea9-404c-a55d-9f6700deb43d","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Vidman: Exploiting implicit dynamics from video diffusion model for effective robot manipulation.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:52e39834cac0e6291d420885c343c01fa78603dce490c36c5c4032744634401c","observation_id":"7b5e2f14-2e13-463d-9e72-a8bf5c2c14b8","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Murphy, Chelsea Finn, and Yilun Du","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:8c14c078f167837be3d77a8a6f74c25817f682bee75984a1e39e9ee5a1cb1292","observation_id":"74fcc968-2799-4902-913c-45a3397f77dd","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"cited_work":{"arxiv_id":"2512.15840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15840","snapshot_observed_at":"2026-07-10T18:47:31.628749Z","title":"Large Video Planner Enables Generalizable Robot Control","venue":"cs.RO","work_id":"6f56b125-35ab-41da-aa0c-d118d706bf3a","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2512.15840","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:4235c5cf69de0800601f4141911a7439c9b2de5c543cca5a88669316287a0ed1","observation_id":"a78fae03-fe60-4ad9-a60c-293f8a4c3896","resolution":{"observed_at":"2026-07-04T00:39:17.321453Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Anypos: Automated task-agnostic actions for bimanual manipulation.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:1c9d8481744fb47a0b90c69019f83b3d9ec28c308c087326409c48bb010f48e3","observation_id":"00920460-fc74-4407-8332-ed14b0520ee3","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18323","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.185124Z","title":"Tc-idm: Grounding video generation for executable zero-shot robot motion","venue":null,"work_id":"555d7477-f0ff-47ca-9aa7-7e2cb1970467","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:791642a27524275440be86c7da300d8c7d554b506ee6a359a39ec5a1257275d0","observation_id":"de19a9f3-fd6e-47e8-9c07-45022c798637","resolution":{"observed_at":"2026-07-04T00:39:17.428620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Veo-act: How far can frontier video models advance generalizable robot manipulation? 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:4c3f6f3b30060e0489497de14c8173a82f111a6d6a653e958b0b13b09bd75806","observation_id":"e58da869-edcd-492c-95ea-0f9fb0fce6f7","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.19370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.565238Z","title":"V AMPO: Policy optimization for improving visual dynamics in video action models","venue":null,"work_id":"5f43b385-fdb8-4b64-b78f-6f981e2a47c6","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0fb68a6ef82714aaba1d74cd2802e6efb2e48bd8227531b760a1726b70cf6fac","observation_id":"d98d9d2e-6f0c-4044-900b-1bf18c42b8cd","resolution":{"observed_at":"2026-07-04T00:39:17.394923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22078","last_updated":"2026-07-30T02:24:57Z","snapshot_observed_at":"2026-08-02T23:16:34.942315Z","submitted_at":"2026-03-23T15:13:15Z","title":"Do World Action Models Generalize Better than VLAs? A Robustness Study","version":5},"cited_work":{"arxiv_id":"2603.22078","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.22078","snapshot_observed_at":"2026-07-09T17:56:25.571078Z","title":"Do World Action Models Generalize Better than VLAs? A Robustness Study","venue":"cs.RO","work_id":"846cc68a-6f5d-43f3-bf11-72b892dbc664","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2603.22078","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:204b86069dbdd78c848fd8ec6128aa9434940455eb39e802a7007d510e5afe09","observation_id":"fd943eb4-7439-4c96-bd18-58f8cf3a2319","resolution":{"observed_at":"2026-07-04T00:39:17.427944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19017","last_updated":"2025-05-25T07:41:39Z","snapshot_observed_at":"2026-07-06T21:30:00.261435Z","submitted_at":"2025-05-25T07:41:39Z","title":"WorldEval: World Model as Real-World Robot Policies Evaluator","version":1},"cited_work":{"arxiv_id":"2505.19017","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19017","snapshot_observed_at":"2026-07-08T19:25:32.462986Z","title":"Worldeval: World model as real-world robot policies evaluator","venue":"cs.RO","work_id":"6b78a805-660c-4db9-aaf4-f2dbf2c966e8","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2505.19017","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:dbc4617d70ddee262a793c04e6701168c3518bde844b920d5304ec43335b7719","observation_id":"3448e806-290e-4388-83ae-79aea7606673","resolution":{"observed_at":"2026-07-04T00:39:17.498204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.16669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:59:46.580151Z","title":"Kinema4d: Kinematic 4d world modeling for spatiotemporal embodied simulation, 2026","venue":null,"work_id":"6739cd73-e482-4444-8505-d7456eb572c8","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0a14682e52669343f3b0809ad48e307387008ed17fe606881dc21c98092f79ec","observation_id":"0aa67ed4-4f61-4427-9ba1-0dd92c6fa43a","resolution":{"observed_at":"2026-07-04T00:39:17.486632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0189b1b019a89c2212f77f7b392ed0f1f17e6c9fb1b3a653fa04ff52af4627ee","observation_id":"935e3104-67d5-4bb1-ae65-53764a4d2599","resolution":{"observed_at":"2026-07-04T00:39:17.433965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.12639","last_updated":"2026-04-13T08:38:18Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-03-13T04:16:19Z","title":"RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization","version":2},"cited_work":{"arxiv_id":"2603.12639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.12639","snapshot_observed_at":"2026-07-04T12:49:53.234464Z","title":"RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization","venue":"cs.CV","work_id":"cd60c4eb-7a50-43fa-bdd3-33f6ba9851a1","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2603.12639","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:509d6f9e2ed1ad5bc09ae2a3d2570dd962e9adfbc524deb0cdc9d22123724367","observation_id":"dfbbef40-6a09-4aa3-89ed-07011a2a21aa","resolution":{"observed_at":"2026-07-04T00:39:17.445163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19734","last_updated":"2026-04-21T17:57:27Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-21T17:57:27Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","version":1},"cited_work":{"arxiv_id":"2604.19734","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19734","snapshot_observed_at":"2026-07-04T00:39:17.463881Z","title":"UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling","venue":"cs.RO","work_id":"4863d8dd-bf80-4d6c-b996-5240e8eece85","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.19734","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:075b322f0868498181b4d7e8abb7ff717a8e887dc9221939685c333f21b789aa","observation_id":"4ff1ec73-74e3-4a7d-b10c-126d3e147026","resolution":{"observed_at":"2026-07-04T00:39:17.465109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.411880Z","title":"Persistent robot world models: Stabilizing multi- step rollouts via reinforcement learning.arXiv preprint arXiv:2603.25685, 2026","venue":null,"work_id":"072625d2-6271-40b5-b382-757f539216d4","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:0f78b6eef6c8d63dfd76958d6905ddd0b0dd29cdd8084b1f331566522fc54ccc","observation_id":"905869cc-0d2d-42ac-b5a1-f95b68dda1dc","resolution":{"observed_at":"2026-07-04T00:39:17.414015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.450256Z","title":"Fate: Closed-loop feasibility-aware task generation with active repair for physically grounded robotic curricula.arXiv preprint arXiv:2603.01505, 2026","venue":null,"work_id":"62104a28-8d2a-408b-b803-cda4a27727e3","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:33e41310a012abc049af7748264592b173857c33b3ef6f9b58fa08eb3aeba97a","observation_id":"de531357-d7d4-4ba2-8563-86cfc7f0f692","resolution":{"observed_at":"2026-07-04T00:39:17.451736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09330","last_updated":"2026-04-10T13:59:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T13:59:54Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","version":1},"cited_work":{"arxiv_id":"2604.09330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09330","snapshot_observed_at":"2026-07-04T04:09:35.495447Z","title":"VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis","venue":"cs.RO","work_id":"de8ef557-6536-43a9-9ae5-6afa7356bf59","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.09330","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:c6f2feff279a28846c5a26fddb3e8d578669f182c4834958ba971b2b22402b21","observation_id":"0f438a2f-b26c-4524-8e23-1d02b2425c4a","resolution":{"observed_at":"2026-07-04T00:39:17.456675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.586020Z","title":"Interactive world simulator for robot policy training and evaluation","venue":null,"work_id":"8a2a3980-472f-4433-ac4a-ebdc041ba8e8","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:66cbbbf60e4343d5ffeb65faa59c03f243ca5d94cab21ff1b2a999dcbcee51fb","observation_id":"c7a70452-d578-409e-a32a-a9c6d08002a6","resolution":{"observed_at":"2026-07-04T00:39:17.451543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01985","last_updated":"2026-05-29T16:27:50Z","snapshot_observed_at":"2026-07-13T14:05:19.455452Z","submitted_at":"2026-04-02T12:48:36Z","title":"World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry","version":2},"cited_work":{"arxiv_id":"2604.01985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.01985","snapshot_observed_at":"2026-07-09T17:56:25.541393Z","title":"World action verifier: Self-improving world models via forward-inverse asymmetry","venue":"cs.LG","work_id":"fbd30b12-d49a-4e1a-b932-9308c10e83ae","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.01985","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:74abf106fc0752e0e39a5b9b099c3c27463d91ee46a2c3f90aa658a250c18ec7","observation_id":"57c7b703-25db-4956-9d2c-87d108d8d84e","resolution":{"observed_at":"2026-07-04T00:39:17.462991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14732","last_updated":"2026-04-19T07:53:54Z","snapshot_observed_at":"2026-07-06T23:02:27.141640Z","submitted_at":"2026-04-16T07:46:05Z","title":"World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems","version":2},"cited_work":{"arxiv_id":"2604.14732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14732","snapshot_observed_at":"2026-07-08T13:14:53.175173Z","title":"World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems","venue":"cs.RO","work_id":"6827cc88-fe2b-43fa-800a-0a5d58930504","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2604.14732","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:5b495e7dc1984b0a9be8424517f2e8a6954a2ee45b263e8d9a0dee7a283f03cc","observation_id":"e6c788ca-136a-4193-a8b3-8ecb38839b1b","resolution":{"observed_at":"2026-07-04T00:39:17.470339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:1d9bc21c55d6043fe6e408bef17d55a23fffe7b0154beeca98df6493bbcbe893","observation_id":"bbbb3e9b-cda3-43ae-a63d-5bd3d44b3f2b","resolution":{"observed_at":"2026-07-04T00:39:17.499177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"dworldeval: Scalable robotic policy evaluation via discrete diffusion world model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:a5f5b370ffd585ac01d557921e7ec60c0ce30ed0544c153ecf89a22cb39ed800","observation_id":"2251de90-0eb7-4782-8ab7-a819a181c546","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Interactive world simulator for robot policy training and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:b2aa863916e449916af3068788fd9bffc029f69b994a614cc65c328a4e2d9a34","observation_id":"68440a13-9d8c-410b-9de8-5c82605775cf","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ad12da3b4873f3d35c787eb91acc3959c81da6339748429038e56a4bbc95359d","observation_id":"e537418e-723c-4118-8f8f-2c213335ddbe","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:ac2e7a365dfe2e77fa557e4947327ba2363c76afc87dc040e70ee5da32f28020","observation_id":"891ebd45-3d91-4e59-b077-7546724672b3","resolution":{"observed_at":"2026-07-04T00:39:17.503977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:3b854e3d4864e476eed60f279b7f067f080dd88b5ef4772f6a09c41a917ddc90","observation_id":"db9e670c-aa8c-4e7f-9acc-74fd93acba5c","resolution":{"observed_at":"2026-07-04T00:39:17.425424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-07-06T21:49:13.509342Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"cited_work":{"arxiv_id":"2506.23044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23044","snapshot_observed_at":"2026-07-05T16:51:14.255860Z","title":"Ovis-u1 technical report","venue":"cs.CV","work_id":"1c86f77c-ccaa-442a-a1a1-951ddd663c61","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.23044","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:63ccd6bc75d06b9c722c88e549d04cd5a41532aff95e10cc75fc90b05deb1818","observation_id":"86578b31-29d0-469b-b3f0-e0c6be404263","resolution":{"observed_at":"2026-07-04T00:39:17.483974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"FLUX.2: Frontier Visual Intelligence.https://bfl.ai/blog/flux-2, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:3cc6b9433dd75358361c16235994a84190c64184121f71f6a366838cc5d0bec0","observation_id":"6daf48e1-c49d-4601-b795-4e10bd1bd6ae","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.arXiv preprint, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:caea122e02c65a0d6120a8b85cd8a15808ddc7b4e33b15aed88f4b0820696383","observation_id":"f66e74c9-5128-42bb-a262-ac921091081c","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":"2510.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-07-10T12:47:05.553101Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","venue":"cs.RO","work_id":"e35c8c6d-977d-4af1-963a-766ba98703ce","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:82a6d44a8aa404e343eba1a218dc26e723ea53e203379815297672edcbedd55c","observation_id":"fcbcddc8-c2a0-40b7-84c6-e42809dcef7b","resolution":{"observed_at":"2026-07-04T00:39:17.501582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:a143c5a7e6c31ca78500b692a6a717678fa884a9323ac55e619b9d695a7d4a08","observation_id":"bb81c9a5-2dbb-4999-bd92-34e297a3d90a","resolution":{"observed_at":"2026-07-04T00:39:17.478920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":"2602.11236","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-08T07:14:45.378913Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","venue":"cs.CV","work_id":"30745958-0491-4e57-a989-e53b1a7fe19f","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:aa3e11eccafb81f3e5c1401ea8704db35e5b28a21e828ea74bb1fa8f2b54258c","observation_id":"7bd0c31e-2336-4fc0-a92b-09e08f8e7897","resolution":{"observed_at":"2026-07-04T00:39:17.476110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:8b2bce8a2f5adb6e630b255f9731b6e3026e20b4d10b2e77252e4192946ed081","observation_id":"358e5826-1b6d-4992-a9c2-c95f290d10b8","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"LIBERO: benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:71abed9b9e1939d875ffc9440a1c8c339324c47e5a92cec7b9a40a260bc82f5a","observation_id":"9f6d3ece-d196-458e-bb2b-9f30247be5bd","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Univla: Learning to act anywhere with task-centric latent actions.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:5fac7db53c8b3284a3734d476621a9e4fce8af3e142540e2bbbf392d10cc8ddf","observation_id":"9661e013-9c30-4787-b8ba-c16769e88032","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:6c5c39c60ea2a064c9c9516ed8f77659862793127eb94377b0eb75434b17bbd5","observation_id":"6df536dd-5ba4-4a2e-860b-8f92479e53a7","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:dfa32d49e0483084411c2387e8a0d0491d3eba93c1274be20a0304a00211d816","observation_id":"f6a9cb63-31cb-4abd-b7ca-7bf46aea9909","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:398945f11ec4c3fe53bc278b1d4229a1f1e435e71f91882d71c57f536a27e353","observation_id":"fb9c0662-b8c2-4117-9d68-c1dc0dfaf584","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19850","last_updated":"2025-06-24T17:59:57Z","snapshot_observed_at":"2026-08-04T07:40:05.703158Z","submitted_at":"2025-06-24T17:59:57Z","title":"Unified Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":"2506.19850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.19850","snapshot_observed_at":"2026-07-10T04:16:48.663138Z","title":"Unified vision-language-action model.arXiv preprint arXiv:2506.19850","venue":"cs.CV","work_id":"20c50f3e-aa1b-4b17-b04a-9432249085cd","year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2506.19850","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:9d6bb340cd38d79c9e7ec9442dbf4b9bd7da9015805e8d63167439f05fd96b51","observation_id":"c25c564c-8273-4211-9a7e-a372c55ad769","resolution":{"observed_at":"2026-07-04T00:39:17.478757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:02:24.792139Z","title":"Representationalignmentforgeneration: Trainingdiffusiontransformersiseasierthanyouthink","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:745ddc66e6ce5ef650e0ff1881763a1ecad07a8f7b9f3a9da64885b2cb619c2d","observation_id":"e1f2d5fa-4b5a-461b-9c8a-c65358a4e9a2","resolution":{"observed_at":"2026-06-26T21:02:24.792139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":39,"verified_exact":57,"verified_fuzzy":0},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 9 inbound Pith citation observations for arXiv:2606.19531."}