{"as_of":"2026-08-05T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a313fc80ba5cb89c8fb1a66d96f4fb1c5d8cbc81a134a21b8061314d232dd08","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T06:55:53.760595Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:23:47.997711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:16:36.389750Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":"2606.13515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-07-09T22:16:36.389750Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","venue":"cs.CV","work_id":"d2fcfd0e-b8cb-49cc-9b46-ff189cefd27d","year":2026},"citing_paper":{"arxiv_id":"2606.19531","last_updated":"2026-06-17T19:25:28Z","snapshot_observed_at":"2026-07-06T23:54:51.451358Z","submitted_at":"2026-06-17T19:25:28Z","title":"ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T21:02:24.792139Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2606.19531"},"observation_digest":"sha256:e97756e642f3e60d365867cf8529f888750e5189843784b465223d16277d2435","observation_id":"fc6a206d-370a-47f8-8eaf-08b9c22d2e2d","resolution":{"observed_at":"2026-07-04T00:39:17.382706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":"2606.13515","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-07-09T22:16:36.389750Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","venue":"cs.CV","work_id":"d2fcfd0e-b8cb-49cc-9b46-ff189cefd27d","year":2026},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-07-31T14:59:13.878426Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T22:16:31.529359Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:94927a687eaec1f535bbb233f561f2c1a91898cb6d0973cf55bcb598c7197cfe","observation_id":"52c4186d-e49b-443f-aed4-58f60cdf057e","resolution":{"observed_at":"2026-07-09T22:16:36.391030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-07-13T06:48:14.554799Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-07-31T14:59:13.878426Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T06:48:14.554799Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:dcc23f34df1fdf96c8cf7d9218ae72ae11fb2367d473a45630d2ee464167b99c","observation_id":"353c7a26-527d-41ce-9909-9322f610238a","resolution":{"observed_at":"2026-07-13T06:48:14.554799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-01T01:11:13.569491Z","title":"Yuan, T.; Dong, Z.; Liu, Y.; and Zhao, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25918","last_updated":"2026-07-28T16:08:50Z","snapshot_observed_at":"2026-08-02T17:47:26.215370Z","submitted_at":"2026-07-28T16:08:50Z","title":"DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T01:11:13.569491Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.25918"},"observation_digest":"sha256:aa3daa51f209d67852c2cf2045d315a9c5a8ed154b8a15160639d5d0d3d50af8","observation_id":"7e1e5aeb-e2b5-440a-a5cf-0671109db37b","resolution":{"observed_at":"2026-08-01T01:11:13.569491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-01T11:27:05.799304Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models.arXiv preprint arXiv:2606.13515, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-03T03:05:35Z","snapshot_observed_at":"2026-08-05T12:42:27.381048Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:27:05.799304Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:716326ac4f97381f1ecbe15126513abed09cb23489735a18ee02303df4fd11f0","observation_id":"59ddcd4f-cb92-44c3-bc60-21170645685b","resolution":{"observed_at":"2026-08-01T11:27:05.799304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-04T03:23:47.997711Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models.arXiv preprint arXiv:2606.13515, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26657","last_updated":"2026-08-03T03:05:35Z","snapshot_observed_at":"2026-08-05T12:42:27.381048Z","submitted_at":"2026-07-29T09:17:33Z","title":"Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T03:23:47.997711Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.26657"},"observation_digest":"sha256:b41382a6b647d09933d6899ecda919632efed23d4686c60a7d2a49534ea7d4a0","observation_id":"00e891fe-26a8-4d63-9025-5e753132fdd1","resolution":{"observed_at":"2026-08-04T03:23:47.997711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-03T15:49:34.013520Z","title":"arXiv preprint arXiv:2606.13515 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28993","last_updated":"2026-07-31T03:44:56Z","snapshot_observed_at":"2026-08-05T13:13:00.665495Z","submitted_at":"2026-07-31T03:44:56Z","title":"ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T15:49:34.013520Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2607.28993"},"observation_digest":"sha256:fe11f517d2d0e77ea5148873cfa67183b7899331a094bd8d3a3e9d21a08dc840","observation_id":"7c83ccbb-0a5b-4667-92bf-b7b875d07856","resolution":{"observed_at":"2026-08-03T15:49:34.013520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.13515/citation-record","integrity":"/paper/2606.13515/integrity","json":"/paper/2606.13515/citation-record.json","paper":"/paper/2606.13515"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:ed9b2b8bf3b1fa8f9cd1269e84f81b7fc7c566f33053860e00dd9b5a2a165bdd","observation_id":"0ef878e4-4015-4b38-ab3b-8392410e3685","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2409.16283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16283","snapshot_observed_at":"2026-07-10T23:07:47.692433Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","venue":"cs.RO","work_id":"a3bde288-aace-40db-8067-3ae6656f9509","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2409.16283","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:33589a6ecdec2fd9254e98208851c0916a8d7e0fef8e0deac286a5ea7d07a468","observation_id":"62632859-50c4-46c8-a9a4-a012ea57daeb","resolution":{"observed_at":"2026-07-03T14:48:32.776438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:5c2edc87cff95d32712330187f848c9f9b9c5b9b29f92b70a737aa86a938456e","observation_id":"2baca82f-68ff-4221-aee3-b16c43be7bab","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Motus: A unified latent action world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:43e71d3ecb124143c9f3e47f394f7067d6d885abc350f8d7850ff9ef93023e64","observation_id":"c6954900-03d1-4037-933a-6d348024c767","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:b4a970a32ff049525da4809949ceecece44727a6c1ea4b60a61022275aa4e859","observation_id":"b7c4cbfd-d64c-4699-bbbc-432fb21dfafa","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:eed7ae63ca70962b6d528d4ffc9fa06c83e7ac6cca8a8bc9af8968921cac2d14","observation_id":"a9671f4d-5362-4e68-86be-5c07bcb55fe6","resolution":{"observed_at":"2026-07-03T14:48:32.808722Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:4dab3d9fd7231fad7fee8f7ad8a9fd2ea8a1e93c32f3f3976ad6d5f4d9e8ea09","observation_id":"b1c01647-054c-45b3-b7b9-c7cd281b73bb","resolution":{"observed_at":"2026-07-03T14:48:32.835026Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:720cb67748b63efdbe9a84f509d4ceb40ad9a3c3fc980ec5d8f7c2e477d1a613","observation_id":"eda8f390-75e2-46c6-9e49-4bf52d52c1cb","resolution":{"observed_at":"2026-07-03T14:48:32.790570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-08-03T20:59:48.866420Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":"2511.17502","doi":"10.48550/arxiv.2511.17502","metadata_source":"pith","pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":"cs.RO","work_id":"f28355c2-726f-4492-899f-be74df2c09cd","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:510b98e4e5cda56255e89a4e7502e6a986bfe933abe6b4a332a88aeef13ab10f","observation_id":"35ea5501-a3d7-4205-b1a2-b5043ee776ff","resolution":{"observed_at":"2026-07-03T14:48:32.839921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Worldvla: Towards autoregressive action model with world knowledge.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:72e168924cde55cd38788662e6e9bf5f3bbd35dbb053e160d676b76754f75c9c","observation_id":"06f20129-1aa3-4900-be49-7b25b6c79678","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2410.06158","doi":"10.48550/arxiv.2410.06158","metadata_source":"pith","pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","venue":"cs.RO","work_id":"843ab5eb-2815-4db8-b3bc-890b23fa5ffa","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:e9e118a5edad93b29a6b7d1aba3d91d67a35c516203e6b27f081e4407d8bbf86","observation_id":"dcf9b0ac-d4eb-4b17-b971-811e024b1a21","resolution":{"observed_at":"2026-07-03T14:48:32.853298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T23:23:05.602157+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:c00c6e19babfe58c08ddf88a91799c68cac81998cdd40fdcba6a969d84c37068","observation_id":"bde575de-2795-4e93-964b-3ff137efb37f","resolution":{"observed_at":"2026-07-03T14:48:32.837659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00111","last_updated":"2023-11-20T05:38:13Z","snapshot_observed_at":"2026-08-05T03:52:37.401772Z","submitted_at":"2023-01-31T21:28:13Z","title":"Learning Universal Policies via Text-Guided Video Generation","version":3},"cited_work":{"arxiv_id":"2302.00111","doi":"10.48550/arxiv.2302.00111","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B., Schuurmans, D., and Abbeel, P","venue":"arXiv (Cornell University)","work_id":"d5eed546-aec4-42e8-8e69-fa3e41cc741a","year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2302.00111","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:3d13dbf75ee458a673b5df6c45da8f1e1e40666533580c8552e7059d4081e4ec","observation_id":"3e5861dc-ecca-40a2-a6b2-008152697a0f","resolution":{"observed_at":"2026-07-03T14:48:32.861585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12898","last_updated":"2025-12-20T02:16:12Z","snapshot_observed_at":"2026-07-30T09:36:32.113048Z","submitted_at":"2025-07-17T08:31:55Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","version":4},"cited_work":{"arxiv_id":"2507.12898","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.12898","snapshot_observed_at":"2026-07-04T04:29:34.771221Z","title":"Vidar: Embodied Video Diffusion Model for Generalist Manipulation","venue":"cs.LG","work_id":"27ba4477-458b-442f-bbd1-17d207004d56","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2507.12898","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:d80f7e0c9cd1595a7d43cb413ca4bd8d6e9acbc04c02d5ce402169c3f1f57640","observation_id":"557305d0-2f96-4f16-b0eb-97e7eb89e3eb","resolution":{"observed_at":"2026-07-03T14:48:32.789995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Rt-trajectory: Robotic task generalization via hindsight trajectory sketches, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:8f6fd5aa3055b8daa5f8e378a6ea48d09f1abfda0f7770414b2c12fae928852e","observation_id":"82781542-4b18-4e5c-bda1-af2d38814604","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20391","last_updated":"2025-02-27T18:59:18Z","snapshot_observed_at":"2026-08-04T07:20:18.038554Z","submitted_at":"2025-02-27T18:59:18Z","title":"Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2502.20391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20391","snapshot_observed_at":"2026-07-10T18:47:31.653765Z","title":"Point policy: Unifying observations and actions with key points for robot manipulation","venue":"cs.RO","work_id":"c7bb66c8-0ed5-4673-a7c5-d82216e8d36e","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2502.20391","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:a19baed8caac5caef16ea557c839f4d68745c58c015e9216ed25cef3e7a2e80d","observation_id":"88fe2297-96d9-4f80-abd5-7ad075120542","resolution":{"observed_at":"2026-07-03T14:48:32.858643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Spot: Se (3) pose trajectory diffusion for object-centric manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:78d5c2e67b654041efb7df3875ed455116b13d6341a117357337a85a9cf490c6","observation_id":"fd9bc1df-e626-4ad1-a0d9-abce5ed54223","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":"2412.14803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-07-10T12:47:05.518340Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","venue":"cs.CV","work_id":"62dbe235-8473-4190-8686-17e7437de50f","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:be5dd1d19bd8e006da3af4f3124653ac251ed5cf89d6f0eecb9ba98cb3ac5e78","observation_id":"5ec2dbbc-d991-41ec-926e-3e8b5b533aed","resolution":{"observed_at":"2026-07-03T14:48:32.840658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Roboground: Robotic manipulation with grounded vision-language priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:0d7ddc5c985011c4590e1affd683ecc9978b7dcc4794d74b503417f6bba4ff47","observation_id":"257cc779-9244-4790-acf0-fa65057e9ae4","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01652","last_updated":"2024-11-12T04:33:26Z","snapshot_observed_at":"2026-07-29T23:37:00.228879Z","submitted_at":"2024-09-03T06:45:22Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2409.01652","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01652","snapshot_observed_at":"2026-07-04T16:39:58.441681Z","title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","venue":"cs.RO","work_id":"c1f87e33-d716-44b5-ba00-98d693e65745","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2409.01652","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:bd5fdaad353588cb89d648f784c54ffce3edb5d833e963a82962b86b36b6d866","observation_id":"96c786c4-e0e6-471d-b014-af5e5eadc024","resolution":{"observed_at":"2026-07-03T14:48:32.799999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":"2505.12705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-07-10T12:47:05.582841Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","venue":"cs.RO","work_id":"8f44bbac-2812-4198-83bb-f6c857664a1d","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:ee6c8d59a7cf1f286ff9b84d09b4076cef5dd3ff66e6f8355c20ebad5641755e","observation_id":"506b6d6b-7b09-4ab5-857c-93d06d2ea19b","resolution":{"observed_at":"2026-07-03T14:48:32.871031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Robo-abc: Affordance generalization beyond categories via semantic correspondence for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:38e75a3a49cfe2c1bedb75c219d542320a4eb0c6bfbcab59c8698b0153676155","observation_id":"677e8e10-4c45-4e43-b51e-e5d9627ea60c","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":"2601.16163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-10T18:47:31.583000Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","venue":"cs.AI","work_id":"3d63039f-41b0-4a31-af31-6fc10f5c1b1b","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:16edd2ffc2b0fb1befdfce06d71ef2a8228fa30c216af0e0c314e2c8bb23adc4","observation_id":"b481fdee-2b71-47ee-8af6-cbd0b9d1ab9e","resolution":{"observed_at":"2026-07-03T14:48:32.866010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:4144747e35f971de411255653c25e59a9ab02de0c81e08a18776d800b19097e8","observation_id":"e30b5a95-79ea-4450-8be4-ba986e49bcf3","resolution":{"observed_at":"2026-07-03T14:48:32.861030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:7a8fc34903b7c4a8d797363388c03302c6e11f1bae63f9d79093c69e6bb9e0cb","observation_id":"efcee695-882a-44ea-9e78-c97f1102fa99","resolution":{"observed_at":"2026-07-03T14:48:32.842258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16211","last_updated":"2025-06-19T10:59:53Z","snapshot_observed_at":"2026-07-06T21:44:42.748650Z","submitted_at":"2025-06-19T10:59:53Z","title":"ControlVLA: Few-shot Object-centric Adaptation for Pre-trained Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2506.16211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16211","snapshot_observed_at":"2026-07-04T03:29:30.514537Z","title":"Controlvla: Few-shot object-centric adap- tation for pre-trained vision-language-action models","venue":null,"work_id":"92b04a32-ea80-430b-a101-29f1986509cf","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2506.16211","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:d0f81dcc3b66eaa19ba3820d743e77960d793d70ac5a0c63d4743765d05e8ce0","observation_id":"27e3a5be-f2fb-4e2c-aae8-907fc7f80c20","resolution":{"observed_at":"2026-07-03T14:48:32.825517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00795","last_updated":"2025-08-01T17:23:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-01T17:23:49Z","title":"Video Generators are Robot Policies","version":1},"cited_work":{"arxiv_id":"2508.00795","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.00795","snapshot_observed_at":"2026-07-10T12:47:05.545575Z","title":"Video Generators are Robot Policies","venue":"cs.RO","work_id":"0941f8fe-e893-4e3a-9ac6-0a72f26340e9","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2508.00795","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:96ea31d8568f937082fe690a3908dc5dcd75cd799be826cbb51f55b58ec333d6","observation_id":"893f6c00-759c-462a-b33f-bcb2aa11e45c","resolution":{"observed_at":"2026-07-03T14:48:32.858750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":"2411.04996","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-07-04T11:59:50.940046Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","venue":"cs.CL","work_id":"82eb1f7e-d598-409b-9fec-8a7e82965d26","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:4938f89b260b5f59f20b8fe7f7b53c68eee3519a06015ff43cbe0f365af792ed","observation_id":"dac770c4-9af0-4010-9b08-355be8a0b9eb","resolution":{"observed_at":"2026-07-03T14:48:32.850863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:37848335ff6c5be27faa7c10c30325e7bb7807bf23aa16ed5a1ce9d986cbcaea","observation_id":"d15a86f7-447f-43aa-b434-c77e1eeeddb7","resolution":{"observed_at":"2026-07-03T14:48:32.873069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"cited_work":{"arxiv_id":"2602.19710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.19710","snapshot_observed_at":"2026-07-04T00:39:17.424396Z","title":"Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","venue":"cs.CV","work_id":"d2079511-72ad-42e6-ad08-78eecd103fea","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2602.19710","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:22636879513b40abefd799563d1567a3b5f0ecc7129b0001f4591e2f9f6cee22","observation_id":"14adc3dd-c331-4945-844f-7b8981d089e0","resolution":{"observed_at":"2026-07-03T14:48:32.870836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776– 44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:8775c5bc5928c4b561be26e8f7f35b37d8402139254e41408c47098b484e43b7","observation_id":"562d7fb7-7ad7-4889-9eb6-7b97b261f992","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:3a87899f6de15473817b154c429d4161f40d57f2be3885335c1b236e6e4f1a1f","observation_id":"f567c644-6c7a-4cd8-aa53-7b55fd10ee8a","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03174","last_updated":"2024-09-04T01:18:13Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:08:45Z","title":"MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting","version":3},"cited_work":{"arxiv_id":"2403.03174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03174","snapshot_observed_at":"2026-07-04T20:00:08.785405Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":"ccf8b831-22b2-4f5c-96aa-bb23e62673c0","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2403.03174","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:8711b14f4f25af45c263e7183fadcdada954cbf3554556f7b9943a652f77800b","observation_id":"dfea2e90-9106-4adb-bd0f-5df94bc1766b","resolution":{"observed_at":"2026-07-03T14:48:32.868635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:90004f89ba0093367c36d3987c6abd2ad62865fb86bf7e73b6c0eedd40ea5690","observation_id":"43635b95-30b0-428b-bf07-11f06e418a87","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"cited_work":{"arxiv_id":"2604.19683","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19683","snapshot_observed_at":"2026-07-04T04:09:35.388712Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","venue":"cs.RO","work_id":"327c0f01-34b0-4835-856d-46306a87d75e","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2604.19683","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:15def95bc7831ff2b9ff16d413e2b65a84c42bf92aa6f8d174ea8f2bf86d4fa4","observation_id":"c6c961d5-c2e2-43e6-a244-74c026ed50ad","resolution":{"observed_at":"2026-07-03T14:48:32.819957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:47:31.601064Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":"fbddd7d2-e7dd-47df-8f81-fdf4dd1efdd3","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:51f17250772d748fa8d9512efbcd2d6cdd975029475eacf239386c03b144c7fe","observation_id":"250a5740-2610-4e78-b91c-3ed41c135a8d","resolution":{"observed_at":"2026-07-03T14:48:32.827083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Grounded human-object interaction hotspots from video","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:c32ace8f55f98cdc5123a30f529632aa51607687ac585f60e3fcdfa45932cc75","observation_id":"5deda1b6-ab54-4a5d-8ba7-d94412783cea","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:bdd8a70a7a18078c9ef9c6ae3ff3d6e9a92f7baf496f9bc4e5a6ee840788229a","observation_id":"75a4e62e-30e9-4904-8b53-631050a96a97","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15692","last_updated":"2025-12-19T18:30:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:47:31Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","version":2},"cited_work":{"arxiv_id":"2512.15692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15692","snapshot_observed_at":"2026-07-10T23:07:47.631138Z","title":"mimic-video: Video-Action Models for Generalizable Robot Control Beyond VLAs","venue":"cs.RO","work_id":"cd5b191a-8f67-43d3-8816-0ade1b9a7c29","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2512.15692","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:1fbdb14dd951840088d8faf72b12bed879c860ae5db2113a2a529ce472f68059","observation_id":"daca30db-0550-4d47-9c88-00fc623151ae","resolution":{"observed_at":"2026-07-03T14:48:32.827879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Qwen3-vl: A frontier multimodal large language model.https://github.com/QwenLM/Qwen3-VL,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:78098f4b42fd49d3086e6fe9485e4ba887af141aa83c23d524da2d9a182c754f","observation_id":"022ce25f-4564-4a88-8249-82821eeb49f3","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:6e5c6ac4273c2ec4b6a238d570d3c22f228825ffebb313066776f6984acefd81","observation_id":"445993a4-7872-44a2-8c84-05a49789cbc0","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:6b3c360dc0c913d29c966d37b8ec190082c6df0e302c31965380b1337c62ce81","observation_id":"8e44d8b1-5e5d-4223-a3c0-9bc99e23ca1f","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Open-world object manipulation using pre-trained vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:c85a502df52c0fb817292a03dfb5fe8352317982928a194f72a183684d5b4063","observation_id":"e5d56b44-41ec-4490-9675-159f5d6fcc06","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.617412Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model","venue":null,"work_id":"32706181-717a-461d-87e8-271938e76e0b","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:515a54a9b46e40d75baf26863e856796c2d573419309dfd1da6920e78669172b","observation_id":"d81bf1e9-63ab-4ad9-bf55-e0e967c36678","resolution":{"observed_at":"2026-07-03T14:48:32.788136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Kite: Keypoint-conditioned policies for semantic manipulation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:2f02559836853fa1832b7a8cdd72be4460c4f2e664773a2f8a81a391b8d01d22","observation_id":"4b5b82ee-50fc-4ca1-aaf6-b4b515283be0","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07430","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-03T21:39:13.921814Z","submitted_at":"2026-04-08T17:59:48Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","version":1},"cited_work":{"arxiv_id":"2604.07430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07430","snapshot_observed_at":"2026-07-04T00:39:17.447258Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","venue":"cs.CV","work_id":"886be7b5-70f5-462c-a757-e44686e6e0db","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2604.07430","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:c8e4df10e8adb50061788e67f52f1b67d0acc0bf512096be63fb8853a828d6f0","observation_id":"285ef188-316e-488b-b048-fbf49b5a0036","resolution":{"observed_at":"2026-07-03T14:48:32.809991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:d47d94c34d02350ec6223c187380350b41d6afd1b3f39aa234f07c9413e3219e","observation_id":"0f8d9421-7089-45bf-80c7-7ba47a2ad175","resolution":{"observed_at":"2026-07-03T14:48:32.782125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:3e29778c23e37c5b616835b681ddba8a8e54bf3ff18d2889fc9a44ef0174cf35","observation_id":"6eb4a742-426d-4c2f-85c9-60e33cf669e2","resolution":{"observed_at":"2026-07-03T14:48:32.868536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14400","last_updated":"2025-07-02T08:26:20Z","snapshot_observed_at":"2026-07-06T20:25:31.304367Z","submitted_at":"2025-01-24T11:11:53Z","title":"SKIL: Semantic Keypoint Imitation Learning for Generalizable Data-efficient Manipulation","version":2},"cited_work":{"arxiv_id":"2501.14400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14400","snapshot_observed_at":"2026-07-04T16:39:58.427257Z","title":"arXiv preprint arXiv:2501.14400 , year=","venue":null,"work_id":"05fec494-441b-41fc-a284-b1068c15836d","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2501.14400","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:0bbb62583d6c3bb2c36add09fc75d6677e21e4b17f0708ba1b13d992b7358838","observation_id":"58fcc746-8cbd-4179-9933-ba321a8a2eba","resolution":{"observed_at":"2026-07-03T14:48:32.863620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":"2401.00025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-07-10T18:47:31.639635Z","title":"Any-point Trajectory Modeling for Policy Learning","venue":"cs.RO","work_id":"0c843c6a-ce05-4ca4-992b-e25516f490db","year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:2d58bbdb11b008df8dc8ab978ef5c5c12a2367abc48888e2094e6914d95bfa18","observation_id":"eec8e05b-a71a-45ad-8576-61ad39230792","resolution":{"observed_at":"2026-07-03T14:48:32.832756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27607","last_updated":"2026-05-28T05:41:27Z","snapshot_observed_at":"2026-08-04T07:00:43.894238Z","submitted_at":"2025-10-31T16:32:12Z","title":"Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2510.27607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27607","snapshot_observed_at":"2026-07-04T04:09:35.372388Z","title":"Dual- stream diffusion for world-model augmented vision-language-action model","venue":"cs.CV","work_id":"e8792d80-9c1e-4763-a385-5268dd1c1694","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2510.27607","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:c5a842e7288fc95d2bb6f479e8950e082cfab58940c41ca1ac5dadca57c1e346","observation_id":"cc3bc517-242b-425e-b212-a123e059d14d","resolution":{"observed_at":"2026-07-03T14:48:32.842966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:ba4b9ae7a0e7574f00e668199bda3eba46b9b60e2cb0f2026e2a95c4da44a281","observation_id":"af4f495d-70c4-4e82-b184-ee5e2723eb8e","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:852e1b91efebf0a0e23e10c56b68bcf0a9e3fea48ae5f2182e89672c6e9780cc","observation_id":"d975eeef-af77-4901-a240-ed919ae4274d","resolution":{"observed_at":"2026-07-03T14:48:32.837942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-07-06T18:49:42.663028Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":"2407.15208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-07-10T18:47:31.575403Z","title":"Flow as the cross-domain manipulation interface","venue":"cs.RO","work_id":"40196361-5c47-4912-87a6-0e600288d197","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:591442dfe09f6387704cb88920fe406dc386c41a2401eb2396a17baa382cab55","observation_id":"908655ab-ed7b-43bc-95e1-c5ef6bca66ab","resolution":{"observed_at":"2026-07-03T14:48:32.848415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Flow as the cross-domain manipulation interface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:6b03bab37c9a1428c6142d2d29636a916e44dd2ad1504c920c92d3379031e075","observation_id":"7bab5752-2c10-486f-bdb9-3c04350f6bf3","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:d1f08b8bee3d9d7f6d8f9dfae9545e342506181129473d3bd2dd6587d5e2e73c","observation_id":"b3148b1b-39b5-4538-abec-6dd0d846e124","resolution":{"observed_at":"2026-07-03T14:48:32.812375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:48:32.854377Z","title":"Point what you mean: Visually grounded instruction policy","venue":null,"work_id":"743162b0-2d8c-4c05-b372-b2af9d2db447","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:f572c4405511d6afacd225a9582eb5dfb6452044a25bd3cbeabaf125e21c1b1f","observation_id":"9a251410-2a8a-4867-8c0c-e1dab205303a","resolution":{"observed_at":"2026-07-03T14:48:32.856042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03456","last_updated":"2025-07-28T04:50:52Z","snapshot_observed_at":"2026-07-06T19:10:56.847723Z","submitted_at":"2024-09-05T12:09:02Z","title":"LM-Gaussian: Boost Sparse-view 3D Gaussian Splatting with Large Model Priors","version":3},"cited_work":{"arxiv_id":"2409.03456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03456","snapshot_observed_at":"2026-07-03T14:48:32.806118Z","title":"Lm-gaussian: Boost sparse-view 3d gaussian splatting with large model priors","venue":null,"work_id":"42b765f8-09ca-4394-9bb7-5e3d48c8bc2c","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2409.03456","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:6ed0d565b8b582d38b93b6ed76343dbf5c6cd47cc08265fba2d395ff990a1b27","observation_id":"13dd516d-c730-4cb6-8eca-7e7cd782d13f","resolution":{"observed_at":"2026-07-03T14:48:32.807608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:fe5e2ac49c17014e1b3f0a0ba48666812b58afc621b0b9d3a83bfe857dac0493","observation_id":"5420341a-6eff-46af-b91b-29567b7a7d9f","resolution":{"observed_at":"2026-07-03T14:48:32.845669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:3cac97caad8c5ddb62010fc23d9876f6895e9b531ae9895b118b5c1f9df8b60f","observation_id":"58227ffd-37e0-4898-a3bd-91655f024069","resolution":{"observed_at":"2026-07-03T14:48:32.779436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":"2507.04447","doi":"10.48550/arxiv.2507.04447","metadata_source":"pith","pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","venue":"cs.CV","work_id":"830b1108-8122-404f-a791-f926fbc48669","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:918966864f0591cb2df79c2481496bd33720e76ab0b62036b803532f065c3580","observation_id":"3c4dad22-9513-4d15-b15e-1dbd82a735cf","resolution":{"observed_at":"2026-06-27T07:00:39.873785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16391","last_updated":"2026-03-27T17:20:10Z","snapshot_observed_at":"2026-07-06T23:03:43.854612Z","submitted_at":"2026-03-27T17:20:10Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","version":1},"cited_work":{"arxiv_id":"2604.16391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16391","snapshot_observed_at":"2026-07-04T20:10:07.734151Z","title":"Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining","venue":"cs.RO","work_id":"20d73455-d2d9-48da-8b8d-3b669cbe9873","year":2026},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2604.16391","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:33efd2219986e5a4f49d74b567db52d3d962d4b77ed502b7b3f93d6dddd57740","observation_id":"fd810ebb-154a-4ed6-9bb7-12397e23dd76","resolution":{"observed_at":"2026-07-03T14:48:32.863936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:6de01f39dff884a68ee5a82f239c837b15ed97c1cf2c78f2f5d2f6e668d05011","observation_id":"482f100e-32d9-4520-a0be-2534e0f551fa","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:fdb7ebf34683ce2f76eb8de20326b615386330f501258594765992ebdf32e872","observation_id":"65e7a61e-b97c-4515-88b2-d6f86217d9dc","resolution":{"observed_at":"2026-07-03T14:48:32.866264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:55:53.760595Z","title":"Act2goal: From world model to general goal-conditioned policy, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:e60c43230354a1dbd360abea0eee6d8d63147bc020cdfbfb80b678a8902c0f8a","observation_id":"76047247-7d81-4709-b7ff-90e38df45862","resolution":{"observed_at":"2026-06-27T06:55:53.760595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-02T11:29:41.147175Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":"2404.12377","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-07-10T11:47:02.936864Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","venue":"cs.RO","work_id":"b1231baa-7c16-4ecf-a6a8-ef49d0875212","year":2024},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:208a19847e047b11cadf674ff7baca80fc01fa67cd4eebc4408cf535dcaa734c","observation_id":"afa71aa8-f3d5-44d5-a6f6-4a260acaed36","resolution":{"observed_at":"2026-07-03T14:48:32.830425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":"2504.02792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-07-10T18:47:31.709153Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","venue":"cs.RO","work_id":"c181dcf1-e774-4216-a30e-e55c3f3a766c","year":2025},"citing_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T06:55:53.760595Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2606.13515"},"observation_digest":"sha256:12344e9ab81b52e6c7b22e1598acfcaf69c6c970e6da1e79f4254a6aedddc2a7","observation_id":"7af03346-7e7d-4ecd-aad3-3221750951f9","resolution":{"observed_at":"2026-07-03T14:48:32.829469Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":22,"verified_exact":41,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 7 inbound Pith citation observations for arXiv:2606.13515."}